{"as_of":"2026-08-10T05:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bcb82885f16520bdf10ba3b7faa507cfcf521a043dd04f7e5d22b57f445db1df","coverage":[{"denominator":65,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":65,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T22:48:33.114297Z","state":"measured"},{"denominator":67,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":67,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T06:51:04.076537Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T16:02:08.886957Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04477","snapshot_observed_at":"2026-08-03T18:18:58.439629Z","title":"Near-optimal sample complexity for MDPs via anchoring","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.06244","last_updated":"2026-07-31T22:43:03Z","snapshot_observed_at":"2026-08-09T03:45:26.166178Z","submitted_at":"2025-12-06T02:04:50Z","title":"Auto-exploration for online reinforcement learning","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T18:18:58.439629Z"},"links":{"cited_paper":"/paper/2502.04477","citing_paper":"/paper/2512.06244"},"observation_digest":"sha256:2f9ece665c964dc57ea5f19c9c9286478211650f4c5b25d482c05deb505dfa33","observation_id":"57ea9f20-2673-44da-aa4a-4938303e4ca3","resolution":{"observed_at":"2026-08-03T18:18:58.439629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T16:02:08.886957Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04477","snapshot_observed_at":"2026-08-04T06:51:04.076537Z","title":"Near-optimal sample complexity for MDPs via anchoring","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.06244","last_updated":"2026-07-31T22:43:03Z","snapshot_observed_at":"2026-08-09T03:45:26.166178Z","submitted_at":"2025-12-06T02:04:50Z","title":"Auto-exploration for online reinforcement learning","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T06:51:04.076537Z"},"links":{"cited_paper":"/paper/2502.04477","citing_paper":"/paper/2512.06244"},"observation_digest":"sha256:6270de9b23f15e5b7ca470aef01a5ef5b4126f1dd73c2cf1a9896c4021dfd83e","observation_id":"fd92dba0-5cbd-4100-8480-4818740c509a","resolution":{"observed_at":"2026-08-04T06:51:04.076537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2502.04477/citation-record","integrity":"/paper/2502.04477/integrity","json":"/paper/2502.04477/citation-record.json","paper":"/paper/2502.04477"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:35.376433Z","title":null,"venue":null,"work_id":"6a1a025a-224d-4e0a-99d4-aeb166646ca5","year":2020},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T16:02:08.886957Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:31.777072Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:a9e9c59e474292bb0ab8415f2290baf960e4bc4f6ff9611a5799ac94446c477e","observation_id":"a6c0d75f-e4d1-4cff-afac-9ec6db3d2ee0","resolution":{"observed_at":"2026-08-08T22:48:35.381305Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:35.361643Z","title":null,"venue":null,"work_id":"011f7bbb-f0d9-4db7-8af5-d8cde407da4e","year":1995},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T16:02:08.886957Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:31.801994Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:35122ec9253e26c6f5d19fe805c741d38e4a377d0551173563f4cdd8ffbd5ede","observation_id":"f580cb8d-3ce7-47d6-8e4d-82c1326750de","resolution":{"observed_at":"2026-08-08T22:48:35.366170Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:35.347071Z","title":"G., Munos, R., and Kappen, H","venue":null,"work_id":"d1de315d-043e-4077-9983-c293f4c8bd80","year":2013},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T16:02:08.886957Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:31.825800Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:667d38f3a5fcd9f89ecf2225e1c8cc72c35314d7ec02f201cb36c34043986fc2","observation_id":"34ab2e25-ed2b-4733-b1cd-dac981e81cda","resolution":{"observed_at":"2026-08-08T22:48:35.351423Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:35.333136Z","title":"Weighted sums of certain dependent random variables","venue":null,"work_id":"a4ffde9c-30e2-45be-8591-4c1a9b51feae","year":1967},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T16:02:08.886957Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:31.844624Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:49bb61d89d065c5be88b3a3a4a4544bd3eba089d8ddd100649ffc54e89ed0d55","observation_id":"8132e9a9-7de1-479e-b587-902eb5ede860","resolution":{"observed_at":"2026-08-08T22:48:35.337490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:35.318434Z","title":"U., and Aggarwal, V","venue":null,"work_id":"7d871637-33e2-4b88-8f46-f19a0e98dbdd","year":2024},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T16:02:08.886957Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:31.851877Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:4064f80e9fc6380f34ad46bf80d124bd38deb81093b3bddfa471360db199d168","observation_id":"f4227128-9771-420b-a431-f092f2d1e7b8","resolution":{"observed_at":"2026-08-08T22:48:35.322700Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:35.304130Z","title":"A M arkovian decision process","venue":null,"work_id":"8df926e2-94ed-4636-8152-74fa19f35da8","year":1957},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T16:02:08.886957Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:31.856167Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:4df609b044840221548888e64cff4d64d341fd0de3a086528dfd5d9c1c349400","observation_id":"5471941a-dabe-4723-9730-56588789be6e","resolution":{"observed_at":"2026-08-08T22:48:35.308459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:35.290058Z","title":null,"venue":null,"work_id":"ace52c0a-b94d-48e1-a850-518f46d59f3e","year":2012},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T16:02:08.886957Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:31.861333Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:fb17c590e26387b6c9315536baaf6caaa17e56048b34574ccf1be8da9b90472c","observation_id":"8d9953e6-9138-49bf-bd63-e02467ea3586","resolution":{"observed_at":"2026-08-08T22:48:35.294417Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:35.276719Z","title":null,"venue":null,"work_id":"5acb2de7-0215-4ac0-9cfe-579eccc5b85d","year":1996},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T16:02:08.886957Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:31.866004Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:76fc60d285596ba742070477c89fe4904752a08c07829714970c1396260bc2cb","observation_id":"b1c8853a-bd7e-45d4-8c21-f349c5a20cf7","resolution":{"observed_at":"2026-08-08T22:48:35.281233Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.06971","last_updated":"2018-03-19T15:02:15Z","snapshot_observed_at":"2026-07-06T06:29:04.031745Z","submitted_at":"2018-03-19T15:02:15Z","title":"What Doubling Tricks Can and Can't Do for Multi-Armed Bandits","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.06971","snapshot_observed_at":"2026-08-08T22:48:31.870679Z","title":"and Kaufmann, E","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T16:02:08.886957Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:31.870679Z"},"links":{"cited_paper":"/paper/1803.06971","citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:70dbf1f2f69f23739de9971f275a42366cc34c22a6c58e2634e55b198439f2a7","observation_id":"079d0649-fff0-47fb-924c-91ab2a79dfa8","resolution":{"observed_at":"2026-08-08T22:48:31.870679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:35.257304Z","title":"Discrete dynamic programming","venue":null,"work_id":"9ba30e1a-d4e8-46d4-9af9-a5e724f459a7","year":1962},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T16:02:08.886957Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:31.875465Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:9b482e2ce72ced9c3cc6181cf1206bdecacea86d9dd50d6abd5544230f147fd5","observation_id":"ab8a314a-4571-4704-ad5e-8472e4c42875","resolution":{"observed_at":"2026-08-08T22:48:35.265306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:35.081186Z","title":null,"venue":null,"work_id":"5599ba0e-422e-489c-b3ca-9007155fc7aa","year":2023},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T16:02:08.886957Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:31.879796Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:6f749bdbd6138d0b55b255cb1ca27e21422214d0dffa96f1ac2ec5a148d63127","observation_id":"bc3369f8-5ca6-47e8-8396-7388b88bff3f","resolution":{"observed_at":"2026-08-08T22:48:35.141069Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12338","last_updated":"2025-05-09T21:02:52Z","snapshot_observed_at":"2026-07-06T17:46:42.199436Z","submitted_at":"2024-03-19T01:07:35Z","title":"Stochastic Halpern iteration in normed spaces and applications to reinforcement learning","version":4},"cited_work":{"arxiv_id":"2403.12338","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.12338","snapshot_observed_at":"2026-08-08T22:48:33.213725Z","title":"Stochastic Halpern iteration in normed spaces and applications to reinforcement learning","venue":"math.OC","work_id":"b1bbfde5-1bef-4975-b54d-fc9503639887","year":2024},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T16:02:08.886957Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:31.884881Z"},"links":{"cited_paper":"/paper/2403.12338","citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:ae0a2735149d9550c72115b39bdb36405d72529211fcf7f4707bbc87e423cd13","observation_id":"4e1ec5f7-cd78-4153-b063-010211071eb6","resolution":{"observed_at":"2026-08-08T22:48:33.221284Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:35.038715Z","title":"Stochastic H alpern iteration with variance reduction for stochastic monotone inclusions","venue":null,"work_id":"b54506d6-3d03-4e89-ae54-e6c4fa14dab2","year":2022},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T16:02:08.886957Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:31.888965Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:fb1e381b91a197e8fc83ce4bc293240561808e1e3eb304560fdaec7ee0c7e485","observation_id":"7d84cbcd-7415-4512-af74-d13c7776f005","resolution":{"observed_at":"2026-08-08T22:48:35.043555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:35.024978Z","title":null,"venue":null,"work_id":"a237ab91-6b74-4261-a387-d69dceb33868","year":2022},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T16:02:08.886957Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:31.893704Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:70f4e1ce1c365ebdc1fdf5d6c2a76ad8f4d12127e839a3bd640bec70a4811ef3","observation_id":"994e4a04-f101-452c-bcb0-7d0cc07c9f33","resolution":{"observed_at":"2026-08-08T22:48:35.028925Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.08920","last_updated":"2021-08-03T11:20:08Z","snapshot_observed_at":"2026-08-05T08:32:54.513722Z","submitted_at":"2020-10-18T05:06:01Z","title":"Average-reward model-free reinforcement learning: a systematic review and literature mapping","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.08920","snapshot_observed_at":"2026-08-08T22:48:31.897502Z","title":"Average-reward model-free reinforcement learning: a systematic review and literature mapping","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T16:02:08.886957Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:31.897502Z"},"links":{"cited_paper":"/paper/2010.08920","citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:fb270eef6bb8bcb6535b084d820224a8de693046941feb06c83b2d12669b2d31","observation_id":"1a5c1a4f-ee6b-4a6c-b13e-786381d12c5d","resolution":{"observed_at":"2026-08-08T22:48:31.897502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:35.010047Z","title":"Tree-based batch mode reinforcement learning","venue":null,"work_id":"b0a7a76a-09f6-4932-8c88-54acedc0d629","year":2005},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T16:02:08.886957Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:31.902132Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:7dbe004a1db51743a0640922201b36633d0096019050c1999eb32550cc4db17b","observation_id":"8a31b2dc-d673-4cbe-b1fb-54666603e240","resolution":{"observed_at":"2026-08-08T22:48:35.015122Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:34.994961Z","title":"Regret minimization in MDP s with options without prior knowledge","venue":null,"work_id":"90bc6577-ba9d-4f34-8b1a-325cd13e040f","year":2017},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T16:02:08.886957Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:31.906920Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:19c7857c42caddc5a923e338e2e897ecdb431cf5e586e458d419168024a7b6ca","observation_id":"3bc3b9aa-0e27-406f-b71c-8920beb186ff","resolution":{"observed_at":"2026-08-08T22:48:35.000334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:34.981334Z","title":"Fixed points of nonexpanding maps","venue":null,"work_id":"f2e7368d-6eba-4953-ad41-d31fa1d035e5","year":1967},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T16:02:08.886957Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:31.910727Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:bd89512ba774fe8172e9c7eea2bcadfef9945729270e7d8a44d3c7aeb70f074f","observation_id":"43b847e9-ef88-4276-9a79-78a4d5848601","resolution":{"observed_at":"2026-08-08T22:48:34.985584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:34.967337Z","title":null,"venue":null,"work_id":"38c90982-1b2a-4ca4-90f2-135b2df07fad","year":1960},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T16:02:08.886957Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:31.915182Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:c730e488372fa141d0d1c2392a1ba922fd21a4211208bef1d6378d18ad7f06f0","observation_id":"8660ebd0-bde8-4f66-8347-a587bb714912","resolution":{"observed_at":"2026-08-08T22:48:34.972046Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:34.953994Z","title":"and Sidford, A","venue":null,"work_id":"55cfb2f0-868b-4364-bd12-08589845ef29","year":2020},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T16:02:08.886957Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:31.920096Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:5a4bfb56e9f95cc6912ae3d8008ac6b8d610996450f95fae39cfd4776420d9ed","observation_id":"c15d6450-9dd2-4201-99a7-09a588487e6c","resolution":{"observed_at":"2026-08-08T22:48:34.958140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:34.940662Z","title":"and Sidford, A","venue":null,"work_id":"2bb79dd5-73d4-4887-a260-3313f48b74d3","year":2021},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T16:02:08.886957Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:31.924979Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:73b37d4960aae532bf1abe3b88b660056d91be3c7737ec50103d0132b535bba9","observation_id":"4ee15322-a920-4172-97af-f85c87a51f22","resolution":{"observed_at":"2026-08-08T22:48:34.944742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:34.926416Z","title":"Feasible Q -learning for average reward reinforcement learning","venue":null,"work_id":"4fcba0c6-ec8e-4de6-9d8e-43332b9b1112","year":2024},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T16:02:08.886957Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:31.963818Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:66f93ee27185b8d7b8f6d6c3170d0fd63e823d487dd431732e36d267b19863b6","observation_id":"81b6d8ee-d219-4423-9eba-73ba8387d9bc","resolution":{"observed_at":"2026-08-08T22:48:34.931061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:34.888780Z","title":"Truncated variance reduced value iteration","venue":null,"work_id":"e402cc44-b93f-4ce7-8f76-c9f0b7db4654","year":2024},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T16:02:08.886957Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:32.065918Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:5096c512f468778ac0ad0a894c0c7c67391191b0d10f1aaebb8e16d203e6ba54","observation_id":"0a4f39db-4299-4eea-b331-fb249c65830a","resolution":{"observed_at":"2026-08-08T22:48:34.917313Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:34.745627Z","title":"and Zhang, T","venue":null,"work_id":"f47380a4-d78f-404e-ba41-c27db225e8b5","year":2013},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T16:02:08.886957Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:32.177036Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:b4b43da02a34bfc7994aae6ce3c75f98debcaea43e04061411d23469da55146c","observation_id":"7e47a3ba-f557-421c-acfe-ccc5761b3685","resolution":{"observed_at":"2026-08-08T22:48:34.798170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:34.642565Z","title":"An -best-arm identification algorithm for fixed-confidence and beyond","venue":null,"work_id":"82e2b1c5-b973-4113-9739-8a02126e3cb7","year":2023},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T16:02:08.886957Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:32.270625Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:dd34ab5556f97dfa63970245a9dfc2734f9cbb4590c8d947f77574d40e79b831","observation_id":"aefbacb3-3aee-4b3b-a896-8069f2aa383a","resolution":{"observed_at":"2026-08-08T22:48:34.653622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:34.628694Z","title":"and Jamieson, K","venue":null,"work_id":"41f9e484-9c37-4f2a-8dc6-1f91a751af63","year":2020},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T16:02:08.886957Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:32.309190Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:b8293c71526a0fe3bdcb9e06d77f7240c6c82b6be2c76d6cdbcace30aa5efc71","observation_id":"97798eca-1f4e-44f7-938f-a5c9d30cf669","resolution":{"observed_at":"2026-08-08T22:48:34.632874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:34.614529Z","title":"and Singh, S","venue":null,"work_id":"7898b46c-edd7-444f-b205-53486aa4eeeb","year":1998},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T16:02:08.886957Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:32.356479Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:00772caa4896c21473bd3f580a2f5a803e2c5e0f240bca023e7f12215e7bfd99","observation_id":"9c44ef31-2546-4bb7-9763-ba3ad9274521","resolution":{"observed_at":"2026-08-08T22:48:34.619684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:34.600318Z","title":"Accelerated proximal point method for maximally monotone operators","venue":null,"work_id":"23697a58-21f4-4442-bbca-ac59e5057efe","year":2021},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T16:02:08.886957Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:32.392996Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:9a098d3815d6ba330f31b09090ef6ce0296a5ccca42c1ec06b0fe90f0050ec11","observation_id":"5966d6d3-b39a-47f9-84a2-7b36710a261d","resolution":{"observed_at":"2026-08-08T22:48:34.604718Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:34.585578Z","title":"Y., and Mannor, S","venue":null,"work_id":"1afa80c0-1fbe-4036-863e-335180be1f57","year":2024},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T16:02:08.886957Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:32.415711Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:073db76de6705613626dabfde5b967a83a45a880edb44733cf452c86094faf2f","observation_id":"8e19db17-a48f-4f7d-8968-1d960b533fb2","resolution":{"observed_at":"2026-08-08T22:48:34.590069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:34.572208Z","title":"Y., Srikant, R., and Mannor, S","venue":null,"work_id":"894c116d-b6e7-499e-9ccc-100f21d8cabd","year":2025},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T16:02:08.886957Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:32.427252Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:b4551a5c018ead2397cf336438935e0fe58cfdcfc8726641695461b0e8c952f1","observation_id":"ae9d1a2d-246b-4274-83e5-dce8ac801723","resolution":{"observed_at":"2026-08-08T22:48:34.576590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:34.557958Z","title":"and Ryu, E","venue":null,"work_id":"7482a663-a229-4104-987f-d135d53d8db5","year":2023},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T16:02:08.886957Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:32.431951Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:bd56df6525da4189846fe2720a407fcf6ef765fc30a8a5b186a1b65edb4827c7","observation_id":"a5f05752-a821-416e-a600-24d01b6ff205","resolution":{"observed_at":"2026-08-08T22:48:34.562153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:34.542954Z","title":"and Ryu, E","venue":null,"work_id":"acefb483-84b5-4906-84c3-99bcd1301c17","year":2025},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T16:02:08.886957Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:32.437826Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:9fc90f37e58eeb5582efcdb25321b919403b2d22038db0adbcfdeb561751afdd","observation_id":"68678cd1-5010-4abf-9825-204bdcf66f00","resolution":{"observed_at":"2026-08-08T22:48:34.547674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:34.459711Z","title":"Breaking the sample size barrier in model-based reinforcement learning with a generative model","venue":null,"work_id":"51226a67-45c9-4ecd-9672-c952d7ebb9b8","year":2020},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T16:02:08.886957Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:32.442294Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:f328fdf7a35112dc838bff00c9aedcf41804103c5729d874eecd4ebf94989f55","observation_id":"5ea594d2-ff32-4602-b069-f2c62a3b3ad2","resolution":{"observed_at":"2026-08-08T22:48:34.506560Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:34.348899Z","title":"Stochastic first-order methods for average-reward M arkov decision processes","venue":null,"work_id":"a502d3fd-2cbd-4ecd-95ca-7461b7d2171d","year":2024},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T16:02:08.886957Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:32.446716Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:ba5a83bea5973f6a7a1f1228a3749e6ac79dad3b7b57688bab3afe18d16bf496","observation_id":"246097ab-b289-4951-86d7-c878ef346b83","resolution":{"observed_at":"2026-08-08T22:48:34.384186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:34.334911Z","title":"On the convergence rate of the H alpern-iteration","venue":null,"work_id":"3b76c004-77b2-4a5b-9d33-eaaa7ce854e4","year":2021},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T16:02:08.886957Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:32.451136Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:8003e5bd11432e4a9016c201861a129fa6fde4b3625140f849259176b5ae0a5e","observation_id":"67877b08-3ef0-4f46-a86b-7cf26beb410a","resolution":{"observed_at":"2026-08-08T22:48:34.339419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:34.320549Z","title":"Average reward reinforcement learning: Foundations, algorithms, and empirical results","venue":null,"work_id":"35f91b57-8b6e-4a51-8bd6-d79aad5b1b09","year":1996},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T16:02:08.886957Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:32.455356Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:54092d00c8c86d667ce24f92dc99b1288adb98cad855feba1658682992f7e58d","observation_id":"9ee31ff6-ffcf-4c41-999b-b86b80114a7c","resolution":{"observed_at":"2026-08-08T22:48:34.325611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:34.306434Z","title":"Finding all -good arms in stochastic bandits","venue":null,"work_id":"4b930ea6-55ef-4f6f-8395-e091820c3078","year":2020},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T16:02:08.886957Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:32.459849Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:39e481b914740b0d6a767389fd4f970522f03298721e7f47fd8a8f9c7b9e9904","observation_id":"7d047367-15e1-4d05-a53d-154aaae69599","resolution":{"observed_at":"2026-08-08T22:48:34.311312Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:34.292658Z","title":"A., and et al","venue":null,"work_id":"73c07927-1633-4eea-a863-b36ecf109721","year":2015},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T16:02:08.886957Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:32.463764Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:9e9a12fe35057991583048dc183ab22326f48406a5d445ddc946d41e5107559b","observation_id":"b1a61167-9a7b-47a2-811a-24713a39dd31","resolution":{"observed_at":"2026-08-08T22:48:34.296661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:34.279845Z","title":"and Szepesv \\'a ri, C","venue":null,"work_id":"677cda40-0469-4d7a-89af-27c3807728bf","year":2008},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T16:02:08.886957Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:32.468453Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:0599a65cc821306ae29bd09ff659558fb1595ebba5e114d4233a73db1866ec59","observation_id":"3ced112a-25b0-4238-967a-97e59a574c06","resolution":{"observed_at":"2026-08-08T22:48:34.284077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:34.266544Z","title":"and Srikant, R","venue":null,"work_id":"c06e2894-3090-4bae-8425-3b27e99d4eca","year":1979},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T16:02:08.886957Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:32.472967Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:1ae1a02f4e24083257a58d3e21c03d7d037a806c1aa8f99c394507ae5549d9b4","observation_id":"ee982dfd-3408-430c-b656-ae1a0c6d73a5","resolution":{"observed_at":"2026-08-08T22:48:34.270618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:34.246508Z","title":"and Okolo, N","venue":null,"work_id":"627b51ae-169a-48c5-b4c7-c5b113ed7142","year":2024},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T16:02:08.886957Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:32.477471Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:3ea084de684d6abb5e6de0a6f2ba394f48b12297496a9de7e84c23abf40fd0f1","observation_id":"f30b2363-3cca-4118-8b1e-2d82de96dd01","resolution":{"observed_at":"2026-08-08T22:48:34.251721Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:34.232469Z","title":"M., Liu, J., Scheinberg, K., and Tak \\'a c , M","venue":null,"work_id":"88f6f21d-331c-41fd-b0bc-c90969b04bd4","year":2017},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T16:02:08.886957Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:32.494634Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:2c6ee5d032fdb183ca97a77e3d2ae8c497917f90a5016bbb3123fe40a1e637c7","observation_id":"c79f08b4-a558-4c76-ab8f-b6a0451e358b","resolution":{"observed_at":"2026-08-08T22:48:34.236817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:34.163803Z","title":"and Ryu, E","venue":null,"work_id":"9c106579-7162-4ab8-8bbd-c02ad1ac0f4e","year":2022},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T16:02:08.886957Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:32.588998Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:67bc7cc083894d39b760e2dc6fb89ac1b74eafa0456ad56d55f9b052f97e2fd7","observation_id":"7f37755b-22d8-443e-9284-ade197858d02","resolution":{"observed_at":"2026-08-08T22:48:34.208132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:34.062640Z","title":null,"venue":null,"work_id":"b567def9-c3eb-46e1-991c-f320bab7a3b2","year":2014},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T16:02:08.886957Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:32.734829Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:dcbaf72722d3b18894d47985d956a09b04d210df499f37c45365f3bfcdd787dd","observation_id":"df731c54-283e-4cb8-a503-e51459b80af9","resolution":{"observed_at":"2026-08-08T22:48:34.108545Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:33.943648Z","title":"Strong convergence theorems for resolvents of accretive operators in B anach spaces","venue":null,"work_id":"29374f36-86d7-428c-acd2-7d5780121935","year":1980},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T16:02:08.886957Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:32.748479Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:600280c147345cb9651dbc27d479da4214f2d4bdcb8a2832328ee71be69a4ef5","observation_id":"6c8ed0f4-ec9e-40c0-a5b5-40130bdec4b8","resolution":{"observed_at":"2026-08-08T22:48:33.999717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:33.930050Z","title":"and Mansour, Y","venue":null,"work_id":"545ccbd2-3360-479c-a683-6041ed0a9356","year":2021},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T16:02:08.886957Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:32.768186Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:5eb6203afc69d2c62cd3e674d6fc20ff7b1bd2a93f1d4ea79b1699f6e36f553e","observation_id":"7fab3d07-0926-4b1f-8507-88f7db287c0f","resolution":{"observed_at":"2026-08-08T22:48:33.934187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:33.916289Z","title":"and Shtern, S","venue":null,"work_id":"38fbeff2-7315-4944-9c9c-d4096f3ce02b","year":2017},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T16:02:08.886957Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:32.780734Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:ac586f976cb39b83e07a7dcc2c7d854ae4c072fd105594451dda6c5cfc65c4da","observation_id":"312fa99d-b052-4dd4-a9ad-f6e3ac60ac59","resolution":{"observed_at":"2026-08-08T22:48:33.920700Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:33.901692Z","title":"Near-optimal time and sample complexities for solving M arkov decision processes with a generative model","venue":null,"work_id":"01f9574f-8556-45c5-aae6-331b52c09947","year":2018},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T16:02:08.886957Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:32.788355Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:6440ddc99c2f1e9a8a9f10b15a03edd5eaf83628c733415a87f6281a919697fe","observation_id":"1c0aeceb-2f32-4a56-8a46-c5f6ab9b45b8","resolution":{"observed_at":"2026-08-08T22:48:33.906432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:33.887145Z","title":"Variance reduced value iteration and faster algorithms for solving M arkov decision processes","venue":null,"work_id":"7414e899-23d6-42c5-a65b-0240aaf86ef0","year":2023},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T16:02:08.886957Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:32.793396Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:7df15214466d3645e6fad7d0e22292a0687cba1d0ded8668b43db6d963c91b59","observation_id":"c4dbc32f-8889-4c84-b184-281d760b7b39","resolution":{"observed_at":"2026-08-08T22:48:33.891913Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:33.862361Z","title":null,"venue":null,"work_id":"10f3f39c-1cb1-484e-9ced-f3e21ed03188","year":1988},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T16:02:08.886957Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:32.797742Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:a16d89116cbf4987528ca5cd2483af4f0e1835e8e7736f399f6c2870f94ebf21","observation_id":"1148d948-2309-453f-a4fd-c04a3f99b1d1","resolution":{"observed_at":"2026-08-08T22:48:33.877940Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:33.819677Z","title":null,"venue":null,"work_id":"e224e35c-e53f-4803-b830-011404d0bb3f","year":2018},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T16:02:08.886957Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:32.801806Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:08831a33889a9094dd668337ca2c96038fc4c1222071a29d28d9792035700542","observation_id":"bf4e78f9-d24d-4f6a-a270-022d544ba479","resolution":{"observed_at":"2026-08-08T22:48:33.839562Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:33.601277Z","title":"Algorithms for Reinforcement Learning","venue":null,"work_id":"c85f6260-c9bf-481a-9461-acb5b8887c0a","year":2010},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T16:02:08.886957Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:32.806678Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:95d8955c44137ac1cf3f7f9a71df3df29f424fd7ef209beae0019c03e7956bd9","observation_id":"9cf865e6-99bd-4526-8fb5-490dc7fcc371","resolution":{"observed_at":"2026-08-08T22:48:33.701272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:33.586868Z","title":"Finding good policies in average-reward M arkov decision processes without prior knowledge","venue":null,"work_id":"5aaaf9eb-4d80-43ea-9e6a-7ddbae495359","year":2024},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T16:02:08.886957Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:32.810601Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:92d281f299fb51ca9718ad641c4821490ec28b4887687c4daa4493540735730f","observation_id":"c79fe039-f5f9-4024-8dc4-f355a07aea7b","resolution":{"observed_at":"2026-08-08T22:48:33.591673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.04697","last_updated":"2019-08-08T17:33:58Z","snapshot_observed_at":"2026-08-08T04:58:01.906827Z","submitted_at":"2019-06-11T16:58:54Z","title":"Variance-reduced $Q$-learning is minimax optimal","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.04697","snapshot_observed_at":"2026-08-08T22:48:32.814848Z","title":null,"venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T16:02:08.886957Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:32.814848Z"},"links":{"cited_paper":"/paper/1906.04697","citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:73b74db99ab4a031505afd2168153f9191d2c643855ab59ee551337cd225761c","observation_id":"a7e16fd6-1b54-4c91-a3da-ba2c5e5aec17","resolution":{"observed_at":"2026-08-08T22:48:32.814848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:33.572527Z","title":null,"venue":null,"work_id":"88ab287a-cb6d-441b-b8c5-411d655c850a","year":2021},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T16:02:08.886957Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:32.819248Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:58b5063d7ea61ab194290921b75df808f323a9e2e88bb6d2b8e6b3ace8f2a725","observation_id":"807d7a90-8441-4ab6-af08-1f3a2e150258","resolution":{"observed_at":"2026-08-08T22:48:33.576996Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.00603","last_updated":"2022-12-01T15:57:58Z","snapshot_observed_at":"2026-07-06T14:25:40.781383Z","submitted_at":"2022-12-01T15:57:58Z","title":"Near Sample-Optimal Reduction-based Policy Learning for Average Reward MDP","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.00603","snapshot_observed_at":"2026-08-08T22:48:32.824182Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T16:02:08.886957Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:32.824182Z"},"links":{"cited_paper":"/paper/2212.00603","citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:02113a5323d3eb964f7addb3532891287166547dbc41ba39694e2775e940f794","observation_id":"32ab1a26-20b5-443f-9542-807e6181f9e3","resolution":{"observed_at":"2026-08-08T22:48:32.824182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1710.06100","last_updated":"2017-10-17T05:03:19Z","snapshot_observed_at":"2026-08-07T11:28:35.203683Z","submitted_at":"2017-10-17T05:03:19Z","title":"Primal-Dual $\\pi$ Learning: Sample Complexity and Sublinear Run Time for Ergodic Markov Decision Problems","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.06100","snapshot_observed_at":"2026-08-08T22:48:32.829460Z","title":"Primal-dual learning: Sample complexity and sublinear run time for ergodic M arkov decision problems","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T16:02:08.886957Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:32.829460Z"},"links":{"cited_paper":"/paper/1710.06100","citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:165cfcb7beafec5bedd681310c4f0cbb2d91547a227330692dce2c95db5bd0ba","observation_id":"c5337e60-d0f6-445d-9e53-ee7c5761380f","resolution":{"observed_at":"2026-08-08T22:48:32.829460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:33.558032Z","title":"Optimal sample complexity for average reward M arkov decision processes","venue":null,"work_id":"5f4ffa83-44e6-400c-b574-b7413644784f","year":2023},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T16:02:08.886957Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:32.834124Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:4b54b28163b870094d888d8a29a522edb0b0991575ee57f0ddcac3f10890f9c9","observation_id":"086120f1-6b5a-43c6-8f19-87d59acf8650","resolution":{"observed_at":"2026-08-08T22:48:33.562637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:33.541907Z","title":"J., Luo, H., Sharma, H., and Jain, R","venue":null,"work_id":"b9fc2eb5-561d-44fb-8ba4-61719f35087d","year":2020},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T16:02:08.886957Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:32.838129Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:1c3d524d012a79130a7743f003d3016e6feabf5f3432cb0eb91c7d9ddc639d51","observation_id":"c3b98127-31c4-4daf-a83b-0494e20a430b","resolution":{"observed_at":"2026-08-08T22:48:33.547358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:33.440594Z","title":"Approximation of fixed points of nonexpansive mappings","venue":null,"work_id":"1eef42c8-3ca8-4072-a95c-848b35e820bd","year":1992},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T16:02:08.886957Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:32.842808Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:7c7f34d674eee579ae48f2ffa8b2a0fd1a2e244d25fdb93ee19a01569b01aa77","observation_id":"3f56888e-d312-472d-b92b-47e14efd51e5","resolution":{"observed_at":"2026-08-08T22:48:33.519795Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:33.306081Z","title":"Iterative algorithms for nonlinear operators","venue":null,"work_id":"fbc06a80-100b-4c56-8963-12964150bfb8","year":2002},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T16:02:08.886957Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:32.847597Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:6c04ea19e80b161215d40c6545ac037d2c7eb66f2db484791e62b99b5c7c8a15","observation_id":"f13a70e5-2694-4ef6-a9cd-5043d6e698a2","resolution":{"observed_at":"2026-08-08T22:48:33.353677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:33.289485Z","title":"and Ryu, E","venue":null,"work_id":"3acae3b6-e18b-4945-80ca-643e5abe1f11","year":2021},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T16:02:08.886957Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:32.884091Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:112bdf186c214e20393de3bb63c1e4eccc55e3fa8180f185da05f1316faaa60c","observation_id":"0f84857f-5ec0-46da-ab79-1cd7eb8ea5a7","resolution":{"observed_at":"2026-08-08T22:48:33.294665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:33.274157Z","title":"and Xie, Q","venue":null,"work_id":"a6b3e315-8b25-4107-8a5f-8cef3a843bf6","year":2023},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T16:02:08.886957Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:33.022441Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:bb41b7b76772a4ef48c1ff0ff08ada102862ffacdd0670fecf961923e48dee71","observation_id":"0a693ff1-51e2-4bad-a79c-5b7160dde0a8","resolution":{"observed_at":"2026-08-08T22:48:33.279188Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:33.258929Z","title":"and Chen, Y","venue":null,"work_id":"31f720b5-e6a8-478d-9e4c-7c6e938d52b2","year":2024},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T16:02:08.886957Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:33.109820Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:d49be08057871816993cfbbac43487243e62ed47dfc4bd88f2d8773bb5c48278","observation_id":"75878761-0f78-4812-83da-89c6fd3bee47","resolution":{"observed_at":"2026-08-08T22:48:33.263816Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:33.114297Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T16:02:08.886957Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:33.114297Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:382baf07e35f68f6845ed64f838cb4399bbc2d0c73c35905e5b382db85e1ca6b","observation_id":"0fe317f3-ab06-4ec0-9f6a-226958058625","resolution":{"observed_at":"2026-08-08T22:48:33.114297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","latest_version":2,"primary_category":"math.OC","snapshot_observed_at":"2026-08-09T16:02:08.886957Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring"},"reference_resolution":{"displayed":65,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":17,"verified_exact":1,"verified_fuzzy":47},"total_outbound_references":65},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 65 of 65 outbound references and 2 inbound Pith citation observations for arXiv:2502.04477."}