{"as_of":"2026-08-19T06:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7ed4de20ca6f8ce9b924c006428fdd1f18b988c1cb47a6931d13302822e2b30d","coverage":[{"denominator":37,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T18:54:01.147324Z","state":"measured"},{"denominator":37,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":37,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.17201/citation-record","integrity":"/paper/2607.17201/integrity","json":"/paper/2607.17201/citation-record.json","paper":"/paper/2607.17201"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:53:58.493874Z","title":"Al Marjani and A","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.17201","last_updated":"2026-07-19T11:48:09Z","snapshot_observed_at":"2026-08-14T19:16:59.144744Z","submitted_at":"2026-07-19T11:48:09Z","title":"Non-Asymptotic Best Policy Identification Guarantees in Online Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T18:53:58.493874Z"},"links":{"citing_paper":"/paper/2607.17201"},"observation_digest":"sha256:dbc9b77fa1eb3eef29263a2a7455757a449664e4fcf9d12ba37b8d6288c4081f","observation_id":"7151ce36-21b7-4331-9ea6-7279ad572995","resolution":{"observed_at":"2026-08-01T18:53:58.493874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:53:58.529153Z","title":"Al Marjani, A","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.17201","last_updated":"2026-07-19T11:48:09Z","snapshot_observed_at":"2026-08-14T19:16:59.144744Z","submitted_at":"2026-07-19T11:48:09Z","title":"Non-Asymptotic Best Policy Identification Guarantees in Online Reinforcement Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T18:53:58.529153Z"},"links":{"citing_paper":"/paper/2607.17201"},"observation_digest":"sha256:cda0e721e0999c7538c8564b331ba03d10e0e4d4defa6d321dde6def3eec0e9a","observation_id":"06e02925-65d5-44b7-a941-788000b5515e","resolution":{"observed_at":"2026-08-01T18:53:58.529153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15342","last_updated":"2026-04-20T06:54:31Z","snapshot_observed_at":"2026-07-06T21:27:42.002746Z","submitted_at":"2025-05-21T10:13:54Z","title":"Policy Testing in Markov Decision Processes","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15342","snapshot_observed_at":"2026-08-01T18:53:58.581627Z","title":"Ariu, P.-A","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17201","last_updated":"2026-07-19T11:48:09Z","snapshot_observed_at":"2026-08-14T19:16:59.144744Z","submitted_at":"2026-07-19T11:48:09Z","title":"Non-Asymptotic Best Policy Identification Guarantees in Online Reinforcement Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T18:53:58.581627Z"},"links":{"cited_paper":"/paper/2505.15342","citing_paper":"/paper/2607.17201"},"observation_digest":"sha256:62a0a7c3b76b6eced8efb5a180c7167c3aedddaf52c4005e59a29431b94173e3","observation_id":"eb8f7d5f-4cd3-4159-bab6-483cb77255c7","resolution":{"observed_at":"2026-08-01T18:53:58.581627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:53:58.645968Z","title":"Berge.Topological Spaces: Including a Treatment of Multi-Valued Functions, Vector Spaces, and Convexity","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2607.17201","last_updated":"2026-07-19T11:48:09Z","snapshot_observed_at":"2026-08-14T19:16:59.144744Z","submitted_at":"2026-07-19T11:48:09Z","title":"Non-Asymptotic Best Policy Identification Guarantees in Online Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T18:53:58.645968Z"},"links":{"citing_paper":"/paper/2607.17201"},"observation_digest":"sha256:53bdb8793050bf2d1162b0fe118aebc3bfd94c450576b2a884b14101e60b788d","observation_id":"5db72b6e-b558-44fb-84bb-66656e05f635","resolution":{"observed_at":"2026-08-01T18:53:58.645968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13013","last_updated":"2025-01-22T16:56:42Z","snapshot_observed_at":"2026-08-14T20:10:22.748831Z","submitted_at":"2025-01-22T16:56:42Z","title":"The regret lower bound for communicating Markov Decision Processes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13013","snapshot_observed_at":"2026-08-01T18:53:58.706383Z","title":"Boone and O.-A","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17201","last_updated":"2026-07-19T11:48:09Z","snapshot_observed_at":"2026-08-14T19:16:59.144744Z","submitted_at":"2026-07-19T11:48:09Z","title":"Non-Asymptotic Best Policy Identification Guarantees in Online Reinforcement Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T18:53:58.706383Z"},"links":{"cited_paper":"/paper/2501.13013","citing_paper":"/paper/2607.17201"},"observation_digest":"sha256:a38e98e442aaf8a583b366920dfb64459a5653fce9ca5f9d4f5a2edaab6873ca","observation_id":"d909eea6-b31c-4031-a7f4-2b717132859b","resolution":{"observed_at":"2026-08-01T18:53:58.706383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:53:58.770229Z","title":"Boucheron, G","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2607.17201","last_updated":"2026-07-19T11:48:09Z","snapshot_observed_at":"2026-08-14T19:16:59.144744Z","submitted_at":"2026-07-19T11:48:09Z","title":"Non-Asymptotic Best Policy Identification Guarantees in Online Reinforcement Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T18:53:58.770229Z"},"links":{"citing_paper":"/paper/2607.17201"},"observation_digest":"sha256:850325c4af3dfd3348c999e1f3751a1daeb60753201df9cd7e3d27b0a1cd4b20","observation_id":"57780a37-c1e1-4079-bbe6-c2a72904419b","resolution":{"observed_at":"2026-08-01T18:53:58.770229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:53:58.826541Z","title":null,"venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2607.17201","last_updated":"2026-07-19T11:48:09Z","snapshot_observed_at":"2026-08-14T19:16:59.144744Z","submitted_at":"2026-07-19T11:48:09Z","title":"Non-Asymptotic Best Policy Identification Guarantees in Online Reinforcement Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T18:53:58.826541Z"},"links":{"citing_paper":"/paper/2607.17201"},"observation_digest":"sha256:7e609f86a39e3e6846076141a208d826b69b0dfa6ad8f3ce3a20fc1ebedabf1a","observation_id":"35b958e0-4312-4ee4-8b38-d8bd4a94e922","resolution":{"observed_at":"2026-08-01T18:53:58.826541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/s0024-3795(01)00320-2","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":"Linear Algebra and its Applications","work_id":"33a72288-f553-41a4-9f2d-ad7007a613af","year":2001},"citing_paper":{"arxiv_id":"2607.17201","last_updated":"2026-07-19T11:48:09Z","snapshot_observed_at":"2026-08-14T19:16:59.144744Z","submitted_at":"2026-07-19T11:48:09Z","title":"Non-Asymptotic Best Policy Identification Guarantees in Online Reinforcement Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T18:53:58.871081Z"},"links":{"citing_paper":"/paper/2607.17201"},"observation_digest":"sha256:7923348f9f3d46ed0624d9285f0a5f14c956ce92ed858e2d841f4c37a77ea30d","observation_id":"cc0fdbbe-2b6f-468b-9fab-af3a2ff57e66","resolution":{"observed_at":"2026-08-01T18:59:12.738112Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:53:58.945774Z","title":null,"venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2607.17201","last_updated":"2026-07-19T11:48:09Z","snapshot_observed_at":"2026-08-14T19:16:59.144744Z","submitted_at":"2026-07-19T11:48:09Z","title":"Non-Asymptotic Best Policy Identification Guarantees in Online Reinforcement Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T18:53:58.945774Z"},"links":{"citing_paper":"/paper/2607.17201"},"observation_digest":"sha256:a64cdd93179ed85505f48154a9f9541ec69314ab74f05bc31f2bde24c5f35dc5","observation_id":"c7876929-fb53-45a4-9151-039a347cdc81","resolution":{"observed_at":"2026-08-01T18:53:58.945774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:53:59.009892Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.17201","last_updated":"2026-07-19T11:48:09Z","snapshot_observed_at":"2026-08-14T19:16:59.144744Z","submitted_at":"2026-07-19T11:48:09Z","title":"Non-Asymptotic Best Policy Identification Guarantees in Online Reinforcement Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T18:53:59.009892Z"},"links":{"citing_paper":"/paper/2607.17201"},"observation_digest":"sha256:15e6b7c0303f4effcfa748d2520a8ff0f6e57744e88c6d3de53200ee6ee4c368","observation_id":"89863d45-3678-4211-85ce-8f2e6f2a8cd6","resolution":{"observed_at":"2026-08-01T18:53:59.009892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:53:59.116553Z","title":"Degenne and W","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.17201","last_updated":"2026-07-19T11:48:09Z","snapshot_observed_at":"2026-08-14T19:16:59.144744Z","submitted_at":"2026-07-19T11:48:09Z","title":"Non-Asymptotic Best Policy Identification Guarantees in Online Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T18:53:59.116553Z"},"links":{"citing_paper":"/paper/2607.17201"},"observation_digest":"sha256:5d5937e85f65231ae8f5b086424b8e8f79efcdb8f845342feeef2ccbbd14f2cd","observation_id":"8f0bcc96-f663-41c7-b677-5d9384688533","resolution":{"observed_at":"2026-08-01T18:53:59.116553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:53:59.167718Z","title":"Degenne, W","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.17201","last_updated":"2026-07-19T11:48:09Z","snapshot_observed_at":"2026-08-14T19:16:59.144744Z","submitted_at":"2026-07-19T11:48:09Z","title":"Non-Asymptotic Best Policy Identification Guarantees in Online Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T18:53:59.167718Z"},"links":{"citing_paper":"/paper/2607.17201"},"observation_digest":"sha256:374ab26304810a7f2509595d8ccf2f768e072e1416678264e5988ebc062ca5e6","observation_id":"b9d2103a-99e4-478c-a38f-eebcc5d336bb","resolution":{"observed_at":"2026-08-01T18:53:59.167718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:53:59.262719Z","title":"Garivier and E","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.17201","last_updated":"2026-07-19T11:48:09Z","snapshot_observed_at":"2026-08-14T19:16:59.144744Z","submitted_at":"2026-07-19T11:48:09Z","title":"Non-Asymptotic Best Policy Identification Guarantees in Online Reinforcement Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T18:53:59.262719Z"},"links":{"citing_paper":"/paper/2607.17201"},"observation_digest":"sha256:0ef65ff318986602bf55c66490badf0b0f4ad9d095842d5719c1ee422436c863","observation_id":"3d740a2c-859d-47ca-859f-242de7a9d63c","resolution":{"observed_at":"2026-08-01T18:53:59.262719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.04454","last_updated":"2018-07-24T08:38:39Z","snapshot_observed_at":"2026-08-14T20:14:24.185161Z","submitted_at":"2017-11-13T07:36:01Z","title":"Thresholding Bandit for Dose-ranging: The Impact of Monotonicity","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.04454","snapshot_observed_at":"2026-08-01T18:53:59.352381Z","title":"Garivier, P","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.17201","last_updated":"2026-07-19T11:48:09Z","snapshot_observed_at":"2026-08-14T19:16:59.144744Z","submitted_at":"2026-07-19T11:48:09Z","title":"Non-Asymptotic Best Policy Identification Guarantees in Online Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T18:53:59.352381Z"},"links":{"cited_paper":"/paper/1711.04454","citing_paper":"/paper/2607.17201"},"observation_digest":"sha256:73d556407230019706fc4a87fdf8f53fe3ed5b1261d63795cf8055f60dc7c028","observation_id":"03a5005e-b5c8-4b51-affd-a8ca7f56596f","resolution":{"observed_at":"2026-08-01T18:53:59.352381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:53:59.442412Z","title":null,"venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2607.17201","last_updated":"2026-07-19T11:48:09Z","snapshot_observed_at":"2026-08-14T19:16:59.144744Z","submitted_at":"2026-07-19T11:48:09Z","title":"Non-Asymptotic Best Policy Identification Guarantees in Online Reinforcement Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T18:53:59.442412Z"},"links":{"citing_paper":"/paper/2607.17201"},"observation_digest":"sha256:78edafb380ba2a8dcb07ab1bda07cc9e90aba02dafd85a8141d6d4dcadd960cb","observation_id":"ea5a2da7-1be2-42c6-90c7-e54f0ed970c6","resolution":{"observed_at":"2026-08-01T18:53:59.442412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:53:59.452766Z","title":"Jonsson, E","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.17201","last_updated":"2026-07-19T11:48:09Z","snapshot_observed_at":"2026-08-14T19:16:59.144744Z","submitted_at":"2026-07-19T11:48:09Z","title":"Non-Asymptotic Best Policy Identification Guarantees in Online Reinforcement Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T18:53:59.452766Z"},"links":{"citing_paper":"/paper/2607.17201"},"observation_digest":"sha256:42e8da465e5eef4f4fd5b59c859df06eb287be66419804dfde5b03874ce08c93","observation_id":"0932b424-0528-462e-8a90-dcd389e59d9f","resolution":{"observed_at":"2026-08-01T18:53:59.452766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:53:59.511504Z","title":"Jourdan and A","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17201","last_updated":"2026-07-19T11:48:09Z","snapshot_observed_at":"2026-08-14T19:16:59.144744Z","submitted_at":"2026-07-19T11:48:09Z","title":"Non-Asymptotic Best Policy Identification Guarantees in Online Reinforcement Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T18:53:59.511504Z"},"links":{"citing_paper":"/paper/2607.17201"},"observation_digest":"sha256:6741401ebcdf8d423abd381f6b3a02dc3ac20e353166586e77e5f90e29c8430a","observation_id":"1d2e93fe-fe6a-480f-ab5a-d8737b0ea7cb","resolution":{"observed_at":"2026-08-01T18:53:59.511504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:53:59.578201Z","title":"Jourdan, R","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17201","last_updated":"2026-07-19T11:48:09Z","snapshot_observed_at":"2026-08-14T19:16:59.144744Z","submitted_at":"2026-07-19T11:48:09Z","title":"Non-Asymptotic Best Policy Identification Guarantees in Online Reinforcement Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T18:53:59.578201Z"},"links":{"citing_paper":"/paper/2607.17201"},"observation_digest":"sha256:07a0bdfe6f4a55403884a7ebc126b705578f0a2af6610cadeedcf66a74dcc9b0","observation_id":"1f0be86c-19be-4cb5-8176-6cacd2e5c25f","resolution":{"observed_at":"2026-08-01T18:53:59.578201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:53:59.692268Z","title":"Kaufmann, P","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.17201","last_updated":"2026-07-19T11:48:09Z","snapshot_observed_at":"2026-08-14T19:16:59.144744Z","submitted_at":"2026-07-19T11:48:09Z","title":"Non-Asymptotic Best Policy Identification Guarantees in Online Reinforcement Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T18:53:59.692268Z"},"links":{"citing_paper":"/paper/2607.17201"},"observation_digest":"sha256:81e310fac6c6e781e5651c292541f195a606475807f076c065ea632fee4aa4eb","observation_id":"57eccf5b-b2b7-4de4-970c-f440032526d9","resolution":{"observed_at":"2026-08-01T18:53:59.692268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:53:59.790934Z","title":"Lazzaro and C","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17201","last_updated":"2026-07-19T11:48:09Z","snapshot_observed_at":"2026-08-14T19:16:59.144744Z","submitted_at":"2026-07-19T11:48:09Z","title":"Non-Asymptotic Best Policy Identification Guarantees in Online Reinforcement Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T18:53:59.790934Z"},"links":{"citing_paper":"/paper/2607.17201"},"observation_digest":"sha256:d18be40cb43e11d13170639e3f0f24efd59911b82d2259893359b11b88d382d3","observation_id":"d906c45c-3b27-448f-be8d-5343fa621c18","resolution":{"observed_at":"2026-08-01T18:53:59.790934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:53:59.854229Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.17201","last_updated":"2026-07-19T11:48:09Z","snapshot_observed_at":"2026-08-14T19:16:59.144744Z","submitted_at":"2026-07-19T11:48:09Z","title":"Non-Asymptotic Best Policy Identification Guarantees in Online Reinforcement Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T18:53:59.854229Z"},"links":{"citing_paper":"/paper/2607.17201"},"observation_digest":"sha256:e8d5918041fc53598a22eca7c96434460d64ffe0d89cffde6796da070f509731","observation_id":"842bcfb4-453a-442e-882f-d3e4cf19f9a7","resolution":{"observed_at":"2026-08-01T18:53:59.854229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:53:59.941681Z","title":"Poiani, M","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17201","last_updated":"2026-07-19T11:48:09Z","snapshot_observed_at":"2026-08-14T19:16:59.144744Z","submitted_at":"2026-07-19T11:48:09Z","title":"Non-Asymptotic Best Policy Identification Guarantees in Online Reinforcement Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T18:53:59.941681Z"},"links":{"citing_paper":"/paper/2607.17201"},"observation_digest":"sha256:c71db99962c46c38aabbc36fb2e300321f7a48319728da474b3e246011131804","observation_id":"dc50e33e-8360-45a6-9365-1d9cb6cbf796","resolution":{"observed_at":"2026-08-01T18:53:59.941681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:54:00.031409Z","title":"Poiani, M","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17201","last_updated":"2026-07-19T11:48:09Z","snapshot_observed_at":"2026-08-14T19:16:59.144744Z","submitted_at":"2026-07-19T11:48:09Z","title":"Non-Asymptotic Best Policy Identification Guarantees in Online Reinforcement Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T18:54:00.031409Z"},"links":{"citing_paper":"/paper/2607.17201"},"observation_digest":"sha256:d569d7b20db16140c20ea2b807e9e86b32638b820981d15448f91fe71213fa7f","observation_id":"10d17296-4c7f-4280-b064-9b74ca0f8251","resolution":{"observed_at":"2026-08-01T18:54:00.031409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:54:00.132912Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.17201","last_updated":"2026-07-19T11:48:09Z","snapshot_observed_at":"2026-08-14T19:16:59.144744Z","submitted_at":"2026-07-19T11:48:09Z","title":"Non-Asymptotic Best Policy Identification Guarantees in Online Reinforcement Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T18:54:00.132912Z"},"links":{"citing_paper":"/paper/2607.17201"},"observation_digest":"sha256:c917ee1efc6e3ff966c0e073a85059b94f761f65576101cff62b22bd3da007fd","observation_id":"a3557330-acb1-4377-9e61-ef785a6d2b92","resolution":{"observed_at":"2026-08-01T18:54:00.132912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02516","last_updated":"2025-08-17T03:22:43Z","snapshot_observed_at":"2026-08-17T11:33:05.461466Z","submitted_at":"2025-02-04T17:35:51Z","title":"Adaptive Exploration for Multi-Reward Multi-Policy Evaluation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02516","snapshot_observed_at":"2026-08-01T18:54:00.193317Z","title":"Russo and A","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17201","last_updated":"2026-07-19T11:48:09Z","snapshot_observed_at":"2026-08-14T19:16:59.144744Z","submitted_at":"2026-07-19T11:48:09Z","title":"Non-Asymptotic Best Policy Identification Guarantees in Online Reinforcement Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T18:54:00.193317Z"},"links":{"cited_paper":"/paper/2502.02516","citing_paper":"/paper/2607.17201"},"observation_digest":"sha256:9a119574768ac36a9c795991a468010606a64aa608b91809cad021c337b51dfa","observation_id":"661319d6-b19e-4270-8ce8-866f141e0195","resolution":{"observed_at":"2026-08-01T18:54:00.193317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:54:00.274126Z","title":"Russo and A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17201","last_updated":"2026-07-19T11:48:09Z","snapshot_observed_at":"2026-08-14T19:16:59.144744Z","submitted_at":"2026-07-19T11:48:09Z","title":"Non-Asymptotic Best Policy Identification Guarantees in Online Reinforcement Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T18:54:00.274126Z"},"links":{"citing_paper":"/paper/2607.17201"},"observation_digest":"sha256:10457409c4876ae7503d5d107e14187871c0803e16c84615a5160a20b7108c5f","observation_id":"1b4326d2-0013-4adf-a545-e70733671d2e","resolution":{"observed_at":"2026-08-01T18:54:00.274126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:54:00.432674Z","title":"Russo and F","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17201","last_updated":"2026-07-19T11:48:09Z","snapshot_observed_at":"2026-08-14T19:16:59.144744Z","submitted_at":"2026-07-19T11:48:09Z","title":"Non-Asymptotic Best Policy Identification Guarantees in Online Reinforcement Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T18:54:00.432674Z"},"links":{"citing_paper":"/paper/2607.17201"},"observation_digest":"sha256:fe4bb6543e4c1b2cffa8b92f2b02eb916370a036a6f716cbcdb2abb76913af01","observation_id":"224278e4-ab14-4781-9513-404ffd466581","resolution":{"observed_at":"2026-08-01T18:54:00.432674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07824","last_updated":"2025-03-10T20:11:59Z","snapshot_observed_at":"2026-08-19T05:56:04.122731Z","submitted_at":"2025-03-10T20:11:59Z","title":"Pure Exploration with Feedback Graphs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07824","snapshot_observed_at":"2026-08-01T18:54:00.626153Z","title":"Russo, Y","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17201","last_updated":"2026-07-19T11:48:09Z","snapshot_observed_at":"2026-08-14T19:16:59.144744Z","submitted_at":"2026-07-19T11:48:09Z","title":"Non-Asymptotic Best Policy Identification Guarantees in Online Reinforcement Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T18:54:00.626153Z"},"links":{"cited_paper":"/paper/2503.07824","citing_paper":"/paper/2607.17201"},"observation_digest":"sha256:c52eae2d6ccce20afa64493d1f281d76162246cb045c08ea55ae5816fcd954d5","observation_id":"f0043074-c72f-4304-8351-3d4601eaf280","resolution":{"observed_at":"2026-08-01T18:54:00.626153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:54:00.721970Z","title":null,"venue":null,"work_id":null,"year":1968},"citing_paper":{"arxiv_id":"2607.17201","last_updated":"2026-07-19T11:48:09Z","snapshot_observed_at":"2026-08-14T19:16:59.144744Z","submitted_at":"2026-07-19T11:48:09Z","title":"Non-Asymptotic Best Policy Identification Guarantees in Online Reinforcement Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T18:54:00.721970Z"},"links":{"citing_paper":"/paper/2607.17201"},"observation_digest":"sha256:891ebb2f5735eb8525d49af6b64e734df241623e055deb7122a81fbe0f00da6e","observation_id":"2db139a3-37fb-4422-b44f-c4ca9c94165a","resolution":{"observed_at":"2026-08-01T18:54:00.721970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.17587","last_updated":"2026-05-29T10:41:53Z","snapshot_observed_at":"2026-08-17T19:58:08.831031Z","submitted_at":"2026-02-19T18:11:02Z","title":"Asymptotically Optimal Sequential Testing with Markovian Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.17587","snapshot_observed_at":"2026-08-01T18:54:00.796549Z","title":"Sethi, K","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.17201","last_updated":"2026-07-19T11:48:09Z","snapshot_observed_at":"2026-08-14T19:16:59.144744Z","submitted_at":"2026-07-19T11:48:09Z","title":"Non-Asymptotic Best Policy Identification Guarantees in Online Reinforcement Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T18:54:00.796549Z"},"links":{"cited_paper":"/paper/2602.17587","citing_paper":"/paper/2607.17201"},"observation_digest":"sha256:c5e03c4be6f2598b3026c2c5a3b9cf8c806a855fcb931d2845ec15a05e1e9e4e","observation_id":"50d7c8a2-7619-4abe-9d3d-2db699ddff46","resolution":{"observed_at":"2026-08-01T18:54:00.796549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:54:00.837113Z","title":null,"venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2607.17201","last_updated":"2026-07-19T11:48:09Z","snapshot_observed_at":"2026-08-14T19:16:59.144744Z","submitted_at":"2026-07-19T11:48:09Z","title":"Non-Asymptotic Best Policy Identification Guarantees in Online Reinforcement Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T18:54:00.837113Z"},"links":{"citing_paper":"/paper/2607.17201"},"observation_digest":"sha256:8730071be6298a4d4ce9e507520869a94f768893dbb039641fcdbfd12697e843","observation_id":"c8a9d37c-bec9-4521-9c69-4ffcc2cfc9e0","resolution":{"observed_at":"2026-08-01T18:54:00.837113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:54:00.883532Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.17201","last_updated":"2026-07-19T11:48:09Z","snapshot_observed_at":"2026-08-14T19:16:59.144744Z","submitted_at":"2026-07-19T11:48:09Z","title":"Non-Asymptotic Best Policy Identification Guarantees in Online Reinforcement Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T18:54:00.883532Z"},"links":{"citing_paper":"/paper/2607.17201"},"observation_digest":"sha256:596fd95aa1d89c094d6c275d3f61da69c3612d40e7d2d147e071dde47a44773a","observation_id":"a29c040a-498a-4498-9d0d-dd22925ba511","resolution":{"observed_at":"2026-08-01T18:54:00.883532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:54:00.937068Z","title":"Taupin, Y","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17201","last_updated":"2026-07-19T11:48:09Z","snapshot_observed_at":"2026-08-14T19:16:59.144744Z","submitted_at":"2026-07-19T11:48:09Z","title":"Non-Asymptotic Best Policy Identification Guarantees in Online Reinforcement Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T18:54:00.937068Z"},"links":{"citing_paper":"/paper/2607.17201"},"observation_digest":"sha256:6adc7ce914d6cb693ae3f3abdc89cdc64965116a8fa04bcb90eeeb66c38e8f75","observation_id":"73eadf8b-3c6d-4b0a-bfa7-1eb5171673f6","resolution":{"observed_at":"2026-08-01T18:54:00.937068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:54:00.975367Z","title":"Tuynman and R","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17201","last_updated":"2026-07-19T11:48:09Z","snapshot_observed_at":"2026-08-14T19:16:59.144744Z","submitted_at":"2026-07-19T11:48:09Z","title":"Non-Asymptotic Best Policy Identification Guarantees in Online Reinforcement Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T18:54:00.975367Z"},"links":{"citing_paper":"/paper/2607.17201"},"observation_digest":"sha256:c41e65cefe94e7a65d5bd7c1f35c47d266fe534595af53d8597290cc70e2da06","observation_id":"78ae6ba3-d871-475b-9c6b-9e31467066b0","resolution":{"observed_at":"2026-08-01T18:54:00.975367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:54:01.031230Z","title":"Zalinescu","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2607.17201","last_updated":"2026-07-19T11:48:09Z","snapshot_observed_at":"2026-08-14T19:16:59.144744Z","submitted_at":"2026-07-19T11:48:09Z","title":"Non-Asymptotic Best Policy Identification Guarantees in Online Reinforcement Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-01T18:54:01.031230Z"},"links":{"citing_paper":"/paper/2607.17201"},"observation_digest":"sha256:08a2093ee39dd649904e2d6192de51bc399b5e358334c6a7e5f2e0010ad11990","observation_id":"dc1d2a00-e8be-4281-88aa-fd7bc1184742","resolution":{"observed_at":"2026-08-01T18:54:01.031230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:54:01.101340Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17201","last_updated":"2026-07-19T11:48:09Z","snapshot_observed_at":"2026-08-14T19:16:59.144744Z","submitted_at":"2026-07-19T11:48:09Z","title":"Non-Asymptotic Best Policy Identification Guarantees in Online Reinforcement Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-01T18:54:01.101340Z"},"links":{"citing_paper":"/paper/2607.17201"},"observation_digest":"sha256:65c8a6072b7f511c7717fd49d7c3731967d653a58061501b66d91dc69ba0f2dd","observation_id":"e79e6aa5-05e1-4189-afa2-4290b4bd6dd3","resolution":{"observed_at":"2026-08-01T18:54:01.101340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:54:01.147324Z","title":"Lemma 42.Let Ω⋆(M) := ( ω∈Ω(M) inf M′∈Alt(M) X s,a ω(s, a)KL(P(s, a), P′(s, a)) = (T⋆(M))−1 )","venue":null,"work_id":null,"year":1994},"citing_paper":{"arxiv_id":"2607.17201","last_updated":"2026-07-19T11:48:09Z","snapshot_observed_at":"2026-08-14T19:16:59.144744Z","submitted_at":"2026-07-19T11:48:09Z","title":"Non-Asymptotic Best Policy Identification Guarantees in Online Reinforcement Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-01T18:54:01.147324Z"},"links":{"citing_paper":"/paper/2607.17201"},"observation_digest":"sha256:d92f7da9b852187227e1f87d6fe59c2d7995404395c7ea23f4a67da017b483b8","observation_id":"c115e5c2-e857-4ce1-92bb-b79578246156","resolution":{"observed_at":"2026-08-01T18:54:01.147324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.17201","last_updated":"2026-07-19T11:48:09Z","latest_version":1,"primary_category":"stat.ML","snapshot_observed_at":"2026-08-14T19:16:59.144744Z","submitted_at":"2026-07-19T11:48:09Z","title":"Non-Asymptotic Best Policy Identification Guarantees in Online Reinforcement Learning"},"reference_resolution":{"displayed":37,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":36,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":37},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 37 of 37 outbound references and 0 inbound Pith citation observations for arXiv:2607.17201."}