{"as_of":"2026-08-19T14:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4aa2f1f47a3189e4a1b62dd3e26a9f62382cc409b38115c242545c54bd316b87","coverage":[{"denominator":89,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":89,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-01T06:55:27.313461Z","state":"measured"},{"denominator":89,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":89,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.31769/citation-record","integrity":"/paper/2606.31769/integrity","json":"/paper/2606.31769/citation-record.json","paper":"/paper/2606.31769"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.238205Z","title":"International Conference on Machine Learning , pages=","venue":null,"work_id":"5e62a303-893e-4edf-950c-3a5893545525","year":2023},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:8f594c630c7a37fce44c02df3c55fa8d4326fcc8abc06d5a67b49378f98d046e","observation_id":"14d4c429-7d32-4c9f-8a3e-03f50fc6269c","resolution":{"observed_at":"2026-07-06T16:52:40.239431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.379326Z","title":"Conference on Learning Theory , pages=","venue":null,"work_id":"2023962b-8fb9-4396-bced-f785d072d8bb","year":2022},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:2428d25ff25c9aa53a7397049103155fb5538855ff0d8246ecf84b1ba670585b","observation_id":"73453eab-37e1-4f8b-967b-65daaab3520b","resolution":{"observed_at":"2026-07-06T16:52:40.381207Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.339722Z","title":"Near-optimal Regret Using Policy Optimization in Online","venue":null,"work_id":"63234612-f939-40ee-8097-8bde990238cd","year":2025},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:542e94ff659da623bfe4091931c169ef07cfd7fa39539a67f7977876d1eff947","observation_id":"5db8998b-34fe-4760-8bcb-c3c0c5d4d7c8","resolution":{"observed_at":"2026-07-06T16:52:40.341134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.344478Z","title":"Proceedings of the 41st International Conference on Machine Learning , pages=","venue":null,"work_id":"8e8475bb-1e6f-48cf-b186-0debeb093c09","year":null},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:8951fd67c0029b3f906b913f8ff339008db5c485e80837d5afbfb80174a2208a","observation_id":"5c621f20-e926-409d-ac62-4cb6a505d1c8","resolution":{"observed_at":"2026-07-06T16:52:40.345951Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.338029Z","title":"International Conference on Machine Learning , pages=","venue":null,"work_id":"c5c3c4cc-aa78-4bc9-995c-c5bf98f0135e","year":2019},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:2cb4c7325ca30ec185a4c71a380fd47ead265b31b3ca6fff4088678435b69d5e","observation_id":"05a895cb-c2dc-4d63-b849-3a6d1a0eb3f3","resolution":{"observed_at":"2026-07-06T16:52:40.339102Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.332887Z","title":"Proceedings of the 34th International Conference on Machine Learning , pages =","venue":null,"work_id":"7daebf19-3222-4b12-88d8-8dbac1af9c1b","year":2017},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:51f0200591863df2df3b2a24aacc8d6224acedd1ccd9f3bf59e0a4fc34709fd2","observation_id":"20323228-acb9-4341-9b07-f2fe5683d9ed","resolution":{"observed_at":"2026-07-06T16:52:40.334006Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.268283Z","title":"Proceedings of Thirty Fourth Conference on Learning Theory , pages =","venue":null,"work_id":"6e538f88-625a-4fa8-b2ab-c915251f9c97","year":2021},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:28bc54c4d5d34b510ff49ecc76ae97edf989154511897d0e7080e086194b03d2","observation_id":"b571c96a-376b-4eaf-bbdc-16a809693033","resolution":{"observed_at":"2026-07-06T16:52:40.269768Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.325884Z","title":"International Conference on Machine Learning , pages=","venue":null,"work_id":"7d2358e3-e10b-4502-be79-6320e3284351","year":2023},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:1036b4215001c6af7660e5e8aecf4179538280ff72dfa181f136244a10cd04c9","observation_id":"85d2836e-8a92-4c80-b93e-fb39356e84a9","resolution":{"observed_at":"2026-07-06T16:52:40.326980Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.395570Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular","venue":null,"work_id":"a8160bd8-d9d0-4b3d-adde-d96df708c5ba","year":null},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:aa78cec3a40be4df16fc59e60987de99938bfc5eae72a9f90539834915eb3f63","observation_id":"3225afe0-49ef-4e5b-8a53-0a08dec03ee8","resolution":{"observed_at":"2026-07-06T16:52:40.397181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.359476Z","title":"Non-Asymptotic Gap-Dependent Regret Bounds for Tabular","venue":null,"work_id":"71e37a3b-eabc-42e3-9451-113a6f16cc35","year":null},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:cb7c206ab3cccb5735a46b56188af07ece85d48ef7786a5ecbfc023348162c5f","observation_id":"9ccd5974-909c-460a-b790-a20d1b0c7391","resolution":{"observed_at":"2026-07-06T16:52:40.361225Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.356826Z","title":"Online learning in episodic","venue":null,"work_id":"ad19efc1-630b-4540-af70-5d274634470d","year":null},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:2cba0f8dcbd13cdd009b4264187fe3111922ac3b10378aee07248f7255f7314e","observation_id":"b960668c-5eb9-44c5-b74c-b90e2bfd2736","resolution":{"observed_at":"2026-07-06T16:52:40.359031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.318668Z","title":null,"venue":null,"work_id":"a727cc46-e596-4476-a888-1e0eb1eabb56","year":null},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:e31f2dd9bebb9e26de1379975c57019a1202d77e8ece597bc2e8877be92d5575","observation_id":"5a1fb6b0-2645-4226-a0fc-8d077f6a329c","resolution":{"observed_at":"2026-07-06T16:52:40.319840Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.267373Z","title":"Learning Adversarial","venue":null,"work_id":"35feefa4-4968-476b-a30b-021fee788762","year":2020},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:bf62e8aa328e38a689a1f715374c731c3954de7d8dd024beb95eceeffaaa5cb1","observation_id":"45594917-e06d-48fe-81ec-bc38916cfaed","resolution":{"observed_at":"2026-07-06T16:52:40.268635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.315259Z","title":"Policy Optimization in Adversarial","venue":null,"work_id":"baddd0a9-9c80-4310-ba4a-279ed8f83a61","year":null},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:6dbb8dcef9128229f79137e35cc1d7e30b0525b97743e47466a0ed47c8e302cd","observation_id":"1757f675-696d-435d-adb6-25d277b97c66","resolution":{"observed_at":"2026-07-06T16:52:40.316384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.369426Z","title":null,"venue":null,"work_id":"c2b1285f-4d07-46dd-a32a-e0e392d6c73b","year":null},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:62695d31ef5a09ab56d18620987881967f264c4cb087cfd15797c1980a4167d6","observation_id":"f194eb67-45c9-4105-b804-02d92d4f7fab","resolution":{"observed_at":"2026-07-06T16:52:40.370981Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.311550Z","title":"Laurent and P","venue":null,"work_id":"b76d13f4-4b48-4c56-a0d3-67236340d409","year":null},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:037c21dd99434cb92645fd1cb017be523fae4cec1e2af83ac3e3088aa0968a74","observation_id":"6eb8e578-5ca1-4ca1-948b-67c146c569f9","resolution":{"observed_at":"2026-07-06T16:52:40.312811Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.258064Z","title":"Refined Lower Bounds for Adversarial Bandits , volume =","venue":null,"work_id":"3bed02cd-ca23-401c-943b-518a784bb1d6","year":null},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:f49e7bda88511c3bf4f7e6c73295372c2edaa1615a26235c987b4f6f03dcf2d6","observation_id":"c0992d9e-a455-4916-839e-cfc95685db02","resolution":{"observed_at":"2026-07-06T16:52:40.259880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.320546Z","title":"Probability and Mathematical Statistics , volume=","venue":null,"work_id":"f03b93eb-46cc-4702-89f5-4458c1685c9d","year":2010},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:99580749ab22683b48273731829d85958e43159be1f223d97a5fd4b94ec9c231","observation_id":"0bdcf0ce-552d-4d47-8257-9bae3ad77771","resolution":{"observed_at":"2026-07-06T16:52:40.321775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.324229Z","title":"2013 , month =","venue":null,"work_id":"c3264625-2da9-43d8-90fc-5ece8fda9f12","year":2013},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:833b1910ce0cc2d89fc8c60c3c9f4c5f090a698c8e83279206a3d38ed5377b29","observation_id":"33c6b8d8-f7ab-4633-9ba0-64cd2dbc7cd0","resolution":{"observed_at":"2026-07-06T16:52:40.325340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.331163Z","title":"Tuning Bandit Algorithms in Stochastic Environments","venue":null,"work_id":"2edf1261-5129-4723-a359-5b573433e5cb","year":2007},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:502bdd3abdcce8dc3ba77d4ed1a84c9e7c56b1ba30d4aad331fedf50773a96cf","observation_id":"1fa971e0-eb76-43ac-98ed-64bf069def4f","resolution":{"observed_at":"2026-07-06T16:52:40.332323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.393212Z","title":"Online Convex Optimization in Adversarial","venue":null,"work_id":"ce45cfff-33f4-4ec2-b53f-557b1370c49b","year":2019},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:25336a458526c5c05d3568b50f459e960b3852c72d93fcdf77e0fa5076ccb02a","observation_id":"dad72bcb-cd68-4dcc-a782-f0aab952156a","resolution":{"observed_at":"2026-07-06T16:52:40.395018Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.290734Z","title":"Proceedings of the 37th International Conference on Machine Learning , pages =","venue":null,"work_id":"388f0414-7572-4c07-9cac-424a8501c234","year":2020},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:3d9c48ae659f076a3d180f5b84c345343938f79e21644509221961bacca77c6c","observation_id":"eec37106-7870-4a44-9e85-da8a6caff019","resolution":{"observed_at":"2026-07-06T16:52:40.292144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.221975Z","title":null,"venue":null,"work_id":"186de941-c614-4ac4-8387-28ab73b92841","year":2009},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:bef166ba86e6f766b6c807f42a927f78c2e81e0a76aa97d446729354fdf91a6a","observation_id":"d7911cad-e059-45e1-a737-dd470191f0d3","resolution":{"observed_at":"2026-07-06T16:52:40.223530Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.404503Z","title":"Online Markov Decision Processes under Bandit Feedback , volume =","venue":null,"work_id":"abf36cc1-cd01-4f18-b458-f33b57ad48c1","year":null},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:d83d188e6e7a88f712b58d2633656e2d4cf883e1df2d1252104f79061b7d1255","observation_id":"18fba09c-b30e-4ca9-9633-30eff050de10","resolution":{"observed_at":"2026-07-06T16:52:40.406021Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.402447Z","title":"Learning adversarial","venue":null,"work_id":"0ca474a3-4d38-44ef-8238-874285518475","year":null},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:dcab306f458b4694052d78a79adb64807cd689f4ce5b8a85a3e2d125e75ef179","observation_id":"3c4833ef-90c9-4662-99dc-7722f431363e","resolution":{"observed_at":"2026-07-06T16:52:40.403917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.296050Z","title":"Near-optimal regret for adversarial","venue":null,"work_id":"816d5519-6e4d-4110-919b-40d76482361e","year":null},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:f39c0fd0e4d8dab8abfc1768311367565b17c0e7e8c1518c9fec817fa4f50975","observation_id":"8aeca06b-870a-4d02-9d44-e1de777d92ef","resolution":{"observed_at":"2026-07-06T16:52:40.297517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.273791Z","title":"Delay-Adapted Policy Optimization and Improved Regret for Adversarial","venue":null,"work_id":"d7d0c3f5-9553-499d-8a77-387323354ac2","year":2023},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:4d64f3f54288335910ed8f69f7bdb41bb349adf03f12e645d16ca57203fd7feb","observation_id":"ef4a2f62-5098-4b17-9e9a-c3301233296b","resolution":{"observed_at":"2026-07-06T16:52:40.275251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.406576Z","title":"Finite-Time Analysis of the Multiarmed Bandit Problem , year =","venue":null,"work_id":"2974fbc8-1d6b-42c1-b6f7-ca482805fd12","year":null},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:22cace35b21330c1db31711a27d6c9eb99e9cbfcb453b1ace4e3bb0352f68afb","observation_id":"0e56bc8f-e625-4ed1-88c8-0fa5f1e6c559","resolution":{"observed_at":"2026-07-06T16:52:40.407915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.400492Z","title":"Journal of Machine Learning Research , year =","venue":null,"work_id":"c76f25b8-ab27-4ffb-845b-fac4611bc0e4","year":null},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:40e63daed93f93c949d7b857bdebef0045efb719531164bc222b4aad52001f5f","observation_id":"55f4fc67-b198-4ae1-bcde-4649e38d84c1","resolution":{"observed_at":"2026-07-06T16:52:40.401904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.299982Z","title":"Proceedings of the 25th Annual Conference on Learning Theory , pages =","venue":null,"work_id":"2583ffec-6be9-4712-bbba-c319bcded5c3","year":2012},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:3a510e1468fb2b8b20dd15598de73edd4aadc443106ac0e52f8be9c8e40754be","observation_id":"79b11b62-41de-4c04-958e-5faa2952870a","resolution":{"observed_at":"2026-07-06T16:52:40.301336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.313328Z","title":"Simultaneously Learning Stochastic and Adversarial Episodic","venue":null,"work_id":"fed571e8-d36d-4717-b062-ff45c0ee5aef","year":null},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:8d5c1333990c4fef6b09cd9a1efc56f47f3595fd7cfc3ce58764a80d6ac8cbf3","observation_id":"61c2ad1d-8f56-4911-8464-6682442becd8","resolution":{"observed_at":"2026-07-06T16:52:40.314549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.367034Z","title":"The best of both worlds: stochastic and adversarial episodic","venue":null,"work_id":"e3a4bac9-2139-4153-b2a4-baf1c8d3f4d3","year":null},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:38702292d39d0f86c8e62f530bc2bd3ec43a6bda4b527a8e771769a2d428247d","observation_id":"ead8046c-1c24-467a-bf8d-e9d780a30add","resolution":{"observed_at":"2026-07-06T16:52:40.368711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.271891Z","title":"Proceedings of the 31st Conference On Learning Theory , pages =","venue":null,"work_id":"8324ead2-15ad-4452-b33d-d50b6239d1eb","year":2018},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:fa910738fb93e6aa9309ea5093a3b87a9a90ff5066cc5fbdb8af7b02f718a379","observation_id":"b7a99ceb-326d-47e8-8956-00025523569a","resolution":{"observed_at":"2026-07-06T16:52:40.273202Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.393419Z","title":"Tsallis-","venue":null,"work_id":"f8184647-7130-4b44-8033-5a5efcad668b","year":null},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:918c8a0b6d52a6cd1dbf12425e9376c2b5f78a18e46446177063da9c6b7c6697","observation_id":"7b6acfcb-4b3a-458a-82c3-a25c9792852a","resolution":{"observed_at":"2026-07-06T16:52:40.395203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.376994Z","title":"Improved Analysis of the","venue":null,"work_id":"85850cea-6c6d-424e-853d-4ed02cbdcd4a","year":2021},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:d1c170dd3398721ff220101185dad132382cfa4c579f911f5b752dcb3aee441d","observation_id":"283ef0d8-b7d3-4af1-88de-a7227d4cc57e","resolution":{"observed_at":"2026-07-06T16:52:40.378556Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.334548Z","title":"Proceedings of the 36th International Conference on Machine Learning , pages =","venue":null,"work_id":"e4631c78-0229-4abb-ad87-a11b1f2c9944","year":2019},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:6e0286f2a6ebef71cde06cab4d9d3b5c0513f6e4c8c150a39d2306529517b9f1","observation_id":"1ad86420-6132-4b63-bdcf-211a82a68f68","resolution":{"observed_at":"2026-07-06T16:52:40.335767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.383633Z","title":"Proceedings of Thirty Fourth Conference on Learning Theory , pages =","venue":null,"work_id":"18242906-ef63-4397-82ce-a4c0e877b814","year":2021},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:8ba1a1d759c389be3dfbc65db6fdb109040517f4085b57d1adedca0401ae51c5","observation_id":"069f8c57-4db0-4a62-9e12-88cdce021f82","resolution":{"observed_at":"2026-07-06T16:52:40.385429Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.307861Z","title":"Towards Best-of-All-Worlds Online Learning with Feedback Graphs , volume =","venue":null,"work_id":"be42ead4-e483-42d0-94ad-723dbef685ad","year":2021},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:3a36b0a061d85d2949c2799018275bdc610a958e1b932f231836e30003088987","observation_id":"f3a43589-aff7-4c0a-9851-de826d671e9d","resolution":{"observed_at":"2026-07-06T16:52:40.309320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.288007Z","title":"Proceedings of The 27th Conference on Learning Theory , pages =","venue":null,"work_id":"fef0a689-1ccf-4a72-b6c9-6f16f4a50680","year":2014},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:2e9c5e75f5d7805c8b843cb9baf988f521d64865498f5884cf34d47e0ae21529","observation_id":"65157022-e1de-4bf0-9fcc-b32a67f06990","resolution":{"observed_at":"2026-07-06T16:52:40.289311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.228984Z","title":"Proceedings of the 31st International Conference on Machine Learning , pages =","venue":null,"work_id":"ca3e9682-9723-4775-acbc-dbd66765349f","year":2014},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:c0145be8f3421054ddfabaf79ba9c8962984ff92b80683ab592584f716dc2319","observation_id":"d29675b0-ca26-420e-8511-4cd3846ba2eb","resolution":{"observed_at":"2026-07-06T16:52:40.230166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.294082Z","title":"29th Annual Conference on Learning Theory , pages =","venue":null,"work_id":"0191e8d8-6027-482c-8c18-ff155cc38e9f","year":2016},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:7c36e955524258b1b04d5b27badd2045bbdc5266434a64483fd887a95332efbc","observation_id":"b80e341a-a2d8-42a5-9890-bf1c7145cf5b","resolution":{"observed_at":"2026-07-06T16:52:40.295280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.235642Z","title":"An Improved Parametrization and Analysis of the","venue":null,"work_id":"e5c1efa8-a74d-4f53-a5d4-97513e0570c4","year":2017},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:999ef63b014a8aea49a33f17a339f3d451874d61dd66c68d4073517245205654","observation_id":"88bc35d7-fde4-467b-aa22-8d35e6dd8b77","resolution":{"observed_at":"2026-07-06T16:52:40.237992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.264921Z","title":"Adapting to Stochastic and Adversarial Losses in Episodic","venue":null,"work_id":"03325894-2e43-41b3-86e8-a57a07087456","year":null},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:6871d3807fa2f5dab775f39443a31338cff2c5559e307668a5630dd5b39b97dc","observation_id":"1fc76744-10bb-4bad-9298-0f5893c21a12","resolution":{"observed_at":"2026-07-06T16:52:40.266508Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.372064Z","title":"Proceedings of Thirty Sixth Conference on Learning Theory , pages =","venue":null,"work_id":"f29a8efb-be92-4166-a3aa-af32e5c6d359","year":2023},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:ebc1ca1ea052c1deced978110fd6b2c0080dc9bd7ee68f2ba7d555b30436ba12","observation_id":"30f6b5b5-eda3-4ef6-a4b1-46800372c064","resolution":{"observed_at":"2026-07-06T16:52:40.373563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.336282Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":"311f4ece-bb4b-42b1-8f8a-180bd07a6e0a","year":2024},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:1bc84a307cb3f65d69de73fb0240494cb3b5f85802922a5840e45d86222a6d30","observation_id":"ce6b0064-2ed7-49a0-b78b-04f67489f4c6","resolution":{"observed_at":"2026-07-06T16:52:40.337481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.400355Z","title":"Proceedings of Thirty Sixth Conference on Learning Theory , pages =","venue":null,"work_id":"1f0eec96-6c97-4b24-b2a0-a92612bb0cf1","year":2023},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:888a1c9d3f0667e5130781490c5baa629b60cdc1222031421df84568ae3ee803","observation_id":"ef46ec24-05b7-4742-ba9a-e616892f0806","resolution":{"observed_at":"2026-07-06T16:52:40.402086Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.346766Z","title":"Proceedings of The 26th International Conference on Artificial Intelligence and Statistics , pages =","venue":null,"work_id":"acf9d84c-efbd-41f7-89f7-344a32f3e923","year":2023},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:35d3858f848927392fb5554a0a3a7a5687e2368bc2aec6c78aa54130eb93f822","observation_id":"c8b63570-73c8-4d00-9521-052f06db5f20","resolution":{"observed_at":"2026-07-06T16:52:40.348423Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07307","last_updated":"2025-07-07T14:25:36Z","snapshot_observed_at":"2026-08-16T12:42:34.107965Z","submitted_at":"2025-04-09T22:07:01Z","title":"Follow-the-Perturbed-Leader Approaches Best-of-Both-Worlds for the m-Set Semi-Bandit Problems","version":4},"cited_work":{"arxiv_id":"2504.07307","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.07307","snapshot_observed_at":"2026-07-01T08:55:35.890881Z","title":"arXiv preprint arXiv:2504.07307 , year=","venue":null,"work_id":"ffc099b0-5c98-45a8-8706-5ffcc3e47fcd","year":null},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"cited_paper":"/paper/2504.07307","citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:09f4c81064120c19f3568d524bebea82e4ed1f011f45d397fa79108963403d92","observation_id":"f761abec-1550-4e4b-8410-5c0bfe4d2265","resolution":{"observed_at":"2026-07-01T08:55:35.892402Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.227104Z","title":"International Conference on Artificial Intelligence and Statistics , pages=","venue":null,"work_id":"7f268866-b5f8-4e1a-a121-577127258d7c","year":2025},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:335f6181a19a03fd0b2bca453648951c72148b23ecbba29937c370d9fabfc5da","observation_id":"b079470e-a09c-47a0-bd46-652dc5cec595","resolution":{"observed_at":"2026-07-06T16:52:40.228386Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.405006Z","title":"Proceedings of the 38th International Conference on Machine Learning , pages =","venue":null,"work_id":"a67bc76a-355f-4cc0-ba0d-63f1da171766","year":2021},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:cd348c70d7e2fecb683b2ad6e0b04563f1e49ff9d519e574693769657f4eb83e","observation_id":"7351568b-25a9-4068-b13f-e3efda3a9fad","resolution":{"observed_at":"2026-07-06T16:52:40.406228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.351661Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":"f1dd4b12-77a1-4bf2-90a8-21db1a8a5dda","year":2022},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:be17aa195cc95f401deb0d24772adab8cfd74093c16287ce05a22cab9a33e86d","observation_id":"975437ad-7c4b-4ea9-8ca0-5cc0b847ecbb","resolution":{"observed_at":"2026-07-06T16:52:40.352860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.322325Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":"49511c2f-35d4-4b95-b94f-6c549e8dbc1f","year":2023},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:c663e21f76b96e350acd623f4dacbe3f0713f70fe03f59b297cde77693c9be8e","observation_id":"ebe4fd21-114e-47a6-9268-908d3f87c90c","resolution":{"observed_at":"2026-07-06T16:52:40.323736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.374438Z","title":"International Conference on Algorithmic Learning Theory , pages=","venue":null,"work_id":"81405768-9e79-472e-9662-2eecfb70f8f7","year":2006},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:20745d43824577a3daa4ab6ace839c69668a289a9047202f3693692df1c220a4","observation_id":"18ef48be-ef84-4f11-ac6e-5a0301de82d1","resolution":{"observed_at":"2026-07-06T16:52:40.376249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.269397Z","title":"Bias no more: high-probability data-dependent regret bounds for adversarial bandits and MDPs , volume =","venue":null,"work_id":"e45f361a-cafa-4814-9fe1-b179f704489b","year":null},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:343f7d735f18f710f5cd036b726a1fd7714c737087701b6f43f481839447d376","observation_id":"f5336e48-97d2-452f-b844-47925bb868f2","resolution":{"observed_at":"2026-07-06T16:52:40.271271Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.246738Z","title":"Journal of Machine Learning Research , year =","venue":null,"work_id":"85e1e6a6-f78d-47ea-a804-7146920b54db","year":null},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:72d29db12b59ea331a35b0e985992051bb30919da3403cb7ef3df8236ae54921","observation_id":"49eaa7ff-e90a-4c68-8843-76c717c97ab1","resolution":{"observed_at":"2026-07-06T16:52:40.248384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.298171Z","title":"Proceedings of Algorithmic Learning Theory , pages =","venue":null,"work_id":"2b82dc3e-27e0-429d-82f0-62bd5e3d3aeb","year":2018},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:efb671ae586abaeccaa391fcd4461da9457e069f44ad3522b9f6677f2db60a92","observation_id":"08eb070e-a267-4f22-a582-9e9212c0c8cb","resolution":{"observed_at":"2026-07-06T16:52:40.299423Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.387292Z","title":"Proceedings of the Thirty-Second Conference on Learning Theory , pages =","venue":null,"work_id":"c5f1ea92-2e36-4104-82e1-ef7d50fa5a28","year":2019},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:d49413761df2bbb59544ed1511b06060fc8a69b10f7ec453bebbcdc094d2b7cb","observation_id":"0b9b304d-242e-44b7-9f9e-5a9ae06d0959","resolution":{"observed_at":"2026-07-06T16:52:40.388785Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.389387Z","title":"Proceedings of the 28th Conference on Learning Theory , pages =","venue":null,"work_id":"47103aaf-3b8a-455a-b212-d31a5bf07d00","year":2015},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:14a8e7203abaf29ca525114a46e2f5d669e07a43950d0beceb0db804056f81a3","observation_id":"b2b371ee-f2dc-41f4-a3ae-5e9bcb46a8b2","resolution":{"observed_at":"2026-07-06T16:52:40.390680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.275897Z","title":"Improved Best-of-Both-Worlds Guarantees for Multi-Armed Bandits:","venue":null,"work_id":"ef16ed57-4b43-4e36-997a-6fe1cd36eddb","year":2023},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:8c798daf962990c353495cfb63fcabe8b93001445aeb6da9df453c8dc06934fb","observation_id":"2719bc76-2c44-4fdf-8959-5355e859fa57","resolution":{"observed_at":"2026-07-06T16:52:40.277184Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.329303Z","title":"Gap-Dependent Bounds for","venue":null,"work_id":"6d69f0a5-b911-4823-8085-26e76da3d439","year":null},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:a4f1c7585f4bc8585d4d7ee466f1d68e74f5362e741b07cb1b93d27f2621d0a9","observation_id":"ad6ab9f6-3957-433f-bbf8-240cbc4db948","resolution":{"observed_at":"2026-07-06T16:52:40.330346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.257578Z","title":"Proceedings of the 26th Annual Conference on Learning Theory , pages =","venue":null,"work_id":"151b60ef-4c59-4974-be91-baf2b4a4b129","year":2013},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:05b098d59a90adee9c93dee5d3b77de13e58cedbb88741435ef946cb75051959","observation_id":"734b30cd-ee00-4ded-b903-214fa1599dbd","resolution":{"observed_at":"2026-07-06T16:52:40.258818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.390945Z","title":"Proceedings of the 31st International Conference on Machine Learning , pages =","venue":null,"work_id":"4b94424e-9074-4b63-a852-85951813b8c8","year":2014},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:1ebf911e657cb7680263b3c5d53201b96ae7d0c3611ce5554e904a19e916a5bb","observation_id":"7a008eb7-8a0f-433c-aab6-24c3fe8865e9","resolution":{"observed_at":"2026-07-06T16:52:40.392809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.262648Z","title":"SIAM Journal on Computing , year =","venue":null,"work_id":"312c9d8a-a3c5-4971-add9-bf2fc4333131","year":null},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:69a5e8403625eda2c28c5da9516476c875742ec5c94db880a9c1d9c61da9b4a9","observation_id":"05a66b6a-d885-4d27-bf79-232c002494e2","resolution":{"observed_at":"2026-07-06T16:52:40.264201Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.398290Z","title":"Proceedings of Thirty Eighth Conference on Learning Theory , pages =","venue":null,"work_id":"3a25e8b3-878a-43a5-8371-7d2c69386611","year":2025},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:f090bfa8b48e9c0423bfa77d7db923e739a2dd0abd5c024eb4af0b4e1264686d","observation_id":"16a038d2-a79f-469d-afdb-a9a93c832959","resolution":{"observed_at":"2026-07-06T16:52:40.399941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.289878Z","title":"Proceedings of the Nineteenth International Conference on Machine Learning , pages=","venue":null,"work_id":"08c6ab0c-7644-40c5-a900-32c3f55266ad","year":null},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:8634a467df68362f1a09f85493b1e9720deca568f947981f01ab532c3b7edb3a","observation_id":"1f334187-8f02-4e90-b1f0-4194950b9dd9","resolution":{"observed_at":"2026-07-06T16:52:40.291102Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.384425Z","title":"Proceedings of the Fifteenth International Conference on Artificial Intelligence and Statistics , pages =","venue":null,"work_id":"8e625d61-205b-4f0d-b08d-d49acddc2cae","year":2012},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:44477f1a6812bf7424cc1d921162524b29d60adfc2728eb66e7ca4906bf41eac","observation_id":"d1c1ef9b-7c8e-4ab8-87f0-75b1bede660e","resolution":{"observed_at":"2026-07-06T16:52:40.386464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.376471Z","title":", author=","venue":null,"work_id":"2e4d6f67-bc12-41af-9cee-68bc5d3ed397","year":null},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:b19b28a27df619fab4d0133d10409b6d0c5c2f961140d424b7c404e426b6354a","observation_id":"46308e1a-e16c-4827-8310-11d5b19ee355","resolution":{"observed_at":"2026-07-06T16:52:40.378348Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T17:32:42.819018Z","title":"IEEE Transactions on Neural Networks , volume=","venue":null,"work_id":"eec91aba-0fe6-49d1-9ce3-9b364aca43b3","year":1996},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:27ce04c3d580af4b3c6389bfa23fa1ab1711f4e2370920003a5ff210b2c73055","observation_id":"b9eb6bdc-d7d5-4fa2-9b68-cd3649abfeab","resolution":{"observed_at":"2026-07-06T16:52:40.325515Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.402722Z","title":"2003 , booktitle =","venue":null,"work_id":"f05aba92-a65c-4762-9d14-8b06d3dd13ac","year":2003},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:10a10beb0ee022807a1b418f96a38e6c2f9beed60c885055347ad2fb69578ac6","observation_id":"56f0e67a-ed8d-45aa-aa73-4392dea58ee7","resolution":{"observed_at":"2026-07-06T16:52:40.404206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.350784Z","title":"Information and Computation , volume=","venue":null,"work_id":"b286b2be-aeae-465e-a29e-a3c3d5fd63a6","year":1994},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:36a5b3705b8244f59fb943912eca1a1ada6ca8fdf8078b7c20c2e8df64c9e6d6","observation_id":"c2186f21-3fad-4ae9-a1c9-031e754cf68f","resolution":{"observed_at":"2026-07-06T16:52:40.352052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:27f42e19eec74721726f0d2fac57a7219d85ae0d68418b123e68430673fa5d3b","observation_id":"d0a6b86b-a741-4147-bdca-1198d3ff7a38","resolution":{"observed_at":"2026-07-01T08:55:35.889593Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.255261Z","title":"and Veness, Joel and Bellemare, Marc G","venue":null,"work_id":"01fba85c-d0ff-4a68-b89b-c07b6621a271","year":null},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:414cad9d3fd6a1c62c8ff3fc6c95078bb3ae7abe2dcb8f9887f27e4682a726a7","observation_id":"5dac5bd2-ce00-4818-83e5-6edfbfc22023","resolution":{"observed_at":"2026-07-06T16:52:40.256923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.371251Z","title":"Nature Medicine , volume=","venue":null,"work_id":"1b2466f9-bf42-44d2-a4f2-70309f7fdebc","year":null},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:c868e93f9667fd4e0293176d250d5167f76926e2c2fa8c6919b1ba3cb2500951","observation_id":"64ef28e4-d109-4630-8e76-61f152b6f25f","resolution":{"observed_at":"2026-07-06T16:52:40.372950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.327494Z","title":"Empirical","venue":null,"work_id":"5cd7e9ef-cbf5-48e6-89e9-710f2e343d07","year":null},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:808d764bdb5a0664ad8af87ca467c33c2848de4a3a0f78462f1503393a0a552d","observation_id":"6b2b7331-052d-422e-913b-d221591b1cf7","resolution":{"observed_at":"2026-07-06T16:52:40.328708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.381419Z","title":"Proceedings of the 25th Annual Conference on Learning Theory , pages =","venue":null,"work_id":"435def41-7c2a-4cdc-89ba-b9d300ce54c1","year":2012},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:e1e1d204c8a95e3aa93285d5e46355d9bfa048ccce379ffb4b67bf8cae8383ba","observation_id":"02221255-3002-405d-9dea-7106dafe63e7","resolution":{"observed_at":"2026-07-06T16:52:40.383001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.277827Z","title":"Reinforcement Learning from Adversarial Preferences in Tabular","venue":null,"work_id":"e55e7734-64f8-400a-9c9a-e2ee69e8deba","year":null},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:4c6a79d9ad2fc6736d6aeaa9e2c35d64a8df24e674c5795190e95dd5a05f0e74","observation_id":"0e3c5536-7364-4b30-bac2-00b4f2c0ab60","resolution":{"observed_at":"2026-07-06T16:52:40.279149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.285972Z","title":"Proceedings of Thirty Seventh Conference on Learning Theory , pages =","venue":null,"work_id":"6bf7bb9c-c5e2-45fa-bfa1-92bbaa01c3a8","year":2024},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:53d0610c6a4f09b907d4282cb93f60de56f6cca4b33c0dece6753e251918b84d","observation_id":"048475ad-6b6f-4e6d-82b6-f8446350cf73","resolution":{"observed_at":"2026-07-06T16:52:40.288156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.306117Z","title":"M arkov Decision Processes with Arbitrary Reward Processes","venue":null,"work_id":"8e2bf0cb-4308-4e64-a8f2-6181aee9914f","year":2008},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:1b4c3ecf89d4a922f809d61beac90e92b21b0b5bc8b6413a77020f5166d7c9a2","observation_id":"328d5ee9-e3a3-488f-a8d2-9aea70f402ed","resolution":{"observed_at":"2026-07-06T16:52:40.307301Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.309856Z","title":"Proceedings of Thirty Sixth Conference on Learning Theory , pages =","venue":null,"work_id":"5f5806e8-8967-4315-b700-e74d7eeb1908","year":2023},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:83b17e28b7305d73b8293f515481a9e1af278e74550a362736dce6b1dbd5d571","observation_id":"07fd084d-5d60-4008-855a-81960e3a7ce2","resolution":{"observed_at":"2026-07-06T16:52:40.311024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.233233Z","title":"Proceedings of the 39th International Conference on Machine Learning , pages =","venue":null,"work_id":"451e69eb-a94a-41b7-bbdf-0e0e2a45aa45","year":2022},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:ae3ab72ca7ff83aebe6a50a7593d63248ce47f0ff2a0d630a043cdf4e85443df","observation_id":"a85d3468-c1fd-4e7b-b48d-8c1283dbe9b1","resolution":{"observed_at":"2026-07-06T16:52:40.234774Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.304169Z","title":"2009 , author =","venue":null,"work_id":"8414a5b9-b52d-4dd8-a338-91c46644bf7a","year":2009},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:0a99fa4135b06e9839382b5acde7f9c4fa65e680a831d96cb3670d1ec2f2abcc","observation_id":"e9096485-519a-4d85-8e7e-de228c345a8e","resolution":{"observed_at":"2026-07-06T16:52:40.305606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.361887Z","title":"Stability-penalty-adaptive follow-the-regularized-leader: Sparsity, game-dependency, and best-of-both-worlds , volume =","venue":null,"work_id":"cd3f24cc-e86e-4e8c-9315-1c5cb5c280e8","year":null},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:7a788b5e8972e41b9efab9d59d3ce8bf52f3ac0f5d767d5922d1c176b7159014","observation_id":"b800689a-e08e-43bc-b1d7-7f7352943bba","resolution":{"observed_at":"2026-07-06T16:52:40.363486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.354481Z","title":"Episodic Reinforcement Learning in Finite","venue":null,"work_id":"0e1e919c-7dbd-4c59-8fc9-d722d0ce5ecd","year":2021},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:055afab50664106255cfd602fadff9dd0cedf2b14385a5d254fbaaa682a3be6d","observation_id":"abb9c9b2-1291-4586-9c3f-a45891fbcc19","resolution":{"observed_at":"2026-07-06T16:52:40.355915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.397931Z","title":"Proceedings of the Fourteenth International Conference on Artificial Intelligence and Statistics , pages =","venue":null,"work_id":"cd912487-65a6-4371-a100-281f7c03883a","year":2011},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:bd0b21f81bf9ed74d951eb12579c03f5cdd1847fdca8494e0ca473f2da29379e","observation_id":"2604cc15-1e64-45f0-b27d-a2c119553618","resolution":{"observed_at":"2026-07-06T16:52:40.399771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.353430Z","title":"International Conference on Machine Learning , year =","venue":null,"work_id":"44961756-415e-4e87-a054-04da1ff7e36f","year":null},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:74f63eb2d80678eec4e57a15751872ad6be1222e0aa951dc0eb845c0671ca533","observation_id":"6865871f-6166-4178-ad00-ffc61fb2db14","resolution":{"observed_at":"2026-07-06T16:52:40.354755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.367198Z","title":"Narrowing the Gap between Adversarial and Stochastic","venue":null,"work_id":"a8b624f4-b25a-41ff-bc5f-38e027204bb8","year":null},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:0ffc4bfc69374ce3ef0c417f4e1cb615c7aedb8e8a8d390ec6159f9005099272","observation_id":"5d6dfc3b-f803-42a3-a658-c37bc2f2bb6f","resolution":{"observed_at":"2026-07-06T16:52:40.368877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.316941Z","title":"Proceedings of the 32nd International Conference on Machine Learning , pages =","venue":null,"work_id":"c54039ce-f3bc-4873-bddf-fbd2bc62c4a2","year":2015},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:c40cd54ae054cd9538b87caaded32243ab744187cd02f6b6607bf074ff6eff59","observation_id":"40ba6c59-3631-4677-ba57-2d8ab9a7cc61","resolution":{"observed_at":"2026-07-06T16:52:40.318135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.341913Z","title":"Advances in Neural Information Processing Systems , publisher =","venue":null,"work_id":"4b2a5076-c9ba-476f-9781-a48b881f8e16","year":null},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:79e1fe7e73ad3a4922be0cce58e086e975c2c743245ae01b179b80272c63a644","observation_id":"1283848a-a0b0-449f-91e3-da4a95ad938c","resolution":{"observed_at":"2026-07-06T16:52:40.343968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.381826Z","title":"Fine-Grained Gap-Dependent Bounds for Tabular","venue":null,"work_id":"941b4eac-1be6-42b8-b016-e4fe2ab1e7d2","year":2021},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:0d56522f9c3d3b98f980641056b3ed9013dfb5bb2bee1fb840a47d6ad6b3edd3","observation_id":"65a0f318-5b1e-4248-81bb-e8d6426791b9","resolution":{"observed_at":"2026-07-06T16:52:40.383860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions"},"reference_resolution":{"displayed":89,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":3,"verified_exact":1,"verified_fuzzy":84},"total_outbound_references":89},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 89 of 89 outbound references and 0 inbound Pith citation observations for arXiv:2606.31769."}