{"as_of":"2026-08-16T08:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b816cacf9794677f9aeeb391c1405710b7e6045b96127a5125a102a55be39fa9","coverage":[{"denominator":85,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":85,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T09:55:59.660672Z","state":"measured"},{"denominator":85,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":85,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.29294/citation-record","integrity":"/paper/2607.29294/integrity","json":"/paper/2607.29294/citation-record.json","paper":"/paper/2607.29294"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:55:50.602622Z","title":"2018 , journal=","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.29294","last_updated":"2026-07-31T11:12:31Z","snapshot_observed_at":"2026-08-13T20:34:15.935730Z","submitted_at":"2026-07-31T11:12:31Z","title":"Sample Efficient Hierarchical Reinforcement Learning via Best Policy Identification","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-03T09:55:50.602622Z"},"links":{"citing_paper":"/paper/2607.29294"},"observation_digest":"sha256:0070e596750172ab60a4e915c33c37705067e3c31f4379d12f8c2afb846899a4","observation_id":"8cd91f56-d330-429c-97ff-6865c814b3f1","resolution":{"observed_at":"2026-08-03T09:55:50.602622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:55:50.654810Z","title":"Advances in neural information processing systems , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29294","last_updated":"2026-07-31T11:12:31Z","snapshot_observed_at":"2026-08-13T20:34:15.935730Z","submitted_at":"2026-07-31T11:12:31Z","title":"Sample Efficient Hierarchical Reinforcement Learning via Best Policy Identification","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-03T09:55:50.654810Z"},"links":{"citing_paper":"/paper/2607.29294"},"observation_digest":"sha256:f5edc1ef96a9d6dc7ab351b2ca05bc59276e97f94b7ddadfe1902e903d6899b3","observation_id":"67a4273d-4102-4062-86a2-b4650e51186a","resolution":{"observed_at":"2026-08-03T09:55:50.654810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:55:50.731457Z","title":"Proceedings of the 23rd international conference on Machine learning , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29294","last_updated":"2026-07-31T11:12:31Z","snapshot_observed_at":"2026-08-13T20:34:15.935730Z","submitted_at":"2026-07-31T11:12:31Z","title":"Sample Efficient Hierarchical Reinforcement Learning via Best Policy Identification","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-03T09:55:50.731457Z"},"links":{"citing_paper":"/paper/2607.29294"},"observation_digest":"sha256:5bb7c1394f5e6ca799d40c3ef4bbbbc129564ecf3af3104f8d0249997517951d","observation_id":"08b13f8c-0288-464c-b20e-2a56f2266dfe","resolution":{"observed_at":"2026-08-03T09:55:50.731457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:55:50.810636Z","title":"Proceedings of the 34th International Conference on Machine Learning-Volume 70 , pages=","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.29294","last_updated":"2026-07-31T11:12:31Z","snapshot_observed_at":"2026-08-13T20:34:15.935730Z","submitted_at":"2026-07-31T11:12:31Z","title":"Sample Efficient Hierarchical Reinforcement Learning via Best Policy Identification","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-03T09:55:50.810636Z"},"links":{"citing_paper":"/paper/2607.29294"},"observation_digest":"sha256:4eb5bbbf61e5ee187711259f0898b5f4e93a7106518d54579fb65b1ecfb6c0a1","observation_id":"b34a6d90-0986-4760-baec-2672dde9dfc2","resolution":{"observed_at":"2026-08-03T09:55:50.810636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:55:50.884631Z","title":"The True Sample Complexity of Identifying Good Arms , booktitle =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29294","last_updated":"2026-07-31T11:12:31Z","snapshot_observed_at":"2026-08-13T20:34:15.935730Z","submitted_at":"2026-07-31T11:12:31Z","title":"Sample Efficient Hierarchical Reinforcement Learning via Best Policy Identification","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-03T09:55:50.884631Z"},"links":{"citing_paper":"/paper/2607.29294"},"observation_digest":"sha256:b34c3696df91c91b48897a6e040706da52c859fe929395190ad506f23af1ad03","observation_id":"10200837-2709-4cc8-9c57-cd320248a92b","resolution":{"observed_at":"2026-08-03T09:55:50.884631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:55:50.950719Z","title":"2019 , eprint=","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.29294","last_updated":"2026-07-31T11:12:31Z","snapshot_observed_at":"2026-08-13T20:34:15.935730Z","submitted_at":"2026-07-31T11:12:31Z","title":"Sample Efficient Hierarchical Reinforcement Learning via Best Policy Identification","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-03T09:55:50.950719Z"},"links":{"citing_paper":"/paper/2607.29294"},"observation_digest":"sha256:9f3c86d613fbbceec92e49d979f3fb780e1b0839c794be7c7dda6da54d3663ca","observation_id":"3acdf1ad-28a7-4257-894a-7abc156278a5","resolution":{"observed_at":"2026-08-03T09:55:50.950719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:55:51.028055Z","title":"Conference on Learning Theory , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29294","last_updated":"2026-07-31T11:12:31Z","snapshot_observed_at":"2026-08-13T20:34:15.935730Z","submitted_at":"2026-07-31T11:12:31Z","title":"Sample Efficient Hierarchical Reinforcement Learning via Best Policy Identification","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-03T09:55:51.028055Z"},"links":{"citing_paper":"/paper/2607.29294"},"observation_digest":"sha256:08f2c0251cf748ed30a01fd104adcd396907c417959626bdd656e098876e65fe","observation_id":"d9e3a7cc-66bb-422d-b1b3-596bd31a89eb","resolution":{"observed_at":"2026-08-03T09:55:51.028055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.09869","last_updated":"2020-02-23T09:10:14Z","snapshot_observed_at":"2026-08-13T20:34:42.355159Z","submitted_at":"2020-02-23T09:10:14Z","title":"Near-optimal Regret Bounds for Stochastic Shortest Path","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.09869","snapshot_observed_at":"2026-08-03T09:55:51.101038Z","title":"arXiv preprint arXiv:2002.09869 , year=","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2607.29294","last_updated":"2026-07-31T11:12:31Z","snapshot_observed_at":"2026-08-13T20:34:15.935730Z","submitted_at":"2026-07-31T11:12:31Z","title":"Sample Efficient Hierarchical Reinforcement Learning via Best Policy Identification","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-03T09:55:51.101038Z"},"links":{"cited_paper":"/paper/2002.09869","citing_paper":"/paper/2607.29294"},"observation_digest":"sha256:5559ed86fb1dc933969ad3eb6cc9a7bad17f378b61b3f229ed22201669c939b4","observation_id":"a2c4b5df-29ed-4a17-a0b7-ec9dcf8c2b51","resolution":{"observed_at":"2026-08-03T09:55:51.101038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.03517","last_updated":"2020-08-17T11:46:12Z","snapshot_observed_at":"2026-08-14T07:23:34.396951Z","submitted_at":"2019-12-07T15:19:22Z","title":"No-Regret Exploration in Goal-Oriented Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.03517","snapshot_observed_at":"2026-08-03T09:55:51.271979Z","title":"arXiv preprint arXiv:1912.03517 , year=","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2607.29294","last_updated":"2026-07-31T11:12:31Z","snapshot_observed_at":"2026-08-13T20:34:15.935730Z","submitted_at":"2026-07-31T11:12:31Z","title":"Sample Efficient Hierarchical Reinforcement Learning via Best Policy Identification","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-03T09:55:51.271979Z"},"links":{"cited_paper":"/paper/1912.03517","citing_paper":"/paper/2607.29294"},"observation_digest":"sha256:81dcf21621a67ddab90a694f7e18eaf7cb499b35a5525fb5d994d2d9623c2ca0","observation_id":"90004e48-3c74-4abc-a720-23e7249b81e6","resolution":{"observed_at":"2026-08-03T09:55:51.271979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:55:51.362134Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29294","last_updated":"2026-07-31T11:12:31Z","snapshot_observed_at":"2026-08-13T20:34:15.935730Z","submitted_at":"2026-07-31T11:12:31Z","title":"Sample Efficient Hierarchical Reinforcement Learning via Best Policy Identification","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-03T09:55:51.362134Z"},"links":{"citing_paper":"/paper/2607.29294"},"observation_digest":"sha256:620049bdd7529636492e46b5641be75a3ea747caff6d86d0c4b8487e69291186","observation_id":"33a6bffe-f7ac-42ee-bd1f-c8fb1e0d7025","resolution":{"observed_at":"2026-08-03T09:55:51.362134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:55:51.540988Z","title":"2007 , booktitle =","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2607.29294","last_updated":"2026-07-31T11:12:31Z","snapshot_observed_at":"2026-08-13T20:34:15.935730Z","submitted_at":"2026-07-31T11:12:31Z","title":"Sample Efficient Hierarchical Reinforcement Learning via Best Policy Identification","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-03T09:55:51.540988Z"},"links":{"citing_paper":"/paper/2607.29294"},"observation_digest":"sha256:df54dd48a8a1fe219fbd34dd60747f1f632a4c2065ff71746c67159b06956e87","observation_id":"fc2fa487-25f3-47f5-b355-b9c98022b9fc","resolution":{"observed_at":"2026-08-03T09:55:51.540988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:55:51.642174Z","title":"Proceedings of the 36th International Conference on Machine Learning, (ICML) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29294","last_updated":"2026-07-31T11:12:31Z","snapshot_observed_at":"2026-08-13T20:34:15.935730Z","submitted_at":"2026-07-31T11:12:31Z","title":"Sample Efficient Hierarchical Reinforcement Learning via Best Policy Identification","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-03T09:55:51.642174Z"},"links":{"citing_paper":"/paper/2607.29294"},"observation_digest":"sha256:d4ec4c553d7d632cadf01a56e3373eb484f8b0db8e15063391cdb17555507616","observation_id":"621bd805-52d6-48c3-9bc2-6bbb871c8922","resolution":{"observed_at":"2026-08-03T09:55:51.642174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:55:51.719137Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29294","last_updated":"2026-07-31T11:12:31Z","snapshot_observed_at":"2026-08-13T20:34:15.935730Z","submitted_at":"2026-07-31T11:12:31Z","title":"Sample Efficient Hierarchical Reinforcement Learning via Best Policy Identification","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-03T09:55:51.719137Z"},"links":{"citing_paper":"/paper/2607.29294"},"observation_digest":"sha256:be73956e82f914333c0c743b2aa8848dce1464fe84ea6ff1ce85565a18ac4f2d","observation_id":"c41b9d28-b731-4ba6-9a21-b7f8090d9d52","resolution":{"observed_at":"2026-08-03T09:55:51.719137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:55:51.795125Z","title":"Kearns and Satinder P","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29294","last_updated":"2026-07-31T11:12:31Z","snapshot_observed_at":"2026-08-13T20:34:15.935730Z","submitted_at":"2026-07-31T11:12:31Z","title":"Sample Efficient Hierarchical Reinforcement Learning via Best Policy Identification","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-03T09:55:51.795125Z"},"links":{"citing_paper":"/paper/2607.29294"},"observation_digest":"sha256:8d42d1595589d64c76989d5b228fe80a5a406915277ed07ddc2a7b4b1f6fb7e0","observation_id":"54991ae1-8a39-4438-9cea-ee62dd14328e","resolution":{"observed_at":"2026-08-03T09:55:51.795125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:55:51.871301Z","title":"2012 , publisher=","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2607.29294","last_updated":"2026-07-31T11:12:31Z","snapshot_observed_at":"2026-08-13T20:34:15.935730Z","submitted_at":"2026-07-31T11:12:31Z","title":"Sample Efficient Hierarchical Reinforcement Learning via Best Policy Identification","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-03T09:55:51.871301Z"},"links":{"citing_paper":"/paper/2607.29294"},"observation_digest":"sha256:17689d642e34dcac6515370a263a24cbb2caa42b03d23ccf4e63efbf0adda55e","observation_id":"c1ce4b49-d576-4931-a150-6a86b5cf1ab5","resolution":{"observed_at":"2026-08-03T09:55:51.871301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:55:52.035309Z","title":"Annals of probability , pages=","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2607.29294","last_updated":"2026-07-31T11:12:31Z","snapshot_observed_at":"2026-08-13T20:34:15.935730Z","submitted_at":"2026-07-31T11:12:31Z","title":"Sample Efficient Hierarchical Reinforcement Learning via Best Policy Identification","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-03T09:55:52.035309Z"},"links":{"citing_paper":"/paper/2607.29294"},"observation_digest":"sha256:a11ccede5c4e3d65348b2ae3b124fa18e2b302130c7963785ccc7a084cd562aa","observation_id":"5ff6a3f0-f497-4930-a4f8-5b49a1dd56f7","resolution":{"observed_at":"2026-08-03T09:55:52.035309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:55:52.197037Z","title":"Proceedings of the 24th annual conference on learning theory , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29294","last_updated":"2026-07-31T11:12:31Z","snapshot_observed_at":"2026-08-13T20:34:15.935730Z","submitted_at":"2026-07-31T11:12:31Z","title":"Sample Efficient Hierarchical Reinforcement Learning via Best Policy Identification","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-03T09:55:52.197037Z"},"links":{"citing_paper":"/paper/2607.29294"},"observation_digest":"sha256:db23b80e90331712a9e1397e1d029ca9910bcd08fd6e22a77f1305a17b7c0e47","observation_id":"c017800b-d26a-44f1-849a-28bd475bf4b0","resolution":{"observed_at":"2026-08-03T09:55:52.197037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:55:52.307664Z","title":"Annals of Statistics , Year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29294","last_updated":"2026-07-31T11:12:31Z","snapshot_observed_at":"2026-08-13T20:34:15.935730Z","submitted_at":"2026-07-31T11:12:31Z","title":"Sample Efficient Hierarchical Reinforcement Learning via Best Policy Identification","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-03T09:55:52.307664Z"},"links":{"citing_paper":"/paper/2607.29294"},"observation_digest":"sha256:8aee21c4ca531a030bd3dec6de9c30d316d08599a427f23573748fcf832298e0","observation_id":"69df0cd3-7d10-48de-b2a2-6b3ea681f2c6","resolution":{"observed_at":"2026-08-03T09:55:52.307664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:55:52.414397Z","title":"and Lattimore, T","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29294","last_updated":"2026-07-31T11:12:31Z","snapshot_observed_at":"2026-08-13T20:34:15.935730Z","submitted_at":"2026-07-31T11:12:31Z","title":"Sample Efficient Hierarchical Reinforcement Learning via Best Policy Identification","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-03T09:55:52.414397Z"},"links":{"citing_paper":"/paper/2607.29294"},"observation_digest":"sha256:8c45d85fdb6f23d47f8e054fd404e94e6df17efbf96c16a8beee8dfe81557a27","observation_id":"fce2aa21-e84e-4e75-972d-4bdc9cb0f8ab","resolution":{"observed_at":"2026-08-03T09:55:52.414397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.02794","last_updated":"2020-02-07T14:03:38Z","snapshot_observed_at":"2026-08-13T22:24:42.320362Z","submitted_at":"2020-02-07T14:03:38Z","title":"Reward-Free Exploration for Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.02794","snapshot_observed_at":"2026-08-03T09:55:52.528190Z","title":"arXiv:2002.02794 , year =","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2607.29294","last_updated":"2026-07-31T11:12:31Z","snapshot_observed_at":"2026-08-13T20:34:15.935730Z","submitted_at":"2026-07-31T11:12:31Z","title":"Sample Efficient Hierarchical Reinforcement Learning via Best Policy Identification","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-03T09:55:52.528190Z"},"links":{"cited_paper":"/paper/2002.02794","citing_paper":"/paper/2607.29294"},"observation_digest":"sha256:27372086c002ca190bb8010034673c4e2f8d2073efd6defc3ea79ce1d205862b","observation_id":"6be6006c-4c81-4d3a-aba0-c51c18fbbee8","resolution":{"observed_at":"2026-08-03T09:55:52.528190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:55:52.631631Z","title":"Jin and Z","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29294","last_updated":"2026-07-31T11:12:31Z","snapshot_observed_at":"2026-08-13T20:34:15.935730Z","submitted_at":"2026-07-31T11:12:31Z","title":"Sample Efficient Hierarchical Reinforcement Learning via Best Policy Identification","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-03T09:55:52.631631Z"},"links":{"citing_paper":"/paper/2607.29294"},"observation_digest":"sha256:6e658c1ca36c34089195c704acbaa40313f17926b92141c2e3db46f2c8a6973c","observation_id":"43b02cdd-8d43-41c1-83d9-e8b8bf164021","resolution":{"observed_at":"2026-08-03T09:55:52.631631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1805.05071","last_updated":"2022-07-01T10:12:30Z","snapshot_observed_at":"2026-08-14T19:15:45.843433Z","submitted_at":"2018-05-14T09:05:10Z","title":"KL-UCB-switch: optimal regret bounds for stochastic bandits from both a distribution-dependent and a distribution-free viewpoints","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.05071","snapshot_observed_at":"2026-08-03T09:55:52.708972Z","title":"arXiv preprint arXiv:1805.05071 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29294","last_updated":"2026-07-31T11:12:31Z","snapshot_observed_at":"2026-08-13T20:34:15.935730Z","submitted_at":"2026-07-31T11:12:31Z","title":"Sample Efficient Hierarchical Reinforcement Learning via Best Policy Identification","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-03T09:55:52.708972Z"},"links":{"cited_paper":"/paper/1805.05071","citing_paper":"/paper/2607.29294"},"observation_digest":"sha256:30c29217293cc21b22fa60102221425ed13fd6de84458794d8984c96d40924c7","observation_id":"bcdc0c60-f423-4af0-9e75-bb72101a73fc","resolution":{"observed_at":"2026-08-03T09:55:52.708972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:55:52.812900Z","title":", Publisher =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29294","last_updated":"2026-07-31T11:12:31Z","snapshot_observed_at":"2026-08-13T20:34:15.935730Z","submitted_at":"2026-07-31T11:12:31Z","title":"Sample Efficient Hierarchical Reinforcement Learning via Best Policy Identification","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-03T09:55:52.812900Z"},"links":{"citing_paper":"/paper/2607.29294"},"observation_digest":"sha256:88625c9423fbba9441ac8533aedef4acffc384e05656c3b564522002ef777dd7","observation_id":"8d5d1644-bddd-439e-848d-db4ea399d3ab","resolution":{"observed_at":"2026-08-03T09:55:52.812900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:55:52.928524Z","title":"and Li, L","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29294","last_updated":"2026-07-31T11:12:31Z","snapshot_observed_at":"2026-08-13T20:34:15.935730Z","submitted_at":"2026-07-31T11:12:31Z","title":"Sample Efficient Hierarchical Reinforcement Learning via Best Policy Identification","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-03T09:55:52.928524Z"},"links":{"citing_paper":"/paper/2607.29294"},"observation_digest":"sha256:e6f1001301934735cdb1d92926e7da067f57af664f70254fa36fa5e26301c0a2","observation_id":"619cd24b-501f-48f0-ad71-39b64b3191c7","resolution":{"observed_at":"2026-08-03T09:55:52.928524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:55:53.039467Z","title":", Author =","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.29294","last_updated":"2026-07-31T11:12:31Z","snapshot_observed_at":"2026-08-13T20:34:15.935730Z","submitted_at":"2026-07-31T11:12:31Z","title":"Sample Efficient Hierarchical Reinforcement Learning via Best Policy Identification","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-03T09:55:53.039467Z"},"links":{"citing_paper":"/paper/2607.29294"},"observation_digest":"sha256:071667bf76c2c7d3be33e80675efa2100beabe5b49cb523b4c23899fb4aa35d9","observation_id":"6075cc70-3582-42b6-8f2b-deb1491f643c","resolution":{"observed_at":"2026-08-03T09:55:53.039467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:55:53.144748Z","title":"Planning in entropy-regularized Markov decision processes and games , booktitle =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29294","last_updated":"2026-07-31T11:12:31Z","snapshot_observed_at":"2026-08-13T20:34:15.935730Z","submitted_at":"2026-07-31T11:12:31Z","title":"Sample Efficient Hierarchical Reinforcement Learning via Best Policy Identification","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-03T09:55:53.144748Z"},"links":{"citing_paper":"/paper/2607.29294"},"observation_digest":"sha256:f4403e5b1326b54cc5eb9a534fce09f71bb16587e2e6d408bf85c58b1c125ec9","observation_id":"3ce3eba5-58cf-4de6-a487-19278c927489","resolution":{"observed_at":"2026-08-03T09:55:53.144748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:55:53.229216Z","title":"Ajallooeian and Csaba Szepesv","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29294","last_updated":"2026-07-31T11:12:31Z","snapshot_observed_at":"2026-08-13T20:34:15.935730Z","submitted_at":"2026-07-31T11:12:31Z","title":"Sample Efficient Hierarchical Reinforcement Learning via Best Policy Identification","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-03T09:55:53.229216Z"},"links":{"citing_paper":"/paper/2607.29294"},"observation_digest":"sha256:e650d0147e27477ee86e2a91e80065ea8e4fa426adc572d6b09705386f015323","observation_id":"b55058c5-aff3-4dad-a4ae-e970e9d1e40b","resolution":{"observed_at":"2026-08-03T09:55:53.229216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:55:53.390800Z","title":"Koolen , title =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29294","last_updated":"2026-07-31T11:12:31Z","snapshot_observed_at":"2026-08-13T20:34:15.935730Z","submitted_at":"2026-07-31T11:12:31Z","title":"Sample Efficient Hierarchical Reinforcement Learning via Best Policy Identification","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-03T09:55:53.390800Z"},"links":{"citing_paper":"/paper/2607.29294"},"observation_digest":"sha256:662e7345d8bef20b6a284109519419e31ea62e09dbe38326c7907ecded906330","observation_id":"c0a9dbdd-20d9-4a2b-86c7-a9d96be7a3f0","resolution":{"observed_at":"2026-08-03T09:55:53.390800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:55:53.545503Z","title":"Proceedings of the 17th European Conference on Machine Learning (ECML) , Year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29294","last_updated":"2026-07-31T11:12:31Z","snapshot_observed_at":"2026-08-13T20:34:15.935730Z","submitted_at":"2026-07-31T11:12:31Z","title":"Sample Efficient Hierarchical Reinforcement Learning via Best Policy Identification","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-03T09:55:53.545503Z"},"links":{"citing_paper":"/paper/2607.29294"},"observation_digest":"sha256:1581976ec75fdd1604c89dc1d8fd6861463b0f2387792d182ca2ab9e6a92419c","observation_id":"fb7479c0-ce41-41f2-8cfe-47d4277d7438","resolution":{"observed_at":"2026-08-03T09:55:53.545503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:55:53.659456Z","title":"and Mannor, S","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2607.29294","last_updated":"2026-07-31T11:12:31Z","snapshot_observed_at":"2026-08-13T20:34:15.935730Z","submitted_at":"2026-07-31T11:12:31Z","title":"Sample Efficient Hierarchical Reinforcement Learning via Best Policy Identification","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-03T09:55:53.659456Z"},"links":{"citing_paper":"/paper/2607.29294"},"observation_digest":"sha256:c89bd32e98331739d64e01e488310fd0c5b7ccdc386c3f9a4e28e2fe1981852e","observation_id":"0ea14565-8891-409c-83c3-082e315e04ed","resolution":{"observed_at":"2026-08-03T09:55:53.659456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:55:53.768107Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29294","last_updated":"2026-07-31T11:12:31Z","snapshot_observed_at":"2026-08-13T20:34:15.935730Z","submitted_at":"2026-07-31T11:12:31Z","title":"Sample Efficient Hierarchical Reinforcement Learning via Best Policy Identification","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-03T09:55:53.768107Z"},"links":{"citing_paper":"/paper/2607.29294"},"observation_digest":"sha256:4a8c43888352517e1c8723721f43663f8c51b499104b16ccd30e3f49256f3725","observation_id":"00845ae3-c6ec-478e-8391-7362e1fe4a06","resolution":{"observed_at":"2026-08-03T09:55:53.768107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:55:53.873483Z","title":"and Cesa-Bianchi, N","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2607.29294","last_updated":"2026-07-31T11:12:31Z","snapshot_observed_at":"2026-08-13T20:34:15.935730Z","submitted_at":"2026-07-31T11:12:31Z","title":"Sample Efficient Hierarchical Reinforcement Learning via Best Policy Identification","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-03T09:55:53.873483Z"},"links":{"citing_paper":"/paper/2607.29294"},"observation_digest":"sha256:339e430656f87871a444c435f73a2633353598f9c93aabbeca165b78c50752c3","observation_id":"979545b3-078a-48a1-8b45-08eea16e7008","resolution":{"observed_at":"2026-08-03T09:55:53.873483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:55:53.937202Z","title":"Jaksch and R","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29294","last_updated":"2026-07-31T11:12:31Z","snapshot_observed_at":"2026-08-13T20:34:15.935730Z","submitted_at":"2026-07-31T11:12:31Z","title":"Sample Efficient Hierarchical Reinforcement Learning via Best Policy Identification","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-03T09:55:53.937202Z"},"links":{"citing_paper":"/paper/2607.29294"},"observation_digest":"sha256:cb3eca52d380ae170396ffa97792fb5da62e42ca25ecb56023243e5eb6cd8190","observation_id":"4e6fb36e-d87f-449e-add8-de587bbbc96b","resolution":{"observed_at":"2026-08-03T09:55:53.937202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:55:54.026928Z","title":"Proceedings of the Twenty-Sixth","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29294","last_updated":"2026-07-31T11:12:31Z","snapshot_observed_at":"2026-08-13T20:34:15.935730Z","submitted_at":"2026-07-31T11:12:31Z","title":"Sample Efficient Hierarchical Reinforcement Learning via Best Policy Identification","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-03T09:55:54.026928Z"},"links":{"citing_paper":"/paper/2607.29294"},"observation_digest":"sha256:9f17967a048812bda990b42a7cb494c89fdf26f3f7c763c91876871b863484b8","observation_id":"189483f2-9f9a-4678-ae46-335939591b2b","resolution":{"observed_at":"2026-08-03T09:55:54.026928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:55:54.126001Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29294","last_updated":"2026-07-31T11:12:31Z","snapshot_observed_at":"2026-08-13T20:34:15.935730Z","submitted_at":"2026-07-31T11:12:31Z","title":"Sample Efficient Hierarchical Reinforcement Learning via Best Policy Identification","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-03T09:55:54.126001Z"},"links":{"citing_paper":"/paper/2607.29294"},"observation_digest":"sha256:fafaa122343db3f151827cb7bc48833322973138e0d8ffd844e55607adfd25bb","observation_id":"fff355dc-4095-4272-8b56-3184e50eede6","resolution":{"observed_at":"2026-08-03T09:55:54.126001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:55:54.180380Z","title":"Journal of Artifial Intelligence Research , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29294","last_updated":"2026-07-31T11:12:31Z","snapshot_observed_at":"2026-08-13T20:34:15.935730Z","submitted_at":"2026-07-31T11:12:31Z","title":"Sample Efficient Hierarchical Reinforcement Learning via Best Policy Identification","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-03T09:55:54.180380Z"},"links":{"citing_paper":"/paper/2607.29294"},"observation_digest":"sha256:e2e518ae752ba8d226a17f11b48bdf75f1585db583c8101c38c0dec9e987a1d3","observation_id":"907537d2-b61e-4f19-9ad6-bac4d07e8669","resolution":{"observed_at":"2026-08-03T09:55:54.180380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:55:54.262136Z","title":"Kearns and Yishay Mansour and Andrew Y","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29294","last_updated":"2026-07-31T11:12:31Z","snapshot_observed_at":"2026-08-13T20:34:15.935730Z","submitted_at":"2026-07-31T11:12:31Z","title":"Sample Efficient Hierarchical Reinforcement Learning via Best Policy Identification","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-03T09:55:54.262136Z"},"links":{"citing_paper":"/paper/2607.29294"},"observation_digest":"sha256:f43c69077c416ac2080b02e292983d68277335f29bee734f3f6adf9eb3e6aca0","observation_id":"91f19420-af17-4b5a-935f-0d86275e7478","resolution":{"observed_at":"2026-08-03T09:55:54.262136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:55:54.330410Z","title":"Advances in Neural Information Processing Systems (NIPS) , Year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29294","last_updated":"2026-07-31T11:12:31Z","snapshot_observed_at":"2026-08-13T20:34:15.935730Z","submitted_at":"2026-07-31T11:12:31Z","title":"Sample Efficient Hierarchical Reinforcement Learning via Best Policy Identification","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-03T09:55:54.330410Z"},"links":{"citing_paper":"/paper/2607.29294"},"observation_digest":"sha256:05225a4e0f30a2075619192b2efb84e5c7b2019cdb6986f8b2e79407f6cf72c1","observation_id":"d125c550-1598-41fb-8fdc-db510f88095e","resolution":{"observed_at":"2026-08-03T09:55:54.330410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:55:54.424017Z","title":"1998 , Owner =","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2607.29294","last_updated":"2026-07-31T11:12:31Z","snapshot_observed_at":"2026-08-13T20:34:15.935730Z","submitted_at":"2026-07-31T11:12:31Z","title":"Sample Efficient Hierarchical Reinforcement Learning via Best Policy Identification","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-03T09:55:54.424017Z"},"links":{"citing_paper":"/paper/2607.29294"},"observation_digest":"sha256:c1d9a464f22c68d3d037f8e197dd7b57a97e5af8a2eb9ae8df7059d518076f7a","observation_id":"afe67170-118d-4b0c-98de-b4c10abe8635","resolution":{"observed_at":"2026-08-03T09:55:54.424017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:55:54.524174Z","title":"Lillicrap and Karen Simonyan and Demis Hassabis , title =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29294","last_updated":"2026-07-31T11:12:31Z","snapshot_observed_at":"2026-08-13T20:34:15.935730Z","submitted_at":"2026-07-31T11:12:31Z","title":"Sample Efficient Hierarchical Reinforcement Learning via Best Policy Identification","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-03T09:55:54.524174Z"},"links":{"citing_paper":"/paper/2607.29294"},"observation_digest":"sha256:b1ffbd207084dc15048e3e582e43122bb68d0a462b97a4c6b213c0b408cb462b","observation_id":"9e05cb1e-1dc3-4b9d-b17a-c1aae01bbdb6","resolution":{"observed_at":"2026-08-03T09:55:54.524174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:55:54.624236Z","title":"Advances in Neural Information Processing Systems (NIPS) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29294","last_updated":"2026-07-31T11:12:31Z","snapshot_observed_at":"2026-08-13T20:34:15.935730Z","submitted_at":"2026-07-31T11:12:31Z","title":"Sample Efficient Hierarchical Reinforcement Learning via Best Policy Identification","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-03T09:55:54.624236Z"},"links":{"citing_paper":"/paper/2607.29294"},"observation_digest":"sha256:8a291e678b53881dcd34c0dc20ede87d51b6909caa6e811fe1529670a0ed570b","observation_id":"72641798-1f03-4c03-86ce-b3c0ebabff9a","resolution":{"observed_at":"2026-08-03T09:55:54.624236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:55:54.716414Z","title":"Jonsson and E","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29294","last_updated":"2026-07-31T11:12:31Z","snapshot_observed_at":"2026-08-13T20:34:15.935730Z","submitted_at":"2026-07-31T11:12:31Z","title":"Sample Efficient Hierarchical Reinforcement Learning via Best Policy Identification","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-03T09:55:54.716414Z"},"links":{"citing_paper":"/paper/2607.29294"},"observation_digest":"sha256:15214d13a39bd64c1d114cd6485a30047e9229c3a865b62c1b1d46ecbee71a7b","observation_id":"62278889-d502-4f51-bcce-15aa8724657f","resolution":{"observed_at":"2026-08-03T09:55:54.716414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.08265","last_updated":"2020-02-21T18:05:30Z","snapshot_observed_at":"2026-08-13T20:33:12.542690Z","submitted_at":"2019-11-19T13:58:52Z","title":"Mastering Atari, Go, Chess and Shogi by Planning with a Learned Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.08265","snapshot_observed_at":"2026-08-03T09:55:54.826178Z","title":"Lillicrap and David Silver , title =","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2607.29294","last_updated":"2026-07-31T11:12:31Z","snapshot_observed_at":"2026-08-13T20:34:15.935730Z","submitted_at":"2026-07-31T11:12:31Z","title":"Sample Efficient Hierarchical Reinforcement Learning via Best Policy Identification","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-03T09:55:54.826178Z"},"links":{"cited_paper":"/paper/1911.08265","citing_paper":"/paper/2607.29294"},"observation_digest":"sha256:56c77d5e52b537b7ca640e5c473bfe5adda10282652f6311dea492f1e05effd2","observation_id":"b782cc45-4b09-48b5-b09a-6a3f84248914","resolution":{"observed_at":"2026-08-03T09:55:54.826178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:55:54.975080Z","title":"IEEE Transactions on Computational Intelligence and AI in games, , Year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29294","last_updated":"2026-07-31T11:12:31Z","snapshot_observed_at":"2026-08-13T20:34:15.935730Z","submitted_at":"2026-07-31T11:12:31Z","title":"Sample Efficient Hierarchical Reinforcement Learning via Best Policy Identification","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-03T09:55:54.975080Z"},"links":{"citing_paper":"/paper/2607.29294"},"observation_digest":"sha256:9a0b1477167e86e9e1df5dbbf1e8b47ff12d8be44a7fbe5954e11dbfbcd1bc6d","observation_id":"2bc6c379-9148-4c9a-aa56-2e07992e5c03","resolution":{"observed_at":"2026-08-03T09:55:54.975080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:55:55.117148Z","title":"Neural Information Processing Systems (NIPS) , Year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29294","last_updated":"2026-07-31T11:12:31Z","snapshot_observed_at":"2026-08-13T20:34:15.935730Z","submitted_at":"2026-07-31T11:12:31Z","title":"Sample Efficient Hierarchical Reinforcement Learning via Best Policy Identification","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-03T09:55:55.117148Z"},"links":{"citing_paper":"/paper/2607.29294"},"observation_digest":"sha256:402744d1c794f82a8021c43baa45e8757e743e05d418f5992c4ac39690eaad00","observation_id":"9ae019b0-8e74-442f-a871-426d26ce8dea","resolution":{"observed_at":"2026-08-03T09:55:55.117148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:55:55.204020Z","title":"Advances in Neural Information Processing Systems , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29294","last_updated":"2026-07-31T11:12:31Z","snapshot_observed_at":"2026-08-13T20:34:15.935730Z","submitted_at":"2026-07-31T11:12:31Z","title":"Sample Efficient Hierarchical Reinforcement Learning via Best Policy Identification","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-03T09:55:55.204020Z"},"links":{"citing_paper":"/paper/2607.29294"},"observation_digest":"sha256:59f94c2072a28deb184ce9378ed2bf34e407aef81a393af5db5587da25160611","observation_id":"a55a6404-fccd-47f2-a36c-ac15caa3d474","resolution":{"observed_at":"2026-08-03T09:55:55.204020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:55:55.321130Z","title":"Gheshlaghi Azar and I","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.29294","last_updated":"2026-07-31T11:12:31Z","snapshot_observed_at":"2026-08-13T20:34:15.935730Z","submitted_at":"2026-07-31T11:12:31Z","title":"Sample Efficient Hierarchical Reinforcement Learning via Best Policy Identification","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-03T09:55:55.321130Z"},"links":{"citing_paper":"/paper/2607.29294"},"observation_digest":"sha256:b39c765860aeb59aaa46f435bb1fbf75df1ce62446ed718aacc4d44e856a11bd","observation_id":"a85bf99e-c40e-40eb-b99a-81518bea411f","resolution":{"observed_at":"2026-08-03T09:55:55.321130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:55:55.502056Z","title":"On the Sample Complexity of Reinforcement Learning with a Generative Model , booktitle =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29294","last_updated":"2026-07-31T11:12:31Z","snapshot_observed_at":"2026-08-13T20:34:15.935730Z","submitted_at":"2026-07-31T11:12:31Z","title":"Sample Efficient Hierarchical Reinforcement Learning via Best Policy Identification","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-03T09:55:55.502056Z"},"links":{"citing_paper":"/paper/2607.29294"},"observation_digest":"sha256:80c2e13efd4df32676d5f879f417b5f4a4d0f29e70220c4103a85ab869cfaed2","observation_id":"625e60b7-0abe-408e-8596-367787ecafc3","resolution":{"observed_at":"2026-08-03T09:55:55.502056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:55:55.676277Z","title":"Kearns and Satinder P","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29294","last_updated":"2026-07-31T11:12:31Z","snapshot_observed_at":"2026-08-13T20:34:15.935730Z","submitted_at":"2026-07-31T11:12:31Z","title":"Sample Efficient Hierarchical Reinforcement Learning via Best Policy Identification","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-03T09:55:55.676277Z"},"links":{"citing_paper":"/paper/2607.29294"},"observation_digest":"sha256:e30057216c40a4c9960ae54d6bc8a19986cb22cb8f901e1baed8db685442401d","observation_id":"2d59a362-9d72-43da-be6a-d6e0001eb11e","resolution":{"observed_at":"2026-08-03T09:55:55.676277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:55:55.819981Z","title":"Efficient Reinforcement Learning , booktitle =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29294","last_updated":"2026-07-31T11:12:31Z","snapshot_observed_at":"2026-08-13T20:34:15.935730Z","submitted_at":"2026-07-31T11:12:31Z","title":"Sample Efficient Hierarchical Reinforcement Learning via Best Policy Identification","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-03T09:55:55.819981Z"},"links":{"citing_paper":"/paper/2607.29294"},"observation_digest":"sha256:dc7f2457234323d9efda4d008abfdc1de1856e862b04237a180b1f6403c0095c","observation_id":"74961bd1-8f15-4d53-aff5-ed0f843ba1ba","resolution":{"observed_at":"2026-08-03T09:55:55.819981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:55:55.933964Z","title":"Expected Mistake Bound Model for On-Line Reinforcement Learning , booktitle =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29294","last_updated":"2026-07-31T11:12:31Z","snapshot_observed_at":"2026-08-13T20:34:15.935730Z","submitted_at":"2026-07-31T11:12:31Z","title":"Sample Efficient Hierarchical Reinforcement Learning via Best Policy Identification","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-03T09:55:55.933964Z"},"links":{"citing_paper":"/paper/2607.29294"},"observation_digest":"sha256:f6f2324f18ab11a960a18ac43cb5edd43e61af6327e869936bc849f889f0f1df","observation_id":"53b09fb9-4a99-4d98-adc9-17aea1cdb6bc","resolution":{"observed_at":"2026-08-03T09:55:55.933964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:55:56.111870Z","title":"and Capp","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29294","last_updated":"2026-07-31T11:12:31Z","snapshot_observed_at":"2026-08-13T20:34:15.935730Z","submitted_at":"2026-07-31T11:12:31Z","title":"Sample Efficient Hierarchical Reinforcement Learning via Best Policy Identification","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-03T09:55:56.111870Z"},"links":{"citing_paper":"/paper/2607.29294"},"observation_digest":"sha256:a972559d9297ba171dffc29f636743634e1945b2346d779b09f087eea2bed291","observation_id":"1fbd94d1-4ec0-4d2e-9704-c101a36f98b7","resolution":{"observed_at":"2026-08-03T09:55:56.111870Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:55:56.223829Z","title":"Brafman and Moshe Tennenholtz , title =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29294","last_updated":"2026-07-31T11:12:31Z","snapshot_observed_at":"2026-08-13T20:34:15.935730Z","submitted_at":"2026-07-31T11:12:31Z","title":"Sample Efficient Hierarchical Reinforcement Learning via Best Policy Identification","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-03T09:55:56.223829Z"},"links":{"citing_paper":"/paper/2607.29294"},"observation_digest":"sha256:bdb776aea16d7cc77adf7a0e6664b0bbc8c5d2d81c7256e72cdd8a32d6d0c12b","observation_id":"5fa62a19-2191-4e92-b73e-155fa67f489a","resolution":{"observed_at":"2026-08-03T09:55:56.223829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:55:56.377054Z","title":"Strehl and Lihong Li and Eric Wiewiora and John Langford and Michael L","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29294","last_updated":"2026-07-31T11:12:31Z","snapshot_observed_at":"2026-08-13T20:34:15.935730Z","submitted_at":"2026-07-31T11:12:31Z","title":"Sample Efficient Hierarchical Reinforcement Learning via Best Policy Identification","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-03T09:55:56.377054Z"},"links":{"citing_paper":"/paper/2607.29294"},"observation_digest":"sha256:b8277b3e5d43a72b20c4e4180e536a11fadf50a8ab5a7cf791917eaa55fa752a","observation_id":"a94b3860-342b-47d1-9674-74416643cec2","resolution":{"observed_at":"2026-08-03T09:55:56.377054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:55:56.520976Z","title":"Strehl and Michael L","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29294","last_updated":"2026-07-31T11:12:31Z","snapshot_observed_at":"2026-08-13T20:34:15.935730Z","submitted_at":"2026-07-31T11:12:31Z","title":"Sample Efficient Hierarchical Reinforcement Learning via Best Policy Identification","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-03T09:55:56.520976Z"},"links":{"citing_paper":"/paper/2607.29294"},"observation_digest":"sha256:74d3793c2142e0a665ab6550f67c33c24d2094e0d47e62d7f629f0cface0f870","observation_id":"67f7d795-f4f5-4231-a502-cf2e465db8a0","resolution":{"observed_at":"2026-08-03T09:55:56.520976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:55:56.570788Z","title":"Conference on Learning Theory , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29294","last_updated":"2026-07-31T11:12:31Z","snapshot_observed_at":"2026-08-13T20:34:15.935730Z","submitted_at":"2026-07-31T11:12:31Z","title":"Sample Efficient Hierarchical Reinforcement Learning via Best Policy Identification","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-03T09:55:56.570788Z"},"links":{"citing_paper":"/paper/2607.29294"},"observation_digest":"sha256:c7f2a6f27012c6786a83d8d25ccbccabdf7222b14192e8f25a63601768da1531","observation_id":"e28f6bc2-3415-480f-bc9b-ace9ac5eeb01","resolution":{"observed_at":"2026-08-03T09:55:56.570788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:55:56.654008Z","title":"2019 , booktitle=","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.29294","last_updated":"2026-07-31T11:12:31Z","snapshot_observed_at":"2026-08-13T20:34:15.935730Z","submitted_at":"2026-07-31T11:12:31Z","title":"Sample Efficient Hierarchical Reinforcement Learning via Best Policy Identification","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-03T09:55:56.654008Z"},"links":{"citing_paper":"/paper/2607.29294"},"observation_digest":"sha256:50bff08e0d18a674bcdde069b702483bb16e35b6fd6ea5b21fc0317e1d1de0d0","observation_id":"96451d14-88c1-4a6e-a7e3-438df515c703","resolution":{"observed_at":"2026-08-03T09:55:56.654008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:55:56.711295Z","title":"Artificial Intelligence and Statistics , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29294","last_updated":"2026-07-31T11:12:31Z","snapshot_observed_at":"2026-08-13T20:34:15.935730Z","submitted_at":"2026-07-31T11:12:31Z","title":"Sample Efficient Hierarchical Reinforcement Learning via Best Policy Identification","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-03T09:55:56.711295Z"},"links":{"citing_paper":"/paper/2607.29294"},"observation_digest":"sha256:87fac16f7c3e600a642d6ca45ce250398dc0d93867aec4f33f7ab0ed06f14911","observation_id":"022977d2-9f63-474d-ae51-e5ce28d6baa0","resolution":{"observed_at":"2026-08-03T09:55:56.711295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:55:56.791193Z","title":"Advances in Neural Information Processing Systems 28 , editor =","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.29294","last_updated":"2026-07-31T11:12:31Z","snapshot_observed_at":"2026-08-13T20:34:15.935730Z","submitted_at":"2026-07-31T11:12:31Z","title":"Sample Efficient Hierarchical Reinforcement Learning via Best Policy Identification","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-03T09:55:56.791193Z"},"links":{"citing_paper":"/paper/2607.29294"},"observation_digest":"sha256:eaed4d4a6a24d4d2637a054f13ce829318c1861fe5ae6be2be47f55e4861c8ac","observation_id":"a80c9e25-cba2-44d4-8540-be95e69f3f27","resolution":{"observed_at":"2026-08-03T09:55:56.791193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:55:56.847218Z","title":"2016 , eprint=","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.29294","last_updated":"2026-07-31T11:12:31Z","snapshot_observed_at":"2026-08-13T20:34:15.935730Z","submitted_at":"2026-07-31T11:12:31Z","title":"Sample Efficient Hierarchical Reinforcement Learning via Best Policy Identification","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-03T09:55:56.847218Z"},"links":{"citing_paper":"/paper/2607.29294"},"observation_digest":"sha256:199e33d78b9870888750c3ac616096403febec4a89aa526eaabbe0f4cf4040a2","observation_id":"726e78c2-0162-44a0-ac72-6ffb0a0af011","resolution":{"observed_at":"2026-08-03T09:55:56.847218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/s12064-011-0142-z","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2012 , Journal =","venue":"Theory in Biosciences","work_id":"e37e9d8e-9138-4e0e-9007-e93cfd0addd8","year":2012},"citing_paper":{"arxiv_id":"2607.29294","last_updated":"2026-07-31T11:12:31Z","snapshot_observed_at":"2026-08-13T20:34:15.935730Z","submitted_at":"2026-07-31T11:12:31Z","title":"Sample Efficient Hierarchical Reinforcement Learning via Best Policy Identification","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-03T09:55:56.913323Z"},"links":{"citing_paper":"/paper/2607.29294"},"observation_digest":"sha256:63c7337cef1dea9dd4b1cee0333e2452e10ff239d77425949ca338f96fce1be8","observation_id":"4672fa2e-fc9b-4e3b-ac39-90f2dd644e10","resolution":{"observed_at":"2026-08-03T09:59:01.344957Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:55:56.939347Z","title":"Advances in Neural Information Processing Systems 17 , editor =","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2607.29294","last_updated":"2026-07-31T11:12:31Z","snapshot_observed_at":"2026-08-13T20:34:15.935730Z","submitted_at":"2026-07-31T11:12:31Z","title":"Sample Efficient Hierarchical Reinforcement Learning via Best Policy Identification","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-03T09:55:56.939347Z"},"links":{"citing_paper":"/paper/2607.29294"},"observation_digest":"sha256:95019a87aa3ce4e5dbbdf9e3762b6a4db2bf4edc78323fdfbe1c9cb59b163915","observation_id":"91c50cc8-3242-4622-9b1a-cb5ae2daf2d4","resolution":{"observed_at":"2026-08-03T09:55:56.939347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1901.00210","last_updated":"2019-11-01T20:35:28Z","snapshot_observed_at":"2026-08-14T17:36:09.834261Z","submitted_at":"2019-01-01T21:17:21Z","title":"Tighter Problem-Dependent Regret Bounds in Reinforcement Learning without Domain Knowledge using Value Function Bounds","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.00210","snapshot_observed_at":"2026-08-03T09:55:57.097421Z","title":"arXiv preprint arXiv:1901.00210 , year=","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2607.29294","last_updated":"2026-07-31T11:12:31Z","snapshot_observed_at":"2026-08-13T20:34:15.935730Z","submitted_at":"2026-07-31T11:12:31Z","title":"Sample Efficient Hierarchical Reinforcement Learning via Best Policy Identification","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-03T09:55:57.097421Z"},"links":{"cited_paper":"/paper/1901.00210","citing_paper":"/paper/2607.29294"},"observation_digest":"sha256:eac79e503328cb3268a6101b8a8a3f4aa86e9cfe3e1115fab718db00e0f88f4e","observation_id":"ee2d9232-b4ba-489f-8d9f-c54ebef1d4d5","resolution":{"observed_at":"2026-08-03T09:55:57.097421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:55:57.157413Z","title":"Kaufmann and P","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29294","last_updated":"2026-07-31T11:12:31Z","snapshot_observed_at":"2026-08-13T20:34:15.935730Z","submitted_at":"2026-07-31T11:12:31Z","title":"Sample Efficient Hierarchical Reinforcement Learning via Best Policy Identification","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-03T09:55:57.157413Z"},"links":{"citing_paper":"/paper/2607.29294"},"observation_digest":"sha256:357535c653d47838615454a1c62891c1292908b199c7021777034420d148c0b4","observation_id":"8dd8c9bd-b5e0-4a8d-b5e2-39da940a405c","resolution":{"observed_at":"2026-08-03T09:55:57.157413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:55:57.301408Z","title":"M\\'enard and O","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29294","last_updated":"2026-07-31T11:12:31Z","snapshot_observed_at":"2026-08-13T20:34:15.935730Z","submitted_at":"2026-07-31T11:12:31Z","title":"Sample Efficient Hierarchical Reinforcement Learning via Best Policy Identification","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-03T09:55:57.301408Z"},"links":{"citing_paper":"/paper/2607.29294"},"observation_digest":"sha256:4df3968c6c4f949753f76f5e45872e97cce6c672e2a8d75878a25ce75544cf4e","observation_id":"c9bc94a5-5d60-468c-9fbe-9192cee7815b","resolution":{"observed_at":"2026-08-03T09:55:57.301408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:55:57.469624Z","title":"Infante and A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29294","last_updated":"2026-07-31T11:12:31Z","snapshot_observed_at":"2026-08-13T20:34:15.935730Z","submitted_at":"2026-07-31T11:12:31Z","title":"Sample Efficient Hierarchical Reinforcement Learning via Best Policy Identification","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-03T09:55:57.469624Z"},"links":{"citing_paper":"/paper/2607.29294"},"observation_digest":"sha256:f2d3d9f770200a3606379217dd635bb55daff547ddbf60861bdd61b9f5183193","observation_id":"2cf5ecf5-ab5b-4749-bfd3-d9ec8a5426e2","resolution":{"observed_at":"2026-08-03T09:55:57.469624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:55:57.635393Z","title":"Drappo and A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29294","last_updated":"2026-07-31T11:12:31Z","snapshot_observed_at":"2026-08-13T20:34:15.935730Z","submitted_at":"2026-07-31T11:12:31Z","title":"Sample Efficient Hierarchical Reinforcement Learning via Best Policy Identification","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-03T09:55:57.635393Z"},"links":{"citing_paper":"/paper/2607.29294"},"observation_digest":"sha256:ab1a260b15d250c1a5c92a6134d0300a38131711619c5f0ec5e82a62bbfc3e0b","observation_id":"d2db58e5-94fd-4d64-87dd-8612ad633fee","resolution":{"observed_at":"2026-08-03T09:55:57.635393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:55:57.732619Z","title":"Robert and C","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29294","last_updated":"2026-07-31T11:12:31Z","snapshot_observed_at":"2026-08-13T20:34:15.935730Z","submitted_at":"2026-07-31T11:12:31Z","title":"Sample Efficient Hierarchical Reinforcement Learning via Best Policy Identification","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-03T09:55:57.732619Z"},"links":{"citing_paper":"/paper/2607.29294"},"observation_digest":"sha256:8c9048234a2e2ed0d2afabdd638bd71f784fc7d43e011e587bee2984189a01c6","observation_id":"48fb65db-f93d-41a0-b528-654501251544","resolution":{"observed_at":"2026-08-03T09:55:57.732619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:55:57.844780Z","title":"Wen and D","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29294","last_updated":"2026-07-31T11:12:31Z","snapshot_observed_at":"2026-08-13T20:34:15.935730Z","submitted_at":"2026-07-31T11:12:31Z","title":"Sample Efficient Hierarchical Reinforcement Learning via Best Policy Identification","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-03T09:55:57.844780Z"},"links":{"citing_paper":"/paper/2607.29294"},"observation_digest":"sha256:2ae3cd1546fd71b77161086f0b2e90c4dd8b779c724b6573e12fffa3c349be36","observation_id":"1e6e4e3b-760e-484f-8e38-ed5e1192d063","resolution":{"observed_at":"2026-08-03T09:55:57.844780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:55:57.953298Z","title":"Nachum and S","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29294","last_updated":"2026-07-31T11:12:31Z","snapshot_observed_at":"2026-08-13T20:34:15.935730Z","submitted_at":"2026-07-31T11:12:31Z","title":"Sample Efficient Hierarchical Reinforcement Learning via Best Policy Identification","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-03T09:55:57.953298Z"},"links":{"citing_paper":"/paper/2607.29294"},"observation_digest":"sha256:8509af9a2468db51535a5667e1329b0c7392897e49ad734f57f61dc24ee7a9c8","observation_id":"3f445232-6a50-4553-9f44-cef3a98d419a","resolution":{"observed_at":"2026-08-03T09:55:57.953298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:55:58.032888Z","title":"Konidaris and A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29294","last_updated":"2026-07-31T11:12:31Z","snapshot_observed_at":"2026-08-13T20:34:15.935730Z","submitted_at":"2026-07-31T11:12:31Z","title":"Sample Efficient Hierarchical Reinforcement Learning via Best Policy Identification","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-03T09:55:58.032888Z"},"links":{"citing_paper":"/paper/2607.29294"},"observation_digest":"sha256:d1146c84c6bacd1524802139b6eaffeaad2a24db28cdaa566e8cafb81e7fa51c","observation_id":"ad5006ea-0472-4f4d-98a5-93874f136765","resolution":{"observed_at":"2026-08-03T09:55:58.032888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:55:58.107434Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29294","last_updated":"2026-07-31T11:12:31Z","snapshot_observed_at":"2026-08-13T20:34:15.935730Z","submitted_at":"2026-07-31T11:12:31Z","title":"Sample Efficient Hierarchical Reinforcement Learning via Best Policy Identification","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-03T09:55:58.107434Z"},"links":{"citing_paper":"/paper/2607.29294"},"observation_digest":"sha256:58a3a00a7d8bcecb69403c768a9706f2023fd19302e58524da6d5e5e77ca9ecb","observation_id":"837d335b-6f32-454d-af8c-847122eef906","resolution":{"observed_at":"2026-08-03T09:55:58.107434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:55:58.240938Z","title":"Levy and G","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29294","last_updated":"2026-07-31T11:12:31Z","snapshot_observed_at":"2026-08-13T20:34:15.935730Z","submitted_at":"2026-07-31T11:12:31Z","title":"Sample Efficient Hierarchical Reinforcement Learning via Best Policy Identification","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-03T09:55:58.240938Z"},"links":{"citing_paper":"/paper/2607.29294"},"observation_digest":"sha256:f80aee348334ee7964b62fce5e04bc144ff2aaa5f895dbfa444b334e5f842d9d","observation_id":"b89c28c5-94b6-4b18-93b3-bc432e9cf0cd","resolution":{"observed_at":"2026-08-03T09:55:58.240938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:55:58.318375Z","title":"Fruit and M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29294","last_updated":"2026-07-31T11:12:31Z","snapshot_observed_at":"2026-08-13T20:34:15.935730Z","submitted_at":"2026-07-31T11:12:31Z","title":"Sample Efficient Hierarchical Reinforcement Learning via Best Policy Identification","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-03T09:55:58.318375Z"},"links":{"citing_paper":"/paper/2607.29294"},"observation_digest":"sha256:d510385afa2964b5e335c9b08d0148b287bd0a137fed010b8216cc806d4a988a","observation_id":"06e71de6-a0ca-4a0c-a92d-531379a69f41","resolution":{"observed_at":"2026-08-03T09:55:58.318375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:55:58.448196Z","title":"Drappo and A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29294","last_updated":"2026-07-31T11:12:31Z","snapshot_observed_at":"2026-08-13T20:34:15.935730Z","submitted_at":"2026-07-31T11:12:31Z","title":"Sample Efficient Hierarchical Reinforcement Learning via Best Policy Identification","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-03T09:55:58.448196Z"},"links":{"citing_paper":"/paper/2607.29294"},"observation_digest":"sha256:f02e6d0864942fc725085a518b8a336f3d6c894ff8903a6fa587861aa68c40cf","observation_id":"1d2448fa-d25d-41b8-8dc4-40e86259aaa9","resolution":{"observed_at":"2026-08-03T09:55:58.448196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:55:58.620135Z","title":"Rafati and D","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29294","last_updated":"2026-07-31T11:12:31Z","snapshot_observed_at":"2026-08-13T20:34:15.935730Z","submitted_at":"2026-07-31T11:12:31Z","title":"Sample Efficient Hierarchical Reinforcement Learning via Best Policy Identification","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-03T09:55:58.620135Z"},"links":{"citing_paper":"/paper/2607.29294"},"observation_digest":"sha256:0114c09261c94b9f231818b5cc65d095d5433d62953bce8f059a299617c7973f","observation_id":"7a04f65b-c566-46ad-9d29-5d3c8af77afb","resolution":{"observed_at":"2026-08-03T09:55:58.620135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:55:58.738145Z","title":"Gopalan and M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29294","last_updated":"2026-07-31T11:12:31Z","snapshot_observed_at":"2026-08-13T20:34:15.935730Z","submitted_at":"2026-07-31T11:12:31Z","title":"Sample Efficient Hierarchical Reinforcement Learning via Best Policy Identification","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-03T09:55:58.738145Z"},"links":{"citing_paper":"/paper/2607.29294"},"observation_digest":"sha256:c4a170d9bc010139be27b10fcb7af1e0824a6fc83c6f27ddb93d600a0bd199cf","observation_id":"53097f2b-3b9c-4d69-9653-42e1bf2300ad","resolution":{"observed_at":"2026-08-03T09:55:58.738145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:55:58.807958Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29294","last_updated":"2026-07-31T11:12:31Z","snapshot_observed_at":"2026-08-13T20:34:15.935730Z","submitted_at":"2026-07-31T11:12:31Z","title":"Sample Efficient Hierarchical Reinforcement Learning via Best Policy Identification","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-03T09:55:58.807958Z"},"links":{"citing_paper":"/paper/2607.29294"},"observation_digest":"sha256:0bdb4f0efe47241f600dee2ac33b6adddb873d2752d4eecc6b1356cf03298d1d","observation_id":"aad61cbc-29eb-4997-a6da-a5f4009514d1","resolution":{"observed_at":"2026-08-03T09:55:58.807958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:55:58.877754Z","title":"Ahn and A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29294","last_updated":"2026-07-31T11:12:31Z","snapshot_observed_at":"2026-08-13T20:34:15.935730Z","submitted_at":"2026-07-31T11:12:31Z","title":"Sample Efficient Hierarchical Reinforcement Learning via Best Policy Identification","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-03T09:55:58.877754Z"},"links":{"citing_paper":"/paper/2607.29294"},"observation_digest":"sha256:87e097a5d3c1fd6668bc92e718d9f8683ee8cd1d91c5dfe4cbfbd7e73099f9df","observation_id":"54098ecd-5095-4b60-8329-20be4a5b9eab","resolution":{"observed_at":"2026-08-03T09:55:58.877754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:55:58.943364Z","title":"Brunskill and L","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29294","last_updated":"2026-07-31T11:12:31Z","snapshot_observed_at":"2026-08-13T20:34:15.935730Z","submitted_at":"2026-07-31T11:12:31Z","title":"Sample Efficient Hierarchical Reinforcement Learning via Best Policy Identification","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-03T09:55:58.943364Z"},"links":{"citing_paper":"/paper/2607.29294"},"observation_digest":"sha256:06ca184ef4e48022fc04524c0763f6f31f3ef3f70d52ca718f3f98d401d96384","observation_id":"c1904535-66ed-4613-b335-daec52f79b0d","resolution":{"observed_at":"2026-08-03T09:55:58.943364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:55:59.105372Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29294","last_updated":"2026-07-31T11:12:31Z","snapshot_observed_at":"2026-08-13T20:34:15.935730Z","submitted_at":"2026-07-31T11:12:31Z","title":"Sample Efficient Hierarchical Reinforcement Learning via Best Policy Identification","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-03T09:55:59.105372Z"},"links":{"citing_paper":"/paper/2607.29294"},"observation_digest":"sha256:399139bab65a990c021ef869aaaa3baad5d19e26a86e330028e2235d2477880d","observation_id":"97155275-ee0e-4665-9425-6cf60a68d57c","resolution":{"observed_at":"2026-08-03T09:55:59.105372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:55:59.235825Z","title":"Matthews and M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29294","last_updated":"2026-07-31T11:12:31Z","snapshot_observed_at":"2026-08-13T20:34:15.935730Z","submitted_at":"2026-07-31T11:12:31Z","title":"Sample Efficient Hierarchical Reinforcement Learning via Best Policy Identification","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-03T09:55:59.235825Z"},"links":{"citing_paper":"/paper/2607.29294"},"observation_digest":"sha256:fd81df627de7aa8fe5a99a0fa8cc3e9c03ada55ec1d79ce038810a47424cf249","observation_id":"63857bf5-7e2a-4e87-80e2-a06c35ee0201","resolution":{"observed_at":"2026-08-03T09:55:59.235825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:55:59.386774Z","title":"Drappo and A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29294","last_updated":"2026-07-31T11:12:31Z","snapshot_observed_at":"2026-08-13T20:34:15.935730Z","submitted_at":"2026-07-31T11:12:31Z","title":"Sample Efficient Hierarchical Reinforcement Learning via Best Policy Identification","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-03T09:55:59.386774Z"},"links":{"citing_paper":"/paper/2607.29294"},"observation_digest":"sha256:1f4878bbf8753c5c165f07946338cbdbb350d882163a36b36f43fb4488f365a6","observation_id":"f2e6f85f-512e-4175-8630-495d3f910034","resolution":{"observed_at":"2026-08-03T09:55:59.386774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:55:59.534752Z","title":"Kuric and G","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29294","last_updated":"2026-07-31T11:12:31Z","snapshot_observed_at":"2026-08-13T20:34:15.935730Z","submitted_at":"2026-07-31T11:12:31Z","title":"Sample Efficient Hierarchical Reinforcement Learning via Best Policy Identification","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-03T09:55:59.534752Z"},"links":{"citing_paper":"/paper/2607.29294"},"observation_digest":"sha256:11d19847838d0f34db75122525157cc83ac7c0b3b1daf3071a0158a6d51db35f","observation_id":"90f241a2-765e-4fef-be3b-393448182db3","resolution":{"observed_at":"2026-08-03T09:55:59.534752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:55:59.660672Z","title":"Manenti and A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29294","last_updated":"2026-07-31T11:12:31Z","snapshot_observed_at":"2026-08-13T20:34:15.935730Z","submitted_at":"2026-07-31T11:12:31Z","title":"Sample Efficient Hierarchical Reinforcement Learning via Best Policy Identification","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-03T09:55:59.660672Z"},"links":{"citing_paper":"/paper/2607.29294"},"observation_digest":"sha256:36e690e2f4d6fd06a52c533388eef0db1ceb2fd9c506b760d2ec0482df0581d5","observation_id":"52f7b743-e91e-4618-8713-36cbb4e8115b","resolution":{"observed_at":"2026-08-03T09:55:59.660672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.29294","last_updated":"2026-07-31T11:12:31Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-13T20:34:15.935730Z","submitted_at":"2026-07-31T11:12:31Z","title":"Sample Efficient Hierarchical Reinforcement Learning via Best Policy Identification"},"reference_resolution":{"displayed":85,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":83,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":85},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 85 of 85 outbound references and 0 inbound Pith citation observations for arXiv:2607.29294."}