{"as_of":"2026-08-12T22:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0a434e1dd024eee2c2eb248c4fb65baee90e5c19dd0ef09d204fec797255ecfb","coverage":[{"denominator":59,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":59,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T22:15:09.161752Z","state":"measured"},{"denominator":59,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":59,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.03767/citation-record","integrity":"/paper/2412.03767/integrity","json":"/paper/2412.03767/citation-record.json","paper":"/paper/2412.03767"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1312.5602","last_updated":"2013-12-19T16:00:08Z","snapshot_observed_at":"2026-08-12T14:28:10.961989Z","submitted_at":"2013-12-19T16:00:08Z","title":"Playing Atari with Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.5602","snapshot_observed_at":"2026-08-11T22:15:06.702638Z","title":"Playing atari with deep reinforcement learning","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2412.03767","last_updated":"2024-12-04T23:12:41Z","snapshot_observed_at":"2026-08-12T09:34:12.100457Z","submitted_at":"2024-12-04T23:12:41Z","title":"Hyper: Hyperparameter Robust Efficient Exploration in Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T22:15:06.702638Z"},"links":{"cited_paper":"/paper/1312.5602","citing_paper":"/paper/2412.03767"},"observation_digest":"sha256:eadf676542f5ddeba8719b8feb46baca44a309520f14c3571da4375f353f363d","observation_id":"5334bbc9-0520-4a6c-ac8d-65fba9774625","resolution":{"observed_at":"2026-08-11T22:15:06.702638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:15:06.751109Z","title":"Human-level control through deep reinforcement learning","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.03767","last_updated":"2024-12-04T23:12:41Z","snapshot_observed_at":"2026-08-12T09:34:12.100457Z","submitted_at":"2024-12-04T23:12:41Z","title":"Hyper: Hyperparameter Robust Efficient Exploration in Reinforcement Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T22:15:06.751109Z"},"links":{"citing_paper":"/paper/2412.03767"},"observation_digest":"sha256:1cc662ea350b258f15e8fb513129aa998b6f4803e9cdd6f91590a65a026ed28d","observation_id":"3f9ac66b-fcbb-4398-9916-83f6843b4059","resolution":{"observed_at":"2026-08-11T22:15:06.751109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:15:06.774746Z","title":"Mastering the game of go with deep neural networks and tree search","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.03767","last_updated":"2024-12-04T23:12:41Z","snapshot_observed_at":"2026-08-12T09:34:12.100457Z","submitted_at":"2024-12-04T23:12:41Z","title":"Hyper: Hyperparameter Robust Efficient Exploration in Reinforcement Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T22:15:06.774746Z"},"links":{"citing_paper":"/paper/2412.03767"},"observation_digest":"sha256:374a872f98d71137869ce23d8b4cee13387cd1cfb434bcfcff7b7a04cb5d01db","observation_id":"2254d36b-be0f-4152-9df8-e6dc6447cd40","resolution":{"observed_at":"2026-08-11T22:15:06.774746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:15:06.834954Z","title":"Mastering the game of go without human knowledge","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.03767","last_updated":"2024-12-04T23:12:41Z","snapshot_observed_at":"2026-08-12T09:34:12.100457Z","submitted_at":"2024-12-04T23:12:41Z","title":"Hyper: Hyperparameter Robust Efficient Exploration in Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T22:15:06.834954Z"},"links":{"citing_paper":"/paper/2412.03767"},"observation_digest":"sha256:54ca0edee7a3e5c53fe7c4a43f7c5644638b9a8f9756ac023793e12685b8d337","observation_id":"e1e9b94e-931a-4d47-b4f8-88451eded4f8","resolution":{"observed_at":"2026-08-11T22:15:06.834954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06680","last_updated":"2019-12-13T19:56:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-12-13T19:56:40Z","title":"Dota 2 with Large Scale Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06680","snapshot_observed_at":"2026-08-11T22:15:06.865821Z","title":"Dota 2 with large scale deep reinforcement learning","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2412.03767","last_updated":"2024-12-04T23:12:41Z","snapshot_observed_at":"2026-08-12T09:34:12.100457Z","submitted_at":"2024-12-04T23:12:41Z","title":"Hyper: Hyperparameter Robust Efficient Exploration in Reinforcement Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T22:15:06.865821Z"},"links":{"cited_paper":"/paper/1912.06680","citing_paper":"/paper/2412.03767"},"observation_digest":"sha256:8359bd905223133fcaae3b2522fc15e616f1ab8a98437962000ffc6988e128dc","observation_id":"628813d8-6d4a-4b89-9ea9-000295df3d8f","resolution":{"observed_at":"2026-08-11T22:15:06.865821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:15:15.034752Z","title":"Alphastar: An evolutionary computation perspective","venue":null,"work_id":"e528d717-5be3-4270-be05-d1003a749183","year":2019},"citing_paper":{"arxiv_id":"2412.03767","last_updated":"2024-12-04T23:12:41Z","snapshot_observed_at":"2026-08-12T09:34:12.100457Z","submitted_at":"2024-12-04T23:12:41Z","title":"Hyper: Hyperparameter Robust Efficient Exploration in Reinforcement Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T22:15:06.902534Z"},"links":{"citing_paper":"/paper/2412.03767"},"observation_digest":"sha256:3d99ca5891073531a274cac3b5c59e2a912c331275ec601a71624c1367009bf3","observation_id":"abd6207a-59ce-41b6-b65f-58e4c1187365","resolution":{"observed_at":"2026-08-11T22:15:15.094752Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:15:06.974750Z","title":"Unifying count-based exploration and intrinsic motivation","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.03767","last_updated":"2024-12-04T23:12:41Z","snapshot_observed_at":"2026-08-12T09:34:12.100457Z","submitted_at":"2024-12-04T23:12:41Z","title":"Hyper: Hyperparameter Robust Efficient Exploration in Reinforcement Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T22:15:06.974750Z"},"links":{"citing_paper":"/paper/2412.03767"},"observation_digest":"sha256:1d151ccae09e111d6926d0200e275c05877f14d2bc3215eaa13e4ca9893c5c30","observation_id":"8e6e462a-9ed2-46c4-b9da-9a4f92db2151","resolution":{"observed_at":"2026-08-11T22:15:06.974750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:15:14.804294Z","title":"Curiosity-driven exploration by self- supervised prediction","venue":null,"work_id":"6e1d103f-260d-4c05-b5ed-1a87d21fcf5f","year":2017},"citing_paper":{"arxiv_id":"2412.03767","last_updated":"2024-12-04T23:12:41Z","snapshot_observed_at":"2026-08-12T09:34:12.100457Z","submitted_at":"2024-12-04T23:12:41Z","title":"Hyper: Hyperparameter Robust Efficient Exploration in Reinforcement Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T22:15:07.001141Z"},"links":{"citing_paper":"/paper/2412.03767"},"observation_digest":"sha256:1111d9336ed2482c5eb5ce4ef9e78b3d0aa5d72bef51bc1dd51aa8a71b4772f6","observation_id":"e641409a-cf0c-4a48-bc3b-ea8bf34a12af","resolution":{"observed_at":"2026-08-11T22:15:14.834946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:15:14.764897Z","title":"Count-based exploration with neural density models","venue":null,"work_id":"bd2e620d-62a3-4762-af3a-1bead74150bf","year":2017},"citing_paper":{"arxiv_id":"2412.03767","last_updated":"2024-12-04T23:12:41Z","snapshot_observed_at":"2026-08-12T09:34:12.100457Z","submitted_at":"2024-12-04T23:12:41Z","title":"Hyper: Hyperparameter Robust Efficient Exploration in Reinforcement Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T22:15:07.030124Z"},"links":{"citing_paper":"/paper/2412.03767"},"observation_digest":"sha256:7ca3c3cd2978760f0bff0f69cb2235c82cd599d9be39b7a0394fdccc7a64b629","observation_id":"2329f066-004c-4d96-a2be-25cf83995d4e","resolution":{"observed_at":"2026-08-11T22:15:14.787945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.12894","last_updated":"2018-10-30T17:44:42Z","snapshot_observed_at":"2026-08-12T12:07:37.369391Z","submitted_at":"2018-10-30T17:44:42Z","title":"Exploration by Random Network Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.12894","snapshot_observed_at":"2026-08-11T22:15:07.085548Z","title":"Exploration by random network distillation","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.03767","last_updated":"2024-12-04T23:12:41Z","snapshot_observed_at":"2026-08-12T09:34:12.100457Z","submitted_at":"2024-12-04T23:12:41Z","title":"Hyper: Hyperparameter Robust Efficient Exploration in Reinforcement Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T22:15:07.085548Z"},"links":{"cited_paper":"/paper/1810.12894","citing_paper":"/paper/2412.03767"},"observation_digest":"sha256:67e2541f8b9bb6c51a791f74d57563298b4f7063431807e035b70c04fa9fb9f6","observation_id":"64bacd47-a6d9-4b9a-9f86-fb6817e829a8","resolution":{"observed_at":"2026-08-11T22:15:07.085548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:15:07.175685Z","title":"Count-based exploration with the successor representation","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.03767","last_updated":"2024-12-04T23:12:41Z","snapshot_observed_at":"2026-08-12T09:34:12.100457Z","submitted_at":"2024-12-04T23:12:41Z","title":"Hyper: Hyperparameter Robust Efficient Exploration in Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T22:15:07.175685Z"},"links":{"citing_paper":"/paper/2412.03767"},"observation_digest":"sha256:5ffd4e93b0c7650dbee8e6b818c11150fa3aa4a7234679b02f39f92a564e6bb9","observation_id":"65300bd7-1be3-4533-a0fe-c8462a1fa556","resolution":{"observed_at":"2026-08-11T22:15:07.175685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:15:14.524748Z","title":"Self-supervised exploration via disagreement","venue":null,"work_id":"f549c736-2bf4-4cb1-98f3-7dc122e4288a","year":2019},"citing_paper":{"arxiv_id":"2412.03767","last_updated":"2024-12-04T23:12:41Z","snapshot_observed_at":"2026-08-12T09:34:12.100457Z","submitted_at":"2024-12-04T23:12:41Z","title":"Hyper: Hyperparameter Robust Efficient Exploration in Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T22:15:07.234843Z"},"links":{"citing_paper":"/paper/2412.03767"},"observation_digest":"sha256:98c260a2ed13edf2c8db7862171b962177e01ec872381480ed5afda364c84118","observation_id":"68ef5268-d29d-4128-a877-3d8b8ac5d113","resolution":{"observed_at":"2026-08-11T22:15:14.574751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:15:07.294747Z","title":"Using confidence bounds for exploitation-exploration trade-offs","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2412.03767","last_updated":"2024-12-04T23:12:41Z","snapshot_observed_at":"2026-08-12T09:34:12.100457Z","submitted_at":"2024-12-04T23:12:41Z","title":"Hyper: Hyperparameter Robust Efficient Exploration in Reinforcement Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T22:15:07.294747Z"},"links":{"citing_paper":"/paper/2412.03767"},"observation_digest":"sha256:8e81e5ceb2358e78e66850b1e74435e86a91426f9af3c75472bf36f9250a0a91","observation_id":"47bcd4c3-323b-46c9-b3f5-4db9e47f67be","resolution":{"observed_at":"2026-08-11T22:15:07.294747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:15:14.333616Z","title":"Minimax regret bounds for reinforcement learning","venue":null,"work_id":"442ee527-ca33-4eb2-86a2-df29cf276a86","year":2017},"citing_paper":{"arxiv_id":"2412.03767","last_updated":"2024-12-04T23:12:41Z","snapshot_observed_at":"2026-08-12T09:34:12.100457Z","submitted_at":"2024-12-04T23:12:41Z","title":"Hyper: Hyperparameter Robust Efficient Exploration in Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T22:15:07.354760Z"},"links":{"citing_paper":"/paper/2412.03767"},"observation_digest":"sha256:485532d2088ab6e130df283853caee8391af8f09b45bbf6b95c7bc291fbe1873","observation_id":"ab6e9ae4-2d5a-4412-9fc2-558f9265cf33","resolution":{"observed_at":"2026-08-11T22:15:14.358712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:15:07.426786Z","title":"Is q-learning provably efficient? Advances in neural information processing systems, 31, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.03767","last_updated":"2024-12-04T23:12:41Z","snapshot_observed_at":"2026-08-12T09:34:12.100457Z","submitted_at":"2024-12-04T23:12:41Z","title":"Hyper: Hyperparameter Robust Efficient Exploration in Reinforcement Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T22:15:07.426786Z"},"links":{"citing_paper":"/paper/2412.03767"},"observation_digest":"sha256:cbd40f55ed684c3d05c409ee68275efb5caa372b242cd64b511f0e10bc7f5599","observation_id":"f7dfa20d-b28b-466d-812e-1002fb601f6c","resolution":{"observed_at":"2026-08-11T22:15:07.426786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:15:14.127414Z","title":"Reinforcement learning in feature space: Matrix bandit, kernels, and regret bound","venue":null,"work_id":"e50f6813-fc98-46a4-b57a-d3b324d1706f","year":2020},"citing_paper":{"arxiv_id":"2412.03767","last_updated":"2024-12-04T23:12:41Z","snapshot_observed_at":"2026-08-12T09:34:12.100457Z","submitted_at":"2024-12-04T23:12:41Z","title":"Hyper: Hyperparameter Robust Efficient Exploration in Reinforcement Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T22:15:07.464747Z"},"links":{"citing_paper":"/paper/2412.03767"},"observation_digest":"sha256:1d7495668617dc9c6a9037e781e1363ee1787043c83f35c538a63ee4b11f0e67","observation_id":"04c70e77-3fdf-454a-a204-5f97e96e1c3e","resolution":{"observed_at":"2026-08-11T22:15:14.164871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:15:14.069541Z","title":"Provably efficient reinforcement learning with linear function approximation","venue":null,"work_id":"78a03a84-5aee-4d49-9281-4b9aad5002db","year":2020},"citing_paper":{"arxiv_id":"2412.03767","last_updated":"2024-12-04T23:12:41Z","snapshot_observed_at":"2026-08-12T09:34:12.100457Z","submitted_at":"2024-12-04T23:12:41Z","title":"Hyper: Hyperparameter Robust Efficient Exploration in Reinforcement Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T22:15:07.506898Z"},"links":{"citing_paper":"/paper/2412.03767"},"observation_digest":"sha256:7df4721ffa31841bc090c03736e79c9501a66c144ba5694b4ea13d6200967fce","observation_id":"3b7e0732-f27d-4879-ba03-095be3993881","resolution":{"observed_at":"2026-08-11T22:15:14.087733Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:15:13.952802Z","title":"Decoupling exploration and exploitation in reinforcement learning","venue":null,"work_id":"d3b734fc-879f-40c8-a789-a9b3303cb377","year":2021},"citing_paper":{"arxiv_id":"2412.03767","last_updated":"2024-12-04T23:12:41Z","snapshot_observed_at":"2026-08-12T09:34:12.100457Z","submitted_at":"2024-12-04T23:12:41Z","title":"Hyper: Hyperparameter Robust Efficient Exploration in Reinforcement Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T22:15:07.560684Z"},"links":{"citing_paper":"/paper/2412.03767"},"observation_digest":"sha256:c966a681abce7c3c6501afce237946cedc4ba9d28bd25959da698f57af94a96c","observation_id":"33bc6ba8-d99a-40b3-a9bf-90fad04cc456","resolution":{"observed_at":"2026-08-11T22:15:14.004750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2101.09458","last_updated":"2021-07-01T16:03:55Z","snapshot_observed_at":"2026-08-06T01:52:53.175095Z","submitted_at":"2021-01-23T08:51:04Z","title":"Decoupled Exploration and Exploitation Policies for Sample-Efficient Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.09458","snapshot_observed_at":"2026-08-11T22:15:07.599131Z","title":"Decoupled exploration and exploitation policies for sample-efficient reinforcement learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.03767","last_updated":"2024-12-04T23:12:41Z","snapshot_observed_at":"2026-08-12T09:34:12.100457Z","submitted_at":"2024-12-04T23:12:41Z","title":"Hyper: Hyperparameter Robust Efficient Exploration in Reinforcement Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T22:15:07.599131Z"},"links":{"cited_paper":"/paper/2101.09458","citing_paper":"/paper/2412.03767"},"observation_digest":"sha256:af8f32f9cd037e1807a77d7f19e87a2fd25bb11f7d443d1990ac505bd7677512","observation_id":"8bd19351-5d4d-4e01-8c62-7f86af3a70d8","resolution":{"observed_at":"2026-08-11T22:15:07.599131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:15:13.837481Z","title":"A markovian decision process","venue":null,"work_id":"a6aa9112-a848-415e-b91f-bd173a1d95c9","year":1957},"citing_paper":{"arxiv_id":"2412.03767","last_updated":"2024-12-04T23:12:41Z","snapshot_observed_at":"2026-08-12T09:34:12.100457Z","submitted_at":"2024-12-04T23:12:41Z","title":"Hyper: Hyperparameter Robust Efficient Exploration in Reinforcement Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T22:15:07.624746Z"},"links":{"citing_paper":"/paper/2412.03767"},"observation_digest":"sha256:a38567b790474b0f20276764012dc6599ee989517b615b2ef98bf4704e7234ec","observation_id":"d1f09285-4e35-4751-9c94-7a6d79a46543","resolution":{"observed_at":"2026-08-11T22:15:13.884744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:15:07.654754Z","title":"Q-learning","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2412.03767","last_updated":"2024-12-04T23:12:41Z","snapshot_observed_at":"2026-08-12T09:34:12.100457Z","submitted_at":"2024-12-04T23:12:41Z","title":"Hyper: Hyperparameter Robust Efficient Exploration in Reinforcement Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T22:15:07.654754Z"},"links":{"citing_paper":"/paper/2412.03767"},"observation_digest":"sha256:5d3ddf3d15c4349137afc70297848024c2b4847ca2155975b52405f5b32e0283","observation_id":"3f2ce05c-dd91-4d4b-9c40-10a93e2dbee2","resolution":{"observed_at":"2026-08-11T22:15:07.654754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:15:13.673215Z","title":"Sample-optimal parametric q-learning using linearly additive features","venue":null,"work_id":"991dd1b3-7f64-466c-abb6-8b11c287b17d","year":2019},"citing_paper":{"arxiv_id":"2412.03767","last_updated":"2024-12-04T23:12:41Z","snapshot_observed_at":"2026-08-12T09:34:12.100457Z","submitted_at":"2024-12-04T23:12:41Z","title":"Hyper: Hyperparameter Robust Efficient Exploration in Reinforcement Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T22:15:07.702779Z"},"links":{"citing_paper":"/paper/2412.03767"},"observation_digest":"sha256:4930aa346e6ffea9880e971b442e3e851f5ee1a8e579c6c6d343dd400a938b5d","observation_id":"128d976f-aa71-4d07-a54b-8d6d74e4b6c6","resolution":{"observed_at":"2026-08-11T22:15:13.693847Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:15:07.754751Z","title":"Addressing function approximation error in actor-critic methods","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.03767","last_updated":"2024-12-04T23:12:41Z","snapshot_observed_at":"2026-08-12T09:34:12.100457Z","submitted_at":"2024-12-04T23:12:41Z","title":"Hyper: Hyperparameter Robust Efficient Exploration in Reinforcement Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T22:15:07.754751Z"},"links":{"citing_paper":"/paper/2412.03767"},"observation_digest":"sha256:b6f312795554cdd1bf0ae39610e832fe5eed373e4bd54225a0823be1a14684d6","observation_id":"98021d54-31fd-4116-b296-44297a5eab4f","resolution":{"observed_at":"2026-08-11T22:15:07.754751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-11T22:15:07.794754Z","title":"D4rl: Datasets for deep data-driven reinforcement learning","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2412.03767","last_updated":"2024-12-04T23:12:41Z","snapshot_observed_at":"2026-08-12T09:34:12.100457Z","submitted_at":"2024-12-04T23:12:41Z","title":"Hyper: Hyperparameter Robust Efficient Exploration in Reinforcement Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T22:15:07.794754Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2412.03767"},"observation_digest":"sha256:dd268b594d7b5362e06cc77d4f7ae892f0074cad83a725d32c5aea923c24212b","observation_id":"85190290-751b-4b7f-bd7b-b1710f629b3e","resolution":{"observed_at":"2026-08-11T22:15:07.794754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:15:07.815965Z","title":"Mujoco: A physics engine for model-based control","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2412.03767","last_updated":"2024-12-04T23:12:41Z","snapshot_observed_at":"2026-08-12T09:34:12.100457Z","submitted_at":"2024-12-04T23:12:41Z","title":"Hyper: Hyperparameter Robust Efficient Exploration in Reinforcement Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T22:15:07.815965Z"},"links":{"citing_paper":"/paper/2412.03767"},"observation_digest":"sha256:ef20db65e96a4229424813c2ae25194fa78b346a3ef1faf0018b8c13f02af222","observation_id":"4e59b5a9-1f9c-46fc-a131-2ce1a955dc52","resolution":{"observed_at":"2026-08-11T22:15:07.815965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:15:07.856198Z","title":"On the likelihood that one unknown probability exceeds another in view of the evidence of two samples","venue":null,"work_id":null,"year":1933},"citing_paper":{"arxiv_id":"2412.03767","last_updated":"2024-12-04T23:12:41Z","snapshot_observed_at":"2026-08-12T09:34:12.100457Z","submitted_at":"2024-12-04T23:12:41Z","title":"Hyper: Hyperparameter Robust Efficient Exploration in Reinforcement Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T22:15:07.856198Z"},"links":{"citing_paper":"/paper/2412.03767"},"observation_digest":"sha256:620e6c3f639dfbae4a1ad0047e69a6da290ed832fd0f416cd7d7de68080d7836","observation_id":"05a83d6f-1fd5-4a22-b5ca-f2c75d4819bf","resolution":{"observed_at":"2026-08-11T22:15:07.856198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:15:13.398408Z","title":"Intrinsic motivation systems for autonomous mental development","venue":null,"work_id":"99d0038b-b409-4d1f-8c45-f73cb9690e7f","year":2007},"citing_paper":{"arxiv_id":"2412.03767","last_updated":"2024-12-04T23:12:41Z","snapshot_observed_at":"2026-08-12T09:34:12.100457Z","submitted_at":"2024-12-04T23:12:41Z","title":"Hyper: Hyperparameter Robust Efficient Exploration in Reinforcement Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T22:15:07.890468Z"},"links":{"citing_paper":"/paper/2412.03767"},"observation_digest":"sha256:975e5823cba4cb49522cf2e5eb7d51a58e8ca263d674e1214310cfaf39508c71","observation_id":"4b104fa7-23b0-41f8-a669-27613a683d74","resolution":{"observed_at":"2026-08-11T22:15:13.410220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:15:13.344992Z","title":"# exploration: A study of count-based exploration for deep reinforcement learning","venue":null,"work_id":"3891aa4f-4b4a-4ab9-85cc-96d7973924ff","year":2017},"citing_paper":{"arxiv_id":"2412.03767","last_updated":"2024-12-04T23:12:41Z","snapshot_observed_at":"2026-08-12T09:34:12.100457Z","submitted_at":"2024-12-04T23:12:41Z","title":"Hyper: Hyperparameter Robust Efficient Exploration in Reinforcement Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T22:15:07.924750Z"},"links":{"citing_paper":"/paper/2412.03767"},"observation_digest":"sha256:1aba866cb01b7545052fa81704f7388bdd5a4980e09a7e2f9b6861d0b27d797f","observation_id":"faf025e1-c39c-4958-876f-773b523613b0","resolution":{"observed_at":"2026-08-11T22:15:13.374746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1804.04012","last_updated":"2018-04-11T14:21:53Z","snapshot_observed_at":"2026-08-10T10:59:40.804443Z","submitted_at":"2018-04-11T14:21:53Z","title":"DORA The Explorer: Directed Outreaching Reinforcement Action-Selection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.04012","snapshot_observed_at":"2026-08-11T22:15:07.964749Z","title":"Dora the explorer: Directed outreaching reinforcement action-selection","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.03767","last_updated":"2024-12-04T23:12:41Z","snapshot_observed_at":"2026-08-12T09:34:12.100457Z","submitted_at":"2024-12-04T23:12:41Z","title":"Hyper: Hyperparameter Robust Efficient Exploration in Reinforcement Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T22:15:07.964749Z"},"links":{"cited_paper":"/paper/1804.04012","citing_paper":"/paper/2412.03767"},"observation_digest":"sha256:d44fb3720dcfd81d0b03cbcf288dc9aa8a4096d0eb20dab73b1093ff7ca26f24","observation_id":"db2679fb-1c8f-4e62-9d24-1f5c9217bc7b","resolution":{"observed_at":"2026-08-11T22:15:07.964749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1901.10995","last_updated":"2021-02-26T21:21:11Z","snapshot_observed_at":"2026-08-12T17:08:25.418798Z","submitted_at":"2019-01-30T18:40:37Z","title":"Go-Explore: a New Approach for Hard-Exploration Problems","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.10995","snapshot_observed_at":"2026-08-11T22:15:07.996689Z","title":"Go-explore: a new approach for hard-exploration problems","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2412.03767","last_updated":"2024-12-04T23:12:41Z","snapshot_observed_at":"2026-08-12T09:34:12.100457Z","submitted_at":"2024-12-04T23:12:41Z","title":"Hyper: Hyperparameter Robust Efficient Exploration in Reinforcement Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T22:15:07.996689Z"},"links":{"cited_paper":"/paper/1901.10995","citing_paper":"/paper/2412.03767"},"observation_digest":"sha256:abc8822a67822c5d4824f8dc765ceb9921aeaa6bb7a114319cc149f43edec254","observation_id":"0002ce96-1da6-4f36-84cb-ec4a8d0951fc","resolution":{"observed_at":"2026-08-11T22:15:07.996689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:15:13.228966Z","title":"Bayesian reinforcement learning: A survey","venue":null,"work_id":"7f896666-0360-41e6-b8d7-282f3bea2630","year":2015},"citing_paper":{"arxiv_id":"2412.03767","last_updated":"2024-12-04T23:12:41Z","snapshot_observed_at":"2026-08-12T09:34:12.100457Z","submitted_at":"2024-12-04T23:12:41Z","title":"Hyper: Hyperparameter Robust Efficient Exploration in Reinforcement Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T22:15:08.011642Z"},"links":{"citing_paper":"/paper/2412.03767"},"observation_digest":"sha256:bb1635c2ccd0ceea3e2c1df58cead05475dd4225f1944c73b76b28ca0fd6f726","observation_id":"1a2de18c-5b05-43eb-a53b-d391695f7c9d","resolution":{"observed_at":"2026-08-11T22:15:13.264224Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.10295","last_updated":"2019-07-09T09:57:23Z","snapshot_observed_at":"2026-08-12T09:33:34.058010Z","submitted_at":"2017-06-30T17:56:19Z","title":"Noisy Networks for Exploration","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.10295","snapshot_observed_at":"2026-08-11T22:15:08.036093Z","title":"Noisy networks for exploration","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.03767","last_updated":"2024-12-04T23:12:41Z","snapshot_observed_at":"2026-08-12T09:34:12.100457Z","submitted_at":"2024-12-04T23:12:41Z","title":"Hyper: Hyperparameter Robust Efficient Exploration in Reinforcement Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T22:15:08.036093Z"},"links":{"cited_paper":"/paper/1706.10295","citing_paper":"/paper/2412.03767"},"observation_digest":"sha256:ea93c30dacc374f8d337a630408dbc81b006949f94be67230604b6122535e058","observation_id":"60c46138-98ad-4aa7-b6d3-44fde8f74f58","resolution":{"observed_at":"2026-08-11T22:15:08.036093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:15:08.066238Z","title":"Deep exploration via bootstrapped dqn","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.03767","last_updated":"2024-12-04T23:12:41Z","snapshot_observed_at":"2026-08-12T09:34:12.100457Z","submitted_at":"2024-12-04T23:12:41Z","title":"Hyper: Hyperparameter Robust Efficient Exploration in Reinforcement Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T22:15:08.066238Z"},"links":{"citing_paper":"/paper/2412.03767"},"observation_digest":"sha256:e23a15a066f60dc3ec8d36b34598cabe256f8f6a0ff4047b62b186c850b3211f","observation_id":"bd4eb3cb-e7ce-48cd-a173-7862acf5787b","resolution":{"observed_at":"2026-08-11T22:15:08.066238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:15:08.104763Z","title":"Between mdps and semi-mdps: A framework for temporal abstraction in reinforcement learning","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2412.03767","last_updated":"2024-12-04T23:12:41Z","snapshot_observed_at":"2026-08-12T09:34:12.100457Z","submitted_at":"2024-12-04T23:12:41Z","title":"Hyper: Hyperparameter Robust Efficient Exploration in Reinforcement Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T22:15:08.104763Z"},"links":{"citing_paper":"/paper/2412.03767"},"observation_digest":"sha256:f413b8bc23c344573db4bfa5eda1a9660a7cad319a855d84884c68dc6da5983d","observation_id":"e7ab1784-c3be-4c0c-955f-70b573cb2ec2","resolution":{"observed_at":"2026-08-11T22:15:08.104763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:15:08.144746Z","title":"The option-critic architecture","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.03767","last_updated":"2024-12-04T23:12:41Z","snapshot_observed_at":"2026-08-12T09:34:12.100457Z","submitted_at":"2024-12-04T23:12:41Z","title":"Hyper: Hyperparameter Robust Efficient Exploration in Reinforcement Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T22:15:08.144746Z"},"links":{"citing_paper":"/paper/2412.03767"},"observation_digest":"sha256:da5f76ce60729327a020a2dd936976eb6ae3b5b4b310d2565b14361748e0562e","observation_id":"bbfcc985-d3fc-420c-b456-82a1cf45a88c","resolution":{"observed_at":"2026-08-11T22:15:08.144746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.01782","last_updated":"2020-06-02T17:02:55Z","snapshot_observed_at":"2026-08-08T01:28:54.336443Z","submitted_at":"2020-06-02T17:02:55Z","title":"Temporally-Extended {\\epsilon}-Greedy Exploration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.01782","snapshot_observed_at":"2026-08-11T22:15:08.194750Z","title":"Temporally-extended {\\epsilon}-greedy exploration","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2412.03767","last_updated":"2024-12-04T23:12:41Z","snapshot_observed_at":"2026-08-12T09:34:12.100457Z","submitted_at":"2024-12-04T23:12:41Z","title":"Hyper: Hyperparameter Robust Efficient Exploration in Reinforcement Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T22:15:08.194750Z"},"links":{"cited_paper":"/paper/2006.01782","citing_paper":"/paper/2412.03767"},"observation_digest":"sha256:55cc8c6c8802e1f6a4367fc7d9ad9b42de360a6ed0fe9212a60f178386146fd3","observation_id":"f4aaee55-e2ac-4197-9a3c-a0591c7617a7","resolution":{"observed_at":"2026-08-11T22:15:08.194750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:15:12.884751Z","title":"Redeeming intrinsic rewards via constrained optimization","venue":null,"work_id":"6ebd41b6-dbb1-4051-8b18-4ccba46d653e","year":2022},"citing_paper":{"arxiv_id":"2412.03767","last_updated":"2024-12-04T23:12:41Z","snapshot_observed_at":"2026-08-12T09:34:12.100457Z","submitted_at":"2024-12-04T23:12:41Z","title":"Hyper: Hyperparameter Robust Efficient Exploration in Reinforcement Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T22:15:08.264752Z"},"links":{"citing_paper":"/paper/2412.03767"},"observation_digest":"sha256:c4c014764a287dca1a57ef678a530157b830032ef182f165ab2a2e0973432e51","observation_id":"271d509a-fdfa-44ae-80c1-671978738de5","resolution":{"observed_at":"2026-08-11T22:15:12.934749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03342","last_updated":"2024-09-08T11:22:48Z","snapshot_observed_at":"2026-08-09T01:05:01.502708Z","submitted_at":"2023-10-05T06:49:52Z","title":"LESSON: Learning to Integrate Exploration Strategies for Reinforcement Learning via an Option Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03342","snapshot_observed_at":"2026-08-11T22:15:08.324750Z","title":"Lesson: learning to integrate exploration strategies for reinforcement learning via an option framework","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03767","last_updated":"2024-12-04T23:12:41Z","snapshot_observed_at":"2026-08-12T09:34:12.100457Z","submitted_at":"2024-12-04T23:12:41Z","title":"Hyper: Hyperparameter Robust Efficient Exploration in Reinforcement Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T22:15:08.324750Z"},"links":{"cited_paper":"/paper/2310.03342","citing_paper":"/paper/2412.03767"},"observation_digest":"sha256:e3768f4aa8dc9ae37901a2c80dccc4fe202f4cac123d0a1a94e0776018dce981","observation_id":"71e915c1-a226-46d4-aed6-19f27206c9ca","resolution":{"observed_at":"2026-08-11T22:15:08.324750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:15:12.766805Z","title":"Decoupling exploration and exploitation for meta- reinforcement learning without sacrifices","venue":null,"work_id":"dae028d4-fd0b-402e-9f69-71f481edc033","year":2021},"citing_paper":{"arxiv_id":"2412.03767","last_updated":"2024-12-04T23:12:41Z","snapshot_observed_at":"2026-08-12T09:34:12.100457Z","submitted_at":"2024-12-04T23:12:41Z","title":"Hyper: Hyperparameter Robust Efficient Exploration in Reinforcement Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T22:15:08.375104Z"},"links":{"citing_paper":"/paper/2412.03767"},"observation_digest":"sha256:2f5d0726b82c5ecd047836e9d0c4e8f310ddf7757ebd6aaa845d0b2165810dcf","observation_id":"4712356e-d74f-4682-abf0-fac63198ccaf","resolution":{"observed_at":"2026-08-11T22:15:12.800760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:15:12.634741Z","title":"Improved algorithms for linear stochastic bandits","venue":null,"work_id":"569a7be5-dfd9-41c0-b87c-301e685d4235","year":2011},"citing_paper":{"arxiv_id":"2412.03767","last_updated":"2024-12-04T23:12:41Z","snapshot_observed_at":"2026-08-12T09:34:12.100457Z","submitted_at":"2024-12-04T23:12:41Z","title":"Hyper: Hyperparameter Robust Efficient Exploration in Reinforcement Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T22:15:08.424747Z"},"links":{"citing_paper":"/paper/2412.03767"},"observation_digest":"sha256:1aff4b94c2a36071948f6fddaf653c6f84d2b46c79fadd182f5c5cbf49b1c0d3","observation_id":"b508ad01-c083-4f05-9667-f25dc12f9852","resolution":{"observed_at":"2026-08-11T22:15:12.681661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:15:12.494840Z","title":"healthy reward","venue":null,"work_id":"6f26db12-4182-4564-b65e-a303c6854579","year":null},"citing_paper":{"arxiv_id":"2412.03767","last_updated":"2024-12-04T23:12:41Z","snapshot_observed_at":"2026-08-12T09:34:12.100457Z","submitted_at":"2024-12-04T23:12:41Z","title":"Hyper: Hyperparameter Robust Efficient Exploration in Reinforcement Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T22:15:08.474749Z"},"links":{"citing_paper":"/paper/2412.03767"},"observation_digest":"sha256:535a3a3da84b144004e0709ca14b65390a308f52ecf2b60dd233c9e0b08b8d79","observation_id":"3b90f39c-5e0e-4d96-b646-1ad6e1f70fb1","resolution":{"observed_at":"2026-08-11T22:15:12.544744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:15:12.336972Z","title":null,"venue":null,"work_id":"3647a48c-67fc-4932-8d6c-9f2465371a76","year":null},"citing_paper":{"arxiv_id":"2412.03767","last_updated":"2024-12-04T23:12:41Z","snapshot_observed_at":"2026-08-12T09:34:12.100457Z","submitted_at":"2024-12-04T23:12:41Z","title":"Hyper: Hyperparameter Robust Efficient Exploration in Reinforcement Learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T22:15:08.534749Z"},"links":{"citing_paper":"/paper/2412.03767"},"observation_digest":"sha256:e5699afcf6c0a906e7ce22a44de481299fcb71ab64ddf335812b083f225a38af","observation_id":"64bbd336-8514-4a9e-9b96-3a84893009f4","resolution":{"observed_at":"2026-08-11T22:15:12.394744Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:15:12.225692Z","title":null,"venue":null,"work_id":"764d8b04-54fc-4882-877a-96687fc35f08","year":null},"citing_paper":{"arxiv_id":"2412.03767","last_updated":"2024-12-04T23:12:41Z","snapshot_observed_at":"2026-08-12T09:34:12.100457Z","submitted_at":"2024-12-04T23:12:41Z","title":"Hyper: Hyperparameter Robust Efficient Exploration in Reinforcement Learning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T22:15:08.584750Z"},"links":{"citing_paper":"/paper/2412.03767"},"observation_digest":"sha256:0336037ee5a3000d83990b86745a5142a85666f5bdd14cb857ccf5ca874cfd83","observation_id":"bb213bf0-c021-46e3-b007-99e2d45802cc","resolution":{"observed_at":"2026-08-11T22:15:12.273545Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:15:12.144748Z","title":null,"venue":null,"work_id":"624fa6db-0322-47bd-8b1e-1bdc8379dff1","year":null},"citing_paper":{"arxiv_id":"2412.03767","last_updated":"2024-12-04T23:12:41Z","snapshot_observed_at":"2026-08-12T09:34:12.100457Z","submitted_at":"2024-12-04T23:12:41Z","title":"Hyper: Hyperparameter Robust Efficient Exploration in Reinforcement Learning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T22:15:08.634752Z"},"links":{"citing_paper":"/paper/2412.03767"},"observation_digest":"sha256:9af4f89c539fb1883f587c3fcca7730e6847ed65521b6e3f59ff1043cfbbe901","observation_id":"bbcfd74b-7ed8-4f46-a22b-763fb7180bd3","resolution":{"observed_at":"2026-08-11T22:15:12.168873Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:15:12.001668Z","title":null,"venue":null,"work_id":"b73b032d-49c3-4c38-9c4a-992f635fa8ad","year":null},"citing_paper":{"arxiv_id":"2412.03767","last_updated":"2024-12-04T23:12:41Z","snapshot_observed_at":"2026-08-12T09:34:12.100457Z","submitted_at":"2024-12-04T23:12:41Z","title":"Hyper: Hyperparameter Robust Efficient Exploration in Reinforcement Learning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T22:15:08.684749Z"},"links":{"citing_paper":"/paper/2412.03767"},"observation_digest":"sha256:009bddfc91fbee98f7cc63a6e7a0f4b7722b429c58647804cf18149c5c95da7c","observation_id":"bb7bb341-8ed3-4940-8281-747c3d8bf1c3","resolution":{"observed_at":"2026-08-11T22:15:12.044746Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:15:11.914742Z","title":"And further, X k∈I ˆV k 1 (sk","venue":null,"work_id":"cc610915-db17-43f2-bffb-8a9a328fb138","year":null},"citing_paper":{"arxiv_id":"2412.03767","last_updated":"2024-12-04T23:12:41Z","snapshot_observed_at":"2026-08-12T09:34:12.100457Z","submitted_at":"2024-12-04T23:12:41Z","title":"Hyper: Hyperparameter Robust Efficient Exploration in Reinforcement Learning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T22:15:08.715584Z"},"links":{"citing_paper":"/paper/2412.03767"},"observation_digest":"sha256:5b95d3ab8151e90f8ba1894aac8a57510a09388044bdb8bbb972f738f4db48cd","observation_id":"044fc1a1-a401-4154-8631-ac68a34efe74","resolution":{"observed_at":"2026-08-11T22:15:11.934771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:15:11.804797Z","title":null,"venue":null,"work_id":"126d9846-3837-472b-aea5-20c104300a8a","year":null},"citing_paper":{"arxiv_id":"2412.03767","last_updated":"2024-12-04T23:12:41Z","snapshot_observed_at":"2026-08-12T09:34:12.100457Z","submitted_at":"2024-12-04T23:12:41Z","title":"Hyper: Hyperparameter Robust Efficient Exploration in Reinforcement Learning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T22:15:08.754750Z"},"links":{"citing_paper":"/paper/2412.03767"},"observation_digest":"sha256:fc42abb8ddf0517ec3332bc65ce0207660b83a921ca79d0d4d94a5ca446eab89","observation_id":"18b5cdc6-d7b9-4d7c-adf4-867574b3376d","resolution":{"observed_at":"2026-08-11T22:15:11.854927Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:15:11.722971Z","title":null,"venue":null,"work_id":"7705a6b4-601b-42f5-bf1c-13ad4e2805d3","year":null},"citing_paper":{"arxiv_id":"2412.03767","last_updated":"2024-12-04T23:12:41Z","snapshot_observed_at":"2026-08-12T09:34:12.100457Z","submitted_at":"2024-12-04T23:12:41Z","title":"Hyper: Hyperparameter Robust Efficient Exploration in Reinforcement Learning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T22:15:08.783299Z"},"links":{"citing_paper":"/paper/2412.03767"},"observation_digest":"sha256:73b68c1dc43cf80bf11ecd84bfd5d527fcb637af8062bde38881f248092c656f","observation_id":"b0b6a364-8c63-42a2-9be8-af6df57fd8fd","resolution":{"observed_at":"2026-08-11T22:15:11.764744Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:15:11.677816Z","title":null,"venue":null,"work_id":"6848469e-12f1-4d2f-aa46-5276c3b99f95","year":null},"citing_paper":{"arxiv_id":"2412.03767","last_updated":"2024-12-04T23:12:41Z","snapshot_observed_at":"2026-08-12T09:34:12.100457Z","submitted_at":"2024-12-04T23:12:41Z","title":"Hyper: Hyperparameter Robust Efficient Exploration in Reinforcement Learning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T22:15:08.814756Z"},"links":{"citing_paper":"/paper/2412.03767"},"observation_digest":"sha256:d5e37c98d121837bae02ae32e5b150c117e8d39507e5f8a79a881c627d0ee71e","observation_id":"f177c735-10fd-493b-8169-6ea3309ad979","resolution":{"observed_at":"2026-08-11T22:15:11.686497Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:15:11.611247Z","title":null,"venue":null,"work_id":"4ac90053-c796-4bb4-a08f-13fb53d7aded","year":null},"citing_paper":{"arxiv_id":"2412.03767","last_updated":"2024-12-04T23:12:41Z","snapshot_observed_at":"2026-08-12T09:34:12.100457Z","submitted_at":"2024-12-04T23:12:41Z","title":"Hyper: Hyperparameter Robust Efficient Exploration in Reinforcement Learning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T22:15:08.854751Z"},"links":{"citing_paper":"/paper/2412.03767"},"observation_digest":"sha256:d5047b05ebcd286f15e49a0f9a23488001e24bee096ecaace8f3953075fe8b49","observation_id":"27395cf3-b54a-47f4-ab34-03d0d1522bdf","resolution":{"observed_at":"2026-08-11T22:15:11.644824Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:15:11.415975Z","title":null,"venue":null,"work_id":"b219d91c-8984-4530-8a9a-5faa2cbeda30","year":null},"citing_paper":{"arxiv_id":"2412.03767","last_updated":"2024-12-04T23:12:41Z","snapshot_observed_at":"2026-08-12T09:34:12.100457Z","submitted_at":"2024-12-04T23:12:41Z","title":"Hyper: Hyperparameter Robust Efficient Exploration in Reinforcement Learning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T22:15:08.887250Z"},"links":{"citing_paper":"/paper/2412.03767"},"observation_digest":"sha256:500ff5c187bc81869c353a96f4e86c2a2d74346d2aa1fbba5cc1bd45b967df1d","observation_id":"46a2843a-2a71-48c6-88e8-34561d8910d0","resolution":{"observed_at":"2026-08-11T22:15:11.495901Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:15:11.365488Z","title":null,"venue":null,"work_id":"e18f1ff2-e934-44ed-bb6a-e5f7c37a8626","year":null},"citing_paper":{"arxiv_id":"2412.03767","last_updated":"2024-12-04T23:12:41Z","snapshot_observed_at":"2026-08-12T09:34:12.100457Z","submitted_at":"2024-12-04T23:12:41Z","title":"Hyper: Hyperparameter Robust Efficient Exploration in Reinforcement Learning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T22:15:08.937334Z"},"links":{"citing_paper":"/paper/2412.03767"},"observation_digest":"sha256:cd54a2ac618c67cd72f0ecf2f9e68e168bf8b05379f263b63001a298507b42c0","observation_id":"9fbde005-7587-4409-9913-0737366ab294","resolution":{"observed_at":"2026-08-11T22:15:11.385416Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:15:11.234753Z","title":null,"venue":null,"work_id":"5c337d9c-2fd2-480a-b622-47dfe528db2a","year":null},"citing_paper":{"arxiv_id":"2412.03767","last_updated":"2024-12-04T23:12:41Z","snapshot_observed_at":"2026-08-12T09:34:12.100457Z","submitted_at":"2024-12-04T23:12:41Z","title":"Hyper: Hyperparameter Robust Efficient Exploration in Reinforcement Learning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T22:15:08.947509Z"},"links":{"citing_paper":"/paper/2412.03767"},"observation_digest":"sha256:f4e58d5007f009439076480b0f0e568044b0f698cfe33eae523872f76de2c812","observation_id":"bd9f997b-0b94-4f54-8333-d9aaf86b273f","resolution":{"observed_at":"2026-08-11T22:15:11.295153Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:15:11.064809Z","title":null,"venue":null,"work_id":"b07369a4-b9a6-45bf-a26c-376d791a9a78","year":null},"citing_paper":{"arxiv_id":"2412.03767","last_updated":"2024-12-04T23:12:41Z","snapshot_observed_at":"2026-08-12T09:34:12.100457Z","submitted_at":"2024-12-04T23:12:41Z","title":"Hyper: Hyperparameter Robust Efficient Exploration in Reinforcement Learning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T22:15:08.974750Z"},"links":{"citing_paper":"/paper/2412.03767"},"observation_digest":"sha256:13470850c9d6e56469dc441edbcfc3fd67410082fa067d3d35246a686ff4b60a","observation_id":"ad613507-f506-49f9-a00e-6c2fec908dc8","resolution":{"observed_at":"2026-08-11T22:15:11.124748Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:15:10.915206Z","title":null,"venue":null,"work_id":"b5ab4fb6-7fe6-4b7e-819c-4e1c8e374892","year":null},"citing_paper":{"arxiv_id":"2412.03767","last_updated":"2024-12-04T23:12:41Z","snapshot_observed_at":"2026-08-12T09:34:12.100457Z","submitted_at":"2024-12-04T23:12:41Z","title":"Hyper: Hyperparameter Robust Efficient Exploration in Reinforcement Learning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T22:15:09.004749Z"},"links":{"citing_paper":"/paper/2412.03767"},"observation_digest":"sha256:0fecc382c44b0733cac51bb49d4bbae42b9b7e030cc341933c4ceb9ba5832e7b","observation_id":"6e636333-bf5f-418a-9df4-2b0bae31d1bb","resolution":{"observed_at":"2026-08-11T22:15:10.963835Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:15:10.790424Z","title":"By recursively applying Equation","venue":null,"work_id":"3a3f05dd-afa5-4414-8326-760f42b2cead","year":null},"citing_paper":{"arxiv_id":"2412.03767","last_updated":"2024-12-04T23:12:41Z","snapshot_observed_at":"2026-08-12T09:34:12.100457Z","submitted_at":"2024-12-04T23:12:41Z","title":"Hyper: Hyperparameter Robust Efficient Exploration in Reinforcement Learning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T22:15:09.044748Z"},"links":{"citing_paper":"/paper/2412.03767"},"observation_digest":"sha256:9bdd9f0258711661ba1ccbeb1389499456a0f3ce842e96fc3a5bfc51cbe37e94","observation_id":"56747326-f28c-44ad-b205-df13f1e36f05","resolution":{"observed_at":"2026-08-11T22:15:10.834756Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:15:10.674750Z","title":null,"venue":null,"work_id":"de7d65ef-2a42-4f2e-b774-28ff2e339121","year":null},"citing_paper":{"arxiv_id":"2412.03767","last_updated":"2024-12-04T23:12:41Z","snapshot_observed_at":"2026-08-12T09:34:12.100457Z","submitted_at":"2024-12-04T23:12:41Z","title":"Hyper: Hyperparameter Robust Efficient Exploration in Reinforcement Learning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T22:15:09.094752Z"},"links":{"citing_paper":"/paper/2412.03767"},"observation_digest":"sha256:36fcdcbb6523f5e909e121874d0be4969e3225d88727aeb6490b2a2a3655329d","observation_id":"1c08dec8-5c4c-4d53-b80d-a485250dfe38","resolution":{"observed_at":"2026-08-11T22:15:10.695308Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:15:10.514751Z","title":"Hence, the total regret is given by: KX k=1 ˆV k 1 (sk","venue":null,"work_id":"59eb87c0-46db-4d24-a5fa-4271e35f9594","year":null},"citing_paper":{"arxiv_id":"2412.03767","last_updated":"2024-12-04T23:12:41Z","snapshot_observed_at":"2026-08-12T09:34:12.100457Z","submitted_at":"2024-12-04T23:12:41Z","title":"Hyper: Hyperparameter Robust Efficient Exploration in Reinforcement Learning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T22:15:09.119779Z"},"links":{"citing_paper":"/paper/2412.03767"},"observation_digest":"sha256:233defb58c763510948215fab6e1379621261185f83986f0a248fb8d331448e7","observation_id":"4c669c78-15b3-4b06-9ff0-bb53113a9b73","resolution":{"observed_at":"2026-08-11T22:15:10.560933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:15:10.414750Z","title":"And equivalently, we conclude that our algorithm obtains ϵ-optimal policy with ˜O( d3H 4 ϵ2 ) samples with probability at least 1 − δ","venue":null,"work_id":"ea09550d-2829-40e4-917c-98698ef6af35","year":null},"citing_paper":{"arxiv_id":"2412.03767","last_updated":"2024-12-04T23:12:41Z","snapshot_observed_at":"2026-08-12T09:34:12.100457Z","submitted_at":"2024-12-04T23:12:41Z","title":"Hyper: Hyperparameter Robust Efficient Exploration in Reinforcement Learning","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T22:15:09.161752Z"},"links":{"citing_paper":"/paper/2412.03767"},"observation_digest":"sha256:29562ac58fdfd64c9e0a3e04c9b8f2a3e7abf8359cc27ab66542938f4c972125","observation_id":"21551000-93d4-4bbc-881b-c4214708596e","resolution":{"observed_at":"2026-08-11T22:15:10.425577Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.03767","last_updated":"2024-12-04T23:12:41Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-12T09:34:12.100457Z","submitted_at":"2024-12-04T23:12:41Z","title":"Hyper: Hyperparameter Robust Efficient Exploration in Reinforcement Learning"},"reference_resolution":{"displayed":59,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":37,"verified_exact":0,"verified_fuzzy":21},"total_outbound_references":59},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 59 of 59 outbound references and 0 inbound Pith citation observations for arXiv:2412.03767."}