{"as_of":"2026-08-18T00:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fe7cdf8318afc9cec1237285afb60ed0734221493482be2f69ed3866696a90dd","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T21:10:12.221295Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:07:59.951972Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T05:08:00.455034Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.11044","last_updated":"2025-05-16T09:38:21Z","snapshot_observed_at":"2026-08-17T17:11:13.573918Z","submitted_at":"2025-05-16T09:38:21Z","title":"Exploration by Random Distribution Distillation","version":1},"cited_work":{"arxiv_id":"2505.11044","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.11044","snapshot_observed_at":"2026-08-07T05:08:00.455034Z","title":"Exploration by Random Distribution Distillation","venue":"cs.LG","work_id":"a490aa45-20fb-45a3-b402-5f8e38600c4d","year":2025},"citing_paper":{"arxiv_id":"2506.08737","last_updated":"2025-06-10T12:34:00Z","snapshot_observed_at":"2026-08-15T15:10:40.517583Z","submitted_at":"2025-06-10T12:34:00Z","title":"Exploration by Random Reward Perturbation","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T05:07:59.951972Z"},"links":{"cited_paper":"/paper/2505.11044","citing_paper":"/paper/2506.08737"},"observation_digest":"sha256:7c21590d535295923a209a10d4489bc81fa8d98f5e039fb6fd426eda8ecb57f8","observation_id":"b2aa546e-f02f-4124-824a-6c104f9bbef4","resolution":{"observed_at":"2026-08-07T05:08:00.459145Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.11044/citation-record","integrity":"/paper/2505.11044/integrity","json":"/paper/2505.11044/citation-record.json","paper":"/paper/2505.11044"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:10:12.989040Z","title":"Deep exploration via bootstrapped dqn,","venue":null,"work_id":"ed8d9f06-8519-40e4-b2f6-a19c63fb3e54","year":2016},"citing_paper":{"arxiv_id":"2505.11044","last_updated":"2025-05-16T09:38:21Z","snapshot_observed_at":"2026-08-17T17:11:13.573918Z","submitted_at":"2025-05-16T09:38:21Z","title":"Exploration by Random Distribution Distillation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T21:10:11.977476Z"},"links":{"citing_paper":"/paper/2505.11044"},"observation_digest":"sha256:af6cd166eb0f0fd2a83278e1f90058808deb508b58621d9b668c02fee24eba32","observation_id":"0eb65fc1-9d28-4857-9db5-a9974d1e5a56","resolution":{"observed_at":"2026-08-15T21:10:12.994412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:10:11.983113Z","title":"An analysis of model-based interval estimation for markov decision processes,","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2505.11044","last_updated":"2025-05-16T09:38:21Z","snapshot_observed_at":"2026-08-17T17:11:13.573918Z","submitted_at":"2025-05-16T09:38:21Z","title":"Exploration by Random Distribution Distillation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T21:10:11.983113Z"},"links":{"citing_paper":"/paper/2505.11044"},"observation_digest":"sha256:c9af8475b0a65ec2b31eb02d0038fa5cfafe14f2209b201c467f17d11bf14800","observation_id":"f016da28-af73-4286-b8e6-a27bb6062496","resolution":{"observed_at":"2026-08-15T21:10:11.983113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:10:12.960936Z","title":"Minimax regret bounds for reinforcement learning,","venue":null,"work_id":"3c730183-db01-4030-9fb2-03ac9e9fd9fb","year":2017},"citing_paper":{"arxiv_id":"2505.11044","last_updated":"2025-05-16T09:38:21Z","snapshot_observed_at":"2026-08-17T17:11:13.573918Z","submitted_at":"2025-05-16T09:38:21Z","title":"Exploration by Random Distribution Distillation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T21:10:11.989632Z"},"links":{"citing_paper":"/paper/2505.11044"},"observation_digest":"sha256:5fea94a066e3425b100814c80fb74096133e5ace046523d7786591cab844d8fc","observation_id":"a61e4d41-e894-48fd-b0ab-a672e6ba11ad","resolution":{"observed_at":"2026-08-15T21:10:12.966612Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.11173","last_updated":"2023-03-21T22:20:47Z","snapshot_observed_at":"2026-08-16T16:37:20.250547Z","submitted_at":"2022-08-23T20:02:09Z","title":"The Alberta Plan for AI Research","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.11173","snapshot_observed_at":"2026-08-15T21:10:11.995579Z","title":"The alberta plan for ai research,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.11044","last_updated":"2025-05-16T09:38:21Z","snapshot_observed_at":"2026-08-17T17:11:13.573918Z","submitted_at":"2025-05-16T09:38:21Z","title":"Exploration by Random Distribution Distillation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T21:10:11.995579Z"},"links":{"cited_paper":"/paper/2208.11173","citing_paper":"/paper/2505.11044"},"observation_digest":"sha256:4e8d17303fbbe65965b4b86b9aef66e1e39363f2d32ff395836df72a61944c1a","observation_id":"9725abb0-e729-4bfd-8f64-7eeb29a7b53b","resolution":{"observed_at":"2026-08-15T21:10:11.995579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:10:12.944174Z","title":"Unifying count-based exploration and intrinsic motivation,","venue":null,"work_id":"8d4529bf-3d72-4d47-a471-0019c884f299","year":2016},"citing_paper":{"arxiv_id":"2505.11044","last_updated":"2025-05-16T09:38:21Z","snapshot_observed_at":"2026-08-17T17:11:13.573918Z","submitted_at":"2025-05-16T09:38:21Z","title":"Exploration by Random Distribution Distillation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T21:10:12.000973Z"},"links":{"citing_paper":"/paper/2505.11044"},"observation_digest":"sha256:d4159c15d45748f2c125630f196445f5b72624ef006bef2860a52e00eae789a6","observation_id":"1d3b377c-e0b8-4b17-9c1a-0d476d9926ce","resolution":{"observed_at":"2026-08-15T21:10:12.950687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:10:12.926731Z","title":"Flipping coins to estimate pseudocounts for exploration in reinforcement learning,","venue":null,"work_id":"7bd29258-5b89-4e86-b749-c0b793a1ffa7","year":2023},"citing_paper":{"arxiv_id":"2505.11044","last_updated":"2025-05-16T09:38:21Z","snapshot_observed_at":"2026-08-17T17:11:13.573918Z","submitted_at":"2025-05-16T09:38:21Z","title":"Exploration by Random Distribution Distillation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T21:10:12.005610Z"},"links":{"citing_paper":"/paper/2505.11044"},"observation_digest":"sha256:c139af44a9f8c2aab4c86c7b78dfddc3aeb6fcbdc1dae5d30e9c8c2d1710f31b","observation_id":"817e8a24-ba9f-49fe-8186-7c05d023cdf9","resolution":{"observed_at":"2026-08-15T21:10:12.932671Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:10:12.907277Z","title":"Count-based exploration with neural density models,","venue":null,"work_id":"81e3b61b-2f8d-4e3e-b1ee-9e71ddc4c7f2","year":2017},"citing_paper":{"arxiv_id":"2505.11044","last_updated":"2025-05-16T09:38:21Z","snapshot_observed_at":"2026-08-17T17:11:13.573918Z","submitted_at":"2025-05-16T09:38:21Z","title":"Exploration by Random Distribution Distillation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T21:10:12.010837Z"},"links":{"citing_paper":"/paper/2505.11044"},"observation_digest":"sha256:27e40d1e11c8dcb442b107359d5b73d19f5e55838ca2012cd2b834d78e6c2d8a","observation_id":"516956b7-2f51-493f-8ad2-2d9ce29e0446","resolution":{"observed_at":"2026-08-15T21:10:12.912587Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:10:12.889965Z","title":"Count-based exploration with the successor representation,","venue":null,"work_id":"fa67ac35-4f79-4313-9663-cedec388f524","year":2020},"citing_paper":{"arxiv_id":"2505.11044","last_updated":"2025-05-16T09:38:21Z","snapshot_observed_at":"2026-08-17T17:11:13.573918Z","submitted_at":"2025-05-16T09:38:21Z","title":"Exploration by Random Distribution Distillation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T21:10:12.015671Z"},"links":{"citing_paper":"/paper/2505.11044"},"observation_digest":"sha256:7d042ae8ce2bf1c255b630aafc801a4b0fb7edcbaa4b0ef0fce61951a1329d93","observation_id":"8eb97b88-0ec9-4cf7-8bfb-4439e6cb9798","resolution":{"observed_at":"2026-08-15T21:10:12.895576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:10:12.869835Z","title":"Curiosity-driven exploration by self- supervised prediction,","venue":null,"work_id":"01e8faa3-d67f-40fc-b2f6-d1382331afda","year":2017},"citing_paper":{"arxiv_id":"2505.11044","last_updated":"2025-05-16T09:38:21Z","snapshot_observed_at":"2026-08-17T17:11:13.573918Z","submitted_at":"2025-05-16T09:38:21Z","title":"Exploration by Random Distribution Distillation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T21:10:12.020460Z"},"links":{"citing_paper":"/paper/2505.11044"},"observation_digest":"sha256:6a2d15ab3ee01e46ced73defe86626f4a1606e6c8ab4778a87e606e4d05f3b2d","observation_id":"8ca4efab-9682-45c3-98d6-2f9852e4cf09","resolution":{"observed_at":"2026-08-15T21:10:12.875598Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.12894","last_updated":"2018-10-30T17:44:42Z","snapshot_observed_at":"2026-08-14T18:06:54.993797Z","submitted_at":"2018-10-30T17:44:42Z","title":"Exploration by Random Network Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.12894","snapshot_observed_at":"2026-08-15T21:10:12.025295Z","title":"Exploration by random network distillation,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.11044","last_updated":"2025-05-16T09:38:21Z","snapshot_observed_at":"2026-08-17T17:11:13.573918Z","submitted_at":"2025-05-16T09:38:21Z","title":"Exploration by Random Distribution Distillation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T21:10:12.025295Z"},"links":{"cited_paper":"/paper/1810.12894","citing_paper":"/paper/2505.11044"},"observation_digest":"sha256:bb044c4c569145138ec9e8c89738fb1c32a3b49dd38eed210bea1f6d79e95f1a","observation_id":"a6877a50-f0f6-43a4-9779-cc36f7fa25b5","resolution":{"observed_at":"2026-08-15T21:10:12.025295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:10:12.850964Z","title":"Is q-learning provably efficient?","venue":null,"work_id":"73c0b530-2229-4892-b487-6ae4558f0e66","year":2018},"citing_paper":{"arxiv_id":"2505.11044","last_updated":"2025-05-16T09:38:21Z","snapshot_observed_at":"2026-08-17T17:11:13.573918Z","submitted_at":"2025-05-16T09:38:21Z","title":"Exploration by Random Distribution Distillation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T21:10:12.030592Z"},"links":{"citing_paper":"/paper/2505.11044"},"observation_digest":"sha256:64054f796720c9328d24a55686d32f1ab339b552a31a4e291669de152a944ad5","observation_id":"0aaf07ee-afad-4a18-bc13-95d8f3f07399","resolution":{"observed_at":"2026-08-15T21:10:12.856842Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:10:12.832639Z","title":"Exploration and anti-exploration with distributional random network distillation,","venue":null,"work_id":"7c57ec29-caaa-4e5a-994d-f0d29ce5a7ae","year":2024},"citing_paper":{"arxiv_id":"2505.11044","last_updated":"2025-05-16T09:38:21Z","snapshot_observed_at":"2026-08-17T17:11:13.573918Z","submitted_at":"2025-05-16T09:38:21Z","title":"Exploration by Random Distribution Distillation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T21:10:12.035218Z"},"links":{"citing_paper":"/paper/2505.11044"},"observation_digest":"sha256:e604ecaa675775143c0df2cdac8296fa79cae56b4fb2baaf5e1aad5a68daa6b1","observation_id":"8115b221-7f28-4551-9109-4bb4ae93f11b","resolution":{"observed_at":"2026-08-15T21:10:12.838173Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:10:12.039603Z","title":"Q-learning,","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2505.11044","last_updated":"2025-05-16T09:38:21Z","snapshot_observed_at":"2026-08-17T17:11:13.573918Z","submitted_at":"2025-05-16T09:38:21Z","title":"Exploration by Random Distribution Distillation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T21:10:12.039603Z"},"links":{"citing_paper":"/paper/2505.11044"},"observation_digest":"sha256:6c2206e46c72f12342f91ddc590d54177adf401a052cf935aaf054be3a5e4ec7","observation_id":"6615c679-dfe5-454b-a919-25d1a598fbb3","resolution":{"observed_at":"2026-08-15T21:10:12.039603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:10:12.804896Z","title":"Human-level control through deep rein- forcement learning,","venue":null,"work_id":"0c94b826-9ccb-448b-9bf6-ceba0aee5892","year":2015},"citing_paper":{"arxiv_id":"2505.11044","last_updated":"2025-05-16T09:38:21Z","snapshot_observed_at":"2026-08-17T17:11:13.573918Z","submitted_at":"2025-05-16T09:38:21Z","title":"Exploration by Random Distribution Distillation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T21:10:12.044184Z"},"links":{"citing_paper":"/paper/2505.11044"},"observation_digest":"sha256:c6307d66d71c176e9a58d11d384a3f3328e18d602d20ab723a20562e05330e1f","observation_id":"fcc62367-2383-4049-8f92-ef7e0c2e6340","resolution":{"observed_at":"2026-08-15T21:10:12.810716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:10:12.787537Z","title":"Rainbow: Combining improvements in deep reinforcement learning,","venue":null,"work_id":"744bccb6-6095-4fd4-b560-07be224dbf03","year":2018},"citing_paper":{"arxiv_id":"2505.11044","last_updated":"2025-05-16T09:38:21Z","snapshot_observed_at":"2026-08-17T17:11:13.573918Z","submitted_at":"2025-05-16T09:38:21Z","title":"Exploration by Random Distribution Distillation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T21:10:12.048799Z"},"links":{"citing_paper":"/paper/2505.11044"},"observation_digest":"sha256:45b22a4685b102e4722df849dd4b76cc3a0d638222593a933dc8b9fa0265ba28","observation_id":"94a3152a-ea97-4944-85ae-e239488fc964","resolution":{"observed_at":"2026-08-15T21:10:12.793387Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:10:12.769579Z","title":"Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor,","venue":null,"work_id":"fa62e7dd-72d8-48d3-8bae-a51153e2f718","year":2018},"citing_paper":{"arxiv_id":"2505.11044","last_updated":"2025-05-16T09:38:21Z","snapshot_observed_at":"2026-08-17T17:11:13.573918Z","submitted_at":"2025-05-16T09:38:21Z","title":"Exploration by Random Distribution Distillation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T21:10:12.053695Z"},"links":{"citing_paper":"/paper/2505.11044"},"observation_digest":"sha256:4b1bc94e79d2445a6b3841d5a2ee5b9ea1ddafdd8e7de40b081f7558e0ded7f5","observation_id":"c4edd3f9-b9a4-4f3f-b4b9-0ac936755f1d","resolution":{"observed_at":"2026-08-15T21:10:12.775280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:10:12.754544Z","title":"Using confidence bounds for exploitation-exploration trade-offs,","venue":null,"work_id":"58c24512-a209-4009-81e4-4192d3ee4279","year":2002},"citing_paper":{"arxiv_id":"2505.11044","last_updated":"2025-05-16T09:38:21Z","snapshot_observed_at":"2026-08-17T17:11:13.573918Z","submitted_at":"2025-05-16T09:38:21Z","title":"Exploration by Random Distribution Distillation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T21:10:12.059293Z"},"links":{"citing_paper":"/paper/2505.11044"},"observation_digest":"sha256:8a26175ba53bd9c84576428c2d5ec470ad07ec4a1189729db046c5718954c8a1","observation_id":"fd5aa7e3-bdec-4dca-b5e0-599adafbf90c","resolution":{"observed_at":"2026-08-15T21:10:12.759499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:10:12.737677Z","title":"Improving generalization for temporal difference learning: The successor representa- tion,","venue":null,"work_id":"8e90a7e0-1a3a-45c4-ad77-f1d8cb847288","year":1993},"citing_paper":{"arxiv_id":"2505.11044","last_updated":"2025-05-16T09:38:21Z","snapshot_observed_at":"2026-08-17T17:11:13.573918Z","submitted_at":"2025-05-16T09:38:21Z","title":"Exploration by Random Distribution Distillation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T21:10:12.064338Z"},"links":{"citing_paper":"/paper/2505.11044"},"observation_digest":"sha256:ec9ca82343808d1f03f7a3db0812c57fca8c331243796a3ab2f8978a2fa607d7","observation_id":"71522f23-58ac-4361-9bb3-4d77e6c40594","resolution":{"observed_at":"2026-08-15T21:10:12.743270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.11052","last_updated":"2021-09-22T21:54:21Z","snapshot_observed_at":"2026-08-16T17:54:43.242403Z","submitted_at":"2021-09-22T21:54:21Z","title":"On Bonus-Based Exploration Methods in the Arcade Learning Environment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.11052","snapshot_observed_at":"2026-08-15T21:10:12.070120Z","title":"On bonus-based exploration methods in the arcade learning environment,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.11044","last_updated":"2025-05-16T09:38:21Z","snapshot_observed_at":"2026-08-17T17:11:13.573918Z","submitted_at":"2025-05-16T09:38:21Z","title":"Exploration by Random Distribution Distillation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T21:10:12.070120Z"},"links":{"cited_paper":"/paper/2109.11052","citing_paper":"/paper/2505.11044"},"observation_digest":"sha256:a93f878358a9292093e06e426e5adc49d56d2aa304ea6f658255cc307028c854","observation_id":"97705774-3838-4cb9-b896-fc0e311ec1b2","resolution":{"observed_at":"2026-08-15T21:10:12.070120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:10:12.721457Z","title":"# exploration: A study of count-based exploration for deep reinforcement learning,","venue":null,"work_id":"4a453b33-1ede-4eb0-9a75-e17be4c24457","year":2017},"citing_paper":{"arxiv_id":"2505.11044","last_updated":"2025-05-16T09:38:21Z","snapshot_observed_at":"2026-08-17T17:11:13.573918Z","submitted_at":"2025-05-16T09:38:21Z","title":"Exploration by Random Distribution Distillation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T21:10:12.075831Z"},"links":{"citing_paper":"/paper/2505.11044"},"observation_digest":"sha256:b90f9cfc7ad45d2f52f08261ecafaedb5c3087871281d9e0fa9cb37d77aaed52","observation_id":"5734298d-bb8e-4b35-b5f2-1a368f586323","resolution":{"observed_at":"2026-08-15T21:10:12.726622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:10:12.705955Z","title":"Optimistic exploration even with apessimistic initialisation","venue":null,"work_id":"2f538647-5f55-4585-8cc3-1e82ac1ac5fc","year":null},"citing_paper":{"arxiv_id":"2505.11044","last_updated":"2025-05-16T09:38:21Z","snapshot_observed_at":"2026-08-17T17:11:13.573918Z","submitted_at":"2025-05-16T09:38:21Z","title":"Exploration by Random Distribution Distillation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T21:10:12.080291Z"},"links":{"citing_paper":"/paper/2505.11044"},"observation_digest":"sha256:100ec334dc2a50209a489e936a79cd3604498926bb528aeb7831746935187db8","observation_id":"59e9d073-7d69-40f3-a84d-66c4064b2833","resolution":{"observed_at":"2026-08-15T21:10:12.710904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:10:12.084814Z","title":"First return, then explore,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.11044","last_updated":"2025-05-16T09:38:21Z","snapshot_observed_at":"2026-08-17T17:11:13.573918Z","submitted_at":"2025-05-16T09:38:21Z","title":"Exploration by Random Distribution Distillation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T21:10:12.084814Z"},"links":{"citing_paper":"/paper/2505.11044"},"observation_digest":"sha256:6b99738b295af3f0290d7df7264a071eae3a79223d24b0c4aeef2c48e7e3de59","observation_id":"e3eac3ba-11d2-43d6-b0c5-8b6136567d87","resolution":{"observed_at":"2026-08-15T21:10:12.084814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:10:12.679416Z","title":"Maximum entropy gain exploration for long horizon multi-goal reinforcement learning,","venue":null,"work_id":"1993afde-f375-4c46-8206-444232461e82","year":2020},"citing_paper":{"arxiv_id":"2505.11044","last_updated":"2025-05-16T09:38:21Z","snapshot_observed_at":"2026-08-17T17:11:13.573918Z","submitted_at":"2025-05-16T09:38:21Z","title":"Exploration by Random Distribution Distillation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T21:10:12.089055Z"},"links":{"citing_paper":"/paper/2505.11044"},"observation_digest":"sha256:365ed2a5193a72df09b2806a534ac0869ad1c94d727173407e7e5674067fe8d8","observation_id":"7b9fd3f3-e076-46f5-9c9b-41d5b6359191","resolution":{"observed_at":"2026-08-15T21:10:12.684813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1507.00814","last_updated":"2015-11-19T22:40:30Z","snapshot_observed_at":"2026-08-16T23:30:13.587768Z","submitted_at":"2015-07-03T04:11:15Z","title":"Incentivizing Exploration In Reinforcement Learning With Deep Predictive Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1507.00814","snapshot_observed_at":"2026-08-15T21:10:12.093833Z","title":"Incentivizing exploration in reinforcement learning with deep predictive models,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.11044","last_updated":"2025-05-16T09:38:21Z","snapshot_observed_at":"2026-08-17T17:11:13.573918Z","submitted_at":"2025-05-16T09:38:21Z","title":"Exploration by Random Distribution Distillation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T21:10:12.093833Z"},"links":{"cited_paper":"/paper/1507.00814","citing_paper":"/paper/2505.11044"},"observation_digest":"sha256:dc0eb3e3af6bc5f93e8ff4758c2a5291a847cf9a759a6fae825d489bcb2cd907","observation_id":"5cf857af-89e4-4ca2-a879-eab0f299244d","resolution":{"observed_at":"2026-08-15T21:10:12.093833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:10:12.661275Z","title":"Vime: Variational information maximizing exploration,","venue":null,"work_id":"287c3e1c-3634-47ad-94a0-c176085d6ee2","year":2016},"citing_paper":{"arxiv_id":"2505.11044","last_updated":"2025-05-16T09:38:21Z","snapshot_observed_at":"2026-08-17T17:11:13.573918Z","submitted_at":"2025-05-16T09:38:21Z","title":"Exploration by Random Distribution Distillation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T21:10:12.098404Z"},"links":{"citing_paper":"/paper/2505.11044"},"observation_digest":"sha256:8bbd7bca5bb1d0327b5123de501d28eb02c3867203e98b06ab737273da62170c","observation_id":"c604e84f-e73f-4779-abe6-859ab606b975","resolution":{"observed_at":"2026-08-15T21:10:12.667413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:10:12.641599Z","title":"Latent world models for intrinsically motivated exploration,","venue":null,"work_id":"68971d0a-e617-4a3d-ad6d-747170553e40","year":2020},"citing_paper":{"arxiv_id":"2505.11044","last_updated":"2025-05-16T09:38:21Z","snapshot_observed_at":"2026-08-17T17:11:13.573918Z","submitted_at":"2025-05-16T09:38:21Z","title":"Exploration by Random Distribution Distillation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T21:10:12.103056Z"},"links":{"citing_paper":"/paper/2505.11044"},"observation_digest":"sha256:8163387372f76b07b4a3d7df116b566309cd9f67803cf169f633b466bde8a629","observation_id":"3bd1767d-20b9-46ab-8076-546fff92419d","resolution":{"observed_at":"2026-08-15T21:10:12.647994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:10:12.624830Z","title":"Byol-explore: Exploration by bootstrapped prediction,","venue":null,"work_id":"e74cd2af-194a-4717-9352-b28f6e4ec001","year":2022},"citing_paper":{"arxiv_id":"2505.11044","last_updated":"2025-05-16T09:38:21Z","snapshot_observed_at":"2026-08-17T17:11:13.573918Z","submitted_at":"2025-05-16T09:38:21Z","title":"Exploration by Random Distribution Distillation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T21:10:12.107954Z"},"links":{"citing_paper":"/paper/2505.11044"},"observation_digest":"sha256:b72f1094f326c7f8a54b855d0872a4cbf4e47f3bfdb260a9b02b1d76a6f992f4","observation_id":"c153d218-9473-46f1-8e88-c661bd118573","resolution":{"observed_at":"2026-08-15T21:10:12.629848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:10:12.608203Z","title":"Near-optimal reinforcement learning in polynomial time,","venue":null,"work_id":"487d802c-0296-4adf-9210-a65d45524beb","year":2002},"citing_paper":{"arxiv_id":"2505.11044","last_updated":"2025-05-16T09:38:21Z","snapshot_observed_at":"2026-08-17T17:11:13.573918Z","submitted_at":"2025-05-16T09:38:21Z","title":"Exploration by Random Distribution Distillation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T21:10:12.112695Z"},"links":{"citing_paper":"/paper/2505.11044"},"observation_digest":"sha256:cab87b23cf8ac954d9800cf6bc736e7792727b9e3a12248ca90ef8516edfb0d2","observation_id":"d6c8d62c-a2e3-4536-b407-aec3c56af37c","resolution":{"observed_at":"2026-08-15T21:10:12.613760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:10:12.592074Z","title":"R-max-a general polynomial time algorithm for near- optimal reinforcement learning,","venue":null,"work_id":"ccbf0413-74b7-4fc6-b9c6-24de90aca5c1","year":2002},"citing_paper":{"arxiv_id":"2505.11044","last_updated":"2025-05-16T09:38:21Z","snapshot_observed_at":"2026-08-17T17:11:13.573918Z","submitted_at":"2025-05-16T09:38:21Z","title":"Exploration by Random Distribution Distillation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T21:10:12.117429Z"},"links":{"citing_paper":"/paper/2505.11044"},"observation_digest":"sha256:b0ecbc0908d8c9f5157dd8d0e59ece7170c6a60cda2582913f0013bdd58848ef","observation_id":"34c19951-1d20-401e-b832-a17c25c8eddd","resolution":{"observed_at":"2026-08-15T21:10:12.597184Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:10:12.577438Z","title":"Exploration in metric state spaces,","venue":null,"work_id":"708b2146-ce4c-496a-92a8-f667b8055363","year":2003},"citing_paper":{"arxiv_id":"2505.11044","last_updated":"2025-05-16T09:38:21Z","snapshot_observed_at":"2026-08-17T17:11:13.573918Z","submitted_at":"2025-05-16T09:38:21Z","title":"Exploration by Random Distribution Distillation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T21:10:12.123483Z"},"links":{"citing_paper":"/paper/2505.11044"},"observation_digest":"sha256:28180e2997e4531253bcb5d8e8925b3d2514989b4979b4c5e795c61bff3cd9cc","observation_id":"2b4eccc8-4442-4767-884e-e766d5c53d5a","resolution":{"observed_at":"2026-08-15T21:10:12.582226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:10:12.129378Z","title":null,"venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2505.11044","last_updated":"2025-05-16T09:38:21Z","snapshot_observed_at":"2026-08-17T17:11:13.573918Z","submitted_at":"2025-05-16T09:38:21Z","title":"Exploration by Random Distribution Distillation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T21:10:12.129378Z"},"links":{"citing_paper":"/paper/2505.11044"},"observation_digest":"sha256:6dd7a0388a9a004017fc5b3e383d40702d71317f0a458384063a156632432cf1","observation_id":"2323462e-f6f0-42c0-ada8-2e5f4c6b7953","resolution":{"observed_at":"2026-08-15T21:10:12.129378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1808.04355","last_updated":"2018-08-13T17:58:01Z","snapshot_observed_at":"2026-08-14T18:41:41.282322Z","submitted_at":"2018-08-13T17:58:01Z","title":"Large-Scale Study of Curiosity-Driven Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.04355","snapshot_observed_at":"2026-08-15T21:10:12.135139Z","title":"Large-scale study of curiosity-driven learning,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.11044","last_updated":"2025-05-16T09:38:21Z","snapshot_observed_at":"2026-08-17T17:11:13.573918Z","submitted_at":"2025-05-16T09:38:21Z","title":"Exploration by Random Distribution Distillation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T21:10:12.135139Z"},"links":{"cited_paper":"/paper/1808.04355","citing_paper":"/paper/2505.11044"},"observation_digest":"sha256:1bec5c221c7e19a40fd3b59315eb27341161e9e3e72830297d0c300881139f2e","observation_id":"1296819d-3453-4251-9daa-f33d920beaa8","resolution":{"observed_at":"2026-08-15T21:10:12.135139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03029","last_updated":"2025-02-28T12:21:00Z","snapshot_observed_at":"2026-08-16T13:28:15.654041Z","submitted_at":"2024-08-06T08:22:16Z","title":"Highly Efficient Self-Adaptive Reward Shaping for Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03029","snapshot_observed_at":"2026-08-15T21:10:12.140204Z","title":"Highly efficient self-adaptive reward shaping for reinforcement learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11044","last_updated":"2025-05-16T09:38:21Z","snapshot_observed_at":"2026-08-17T17:11:13.573918Z","submitted_at":"2025-05-16T09:38:21Z","title":"Exploration by Random Distribution Distillation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T21:10:12.140204Z"},"links":{"cited_paper":"/paper/2408.03029","citing_paper":"/paper/2505.11044"},"observation_digest":"sha256:269c220cbefdc6661541b393feee23db94123454545fc81a4cd5f8b8c864aa7e","observation_id":"19455772-98cc-4e3b-90ad-c96112cfe9d9","resolution":{"observed_at":"2026-08-15T21:10:12.140204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:10:12.550428Z","title":"Reward shaping for reinforcement learning with an assistant reward agent,","venue":null,"work_id":"a4623a2f-6f48-4b57-9270-3f31129f0255","year":2024},"citing_paper":{"arxiv_id":"2505.11044","last_updated":"2025-05-16T09:38:21Z","snapshot_observed_at":"2026-08-17T17:11:13.573918Z","submitted_at":"2025-05-16T09:38:21Z","title":"Exploration by Random Distribution Distillation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T21:10:12.145618Z"},"links":{"citing_paper":"/paper/2505.11044"},"observation_digest":"sha256:970fff7c1b6ec25fb1cb733716dfb37fb26e8c7ccd96b919eeb139c8de8960b2","observation_id":"90cb151d-33f2-4fd5-822e-d814e87262a9","resolution":{"observed_at":"2026-08-15T21:10:12.555544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16255","last_updated":"2024-06-30T03:55:48Z","snapshot_observed_at":"2026-08-16T13:40:19.557723Z","submitted_at":"2024-06-24T01:37:18Z","title":"Uncertainty-Aware Reward-Free Exploration with General Function Approximation","version":2},"cited_work":{"arxiv_id":"2406.16255","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.16255","snapshot_observed_at":"2026-08-15T21:10:12.338162Z","title":"Uncertainty-Aware Reward-Free Exploration with General Function Approximation","venue":"cs.LG","work_id":"4a6e90f7-2845-490c-817f-a6805286dfc4","year":2024},"citing_paper":{"arxiv_id":"2505.11044","last_updated":"2025-05-16T09:38:21Z","snapshot_observed_at":"2026-08-17T17:11:13.573918Z","submitted_at":"2025-05-16T09:38:21Z","title":"Exploration by Random Distribution Distillation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T21:10:12.151636Z"},"links":{"cited_paper":"/paper/2406.16255","citing_paper":"/paper/2505.11044"},"observation_digest":"sha256:bc25b2fc0a95bee10c709a72a2d7550b08eb4dd146bbaf115f741d6f0814bbe7","observation_id":"c4a967f6-3bdb-4d7d-88ca-0a9ac1b6e017","resolution":{"observed_at":"2026-08-15T21:10:12.345576Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:10:12.534617Z","title":"Learning to shape rewards using a game of two partners,","venue":null,"work_id":"b7614dec-f06d-4610-b3fb-2500d74dced8","year":2023},"citing_paper":{"arxiv_id":"2505.11044","last_updated":"2025-05-16T09:38:21Z","snapshot_observed_at":"2026-08-17T17:11:13.573918Z","submitted_at":"2025-05-16T09:38:21Z","title":"Exploration by Random Distribution Distillation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T21:10:12.158130Z"},"links":{"citing_paper":"/paper/2505.11044"},"observation_digest":"sha256:70574c970e6a85748554ba320b03707ec48b0dbf0ad5af11f00d750285c68cd7","observation_id":"a784eea4-8f98-41fe-a5fa-92d32ed2579f","resolution":{"observed_at":"2026-08-15T21:10:12.539899Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:10:12.518292Z","title":"Exploration-guided reward shaping for reinforce- ment learning under sparse rewards,","venue":null,"work_id":"562a7791-e56b-40d8-ae33-831ed669a63b","year":2022},"citing_paper":{"arxiv_id":"2505.11044","last_updated":"2025-05-16T09:38:21Z","snapshot_observed_at":"2026-08-17T17:11:13.573918Z","submitted_at":"2025-05-16T09:38:21Z","title":"Exploration by Random Distribution Distillation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T21:10:12.164057Z"},"links":{"citing_paper":"/paper/2505.11044"},"observation_digest":"sha256:d3f91f007b54ef7e2fbfd0a4a5f3dc92d2c62b1f3d21baf2d3735536ed5734a4","observation_id":"222d0b3e-5274-45e9-952d-26cd9b8ae3a4","resolution":{"observed_at":"2026-08-15T21:10:12.523289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:10:12.503161Z","title":"Addressing function approximation error in actor-critic methods,","venue":null,"work_id":"721b3861-61a2-4db2-aa0d-b988868458e4","year":2018},"citing_paper":{"arxiv_id":"2505.11044","last_updated":"2025-05-16T09:38:21Z","snapshot_observed_at":"2026-08-17T17:11:13.573918Z","submitted_at":"2025-05-16T09:38:21Z","title":"Exploration by Random Distribution Distillation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T21:10:12.168867Z"},"links":{"citing_paper":"/paper/2505.11044"},"observation_digest":"sha256:f6c0f41e45b68c4e2b856b63239241f43e498c455e0e17776984fda8278d4bca","observation_id":"ad9875b9-beae-4235-9c03-555f8c462098","resolution":{"observed_at":"2026-08-15T21:10:12.508233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-15T21:10:12.176055Z","title":"Proximal policy optimization algorithms,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.11044","last_updated":"2025-05-16T09:38:21Z","snapshot_observed_at":"2026-08-17T17:11:13.573918Z","submitted_at":"2025-05-16T09:38:21Z","title":"Exploration by Random Distribution Distillation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T21:10:12.176055Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.11044"},"observation_digest":"sha256:be9c683284a5fdcb0bae30c085bf558da7cbc98574024820fc6cc18f51153ce9","observation_id":"b60a254a-37d9-46c1-8905-445957cd6893","resolution":{"observed_at":"2026-08-15T21:10:12.176055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:10:12.488366Z","title":"The arcade learning environment: An evaluation platform for general agents,","venue":null,"work_id":"26101645-8079-441d-915a-4fb3cabec020","year":2013},"citing_paper":{"arxiv_id":"2505.11044","last_updated":"2025-05-16T09:38:21Z","snapshot_observed_at":"2026-08-17T17:11:13.573918Z","submitted_at":"2025-05-16T09:38:21Z","title":"Exploration by Random Distribution Distillation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T21:10:12.180842Z"},"links":{"citing_paper":"/paper/2505.11044"},"observation_digest":"sha256:df915a9024c7e0ca7b73d0f871dae08c3504a8211366d86a440c16a4a9b12d60","observation_id":"aa8a5bb5-0f63-41ca-a63e-6709d318da05","resolution":{"observed_at":"2026-08-15T21:10:12.493051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1709.10087","last_updated":"2018-06-26T13:31:37Z","snapshot_observed_at":"2026-08-15T17:49:11.636243Z","submitted_at":"2017-09-28T17:51:13Z","title":"Learning Complex Dexterous Manipulation with Deep Reinforcement Learning and Demonstrations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1709.10087","snapshot_observed_at":"2026-08-15T21:10:12.192143Z","title":"Learn- ing complex dexterous manipulation with deep reinforcement learning and demonstrations,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.11044","last_updated":"2025-05-16T09:38:21Z","snapshot_observed_at":"2026-08-17T17:11:13.573918Z","submitted_at":"2025-05-16T09:38:21Z","title":"Exploration by Random Distribution Distillation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T21:10:12.192143Z"},"links":{"cited_paper":"/paper/1709.10087","citing_paper":"/paper/2505.11044"},"observation_digest":"sha256:86c1cc656e4fc4e96db9c60fc6cb0bb4ba99713f4e0e4e5ff3abdf7be99a000a","observation_id":"19200da9-cb16-4b58-9a2d-f90888c5e555","resolution":{"observed_at":"2026-08-15T21:10:12.192143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1802.09464","last_updated":"2018-03-10T18:11:25Z","snapshot_observed_at":"2026-08-14T19:42:01.790871Z","submitted_at":"2018-02-26T17:20:14Z","title":"Multi-Goal Reinforcement Learning: Challenging Robotics Environments and Request for Research","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.09464","snapshot_observed_at":"2026-08-15T21:10:12.197928Z","title":"Multi-goal reinforcement learning: Challenging robotics environments and request for research,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.11044","last_updated":"2025-05-16T09:38:21Z","snapshot_observed_at":"2026-08-17T17:11:13.573918Z","submitted_at":"2025-05-16T09:38:21Z","title":"Exploration by Random Distribution Distillation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T21:10:12.197928Z"},"links":{"cited_paper":"/paper/1802.09464","citing_paper":"/paper/2505.11044"},"observation_digest":"sha256:e280ea52e1a21258904b5b9a3cad2f049846e45668ec3593a62b44571f32e175","observation_id":"a64d6c4b-226e-48cf-8329-d9d7ad39242c","resolution":{"observed_at":"2026-08-15T21:10:12.197928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-08-13T22:24:37.672685Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-08-15T21:10:12.204381Z","title":"Gymnasium: A standard interface for reinforcement learning environments,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11044","last_updated":"2025-05-16T09:38:21Z","snapshot_observed_at":"2026-08-17T17:11:13.573918Z","submitted_at":"2025-05-16T09:38:21Z","title":"Exploration by Random Distribution Distillation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T21:10:12.204381Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2505.11044"},"observation_digest":"sha256:9807d4860da272b622e164fa274489d39974ea6c5a2b08eb45705ac6d1dfd6c6","observation_id":"a8c2c5bf-4bf1-432e-a928-5136683d3d7f","resolution":{"observed_at":"2026-08-15T21:10:12.204381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:10:12.472313Z","title":"Double check your state before trusting it: Confidence-aware bidirectional offline model-based imagination,","venue":null,"work_id":"e441b0e4-7f9a-44e2-ad7d-a3d289a4188a","year":2022},"citing_paper":{"arxiv_id":"2505.11044","last_updated":"2025-05-16T09:38:21Z","snapshot_observed_at":"2026-08-17T17:11:13.573918Z","submitted_at":"2025-05-16T09:38:21Z","title":"Exploration by Random Distribution Distillation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T21:10:12.214743Z"},"links":{"citing_paper":"/paper/2505.11044"},"observation_digest":"sha256:cc2b77320eee5caf44803b2eb4b40bf8237f68cfc17c060e5a269a7aae6f738f","observation_id":"b84cd675-cd39-47d1-84e9-e0182dc42bc3","resolution":{"observed_at":"2026-08-15T21:10:12.477164Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:10:12.456735Z","title":"Optimistic initialization for exploration in continuous control,","venue":null,"work_id":"ea91d39c-d428-4f64-89bf-1db638bcba17","year":2022},"citing_paper":{"arxiv_id":"2505.11044","last_updated":"2025-05-16T09:38:21Z","snapshot_observed_at":"2026-08-17T17:11:13.573918Z","submitted_at":"2025-05-16T09:38:21Z","title":"Exploration by Random Distribution Distillation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T21:10:12.221295Z"},"links":{"citing_paper":"/paper/2505.11044"},"observation_digest":"sha256:e61d581fd67f0584fe98a52507017f613689a4aaeb75f87dfb4d25d7d14c5545","observation_id":"9fd9f4e2-1193-4ffe-8baf-8f0841a77004","resolution":{"observed_at":"2026-08-15T21:10:12.461580Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.11044","last_updated":"2025-05-16T09:38:21Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-17T17:11:13.573918Z","submitted_at":"2025-05-16T09:38:21Z","title":"Exploration by Random Distribution Distillation"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":1,"verified_fuzzy":29},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 1 inbound Pith citation observation for arXiv:2505.11044."}