{"as_of":"2026-08-18T22:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2e047ae40d1136e137b3622eb5bd8574790a73b7c9913183f9a0b56898642246","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T22:12:10.631091Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.03800/citation-record","integrity":"/paper/2412.03800/integrity","json":"/paper/2412.03800/citation-record.json","paper":"/paper/2412.03800"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:12:11.457259Z","title":"Human-level control through deep reinforcement learning,","venue":null,"work_id":"e51b55d7-583e-465c-bc8b-b0d38e5ecfcc","year":2015},"citing_paper":{"arxiv_id":"2412.03800","last_updated":"2024-12-05T01:42:13Z","snapshot_observed_at":"2026-08-15T01:01:26.542685Z","submitted_at":"2024-12-05T01:42:13Z","title":"ELEMENT: Episodic and Lifelong Exploration via Maximum Entropy","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T22:12:10.443266Z"},"links":{"citing_paper":"/paper/2412.03800"},"observation_digest":"sha256:e1df3dc3b45186cd56773855866bd7d7740cafc80d4de078b6b8e1ad1dff615b","observation_id":"05287492-12ba-4962-81ee-e15849634a0f","resolution":{"observed_at":"2026-08-11T22:12:11.462218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:12:10.448382Z","title":"Mastering the game of go with deep neural networks and tree search,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.03800","last_updated":"2024-12-05T01:42:13Z","snapshot_observed_at":"2026-08-15T01:01:26.542685Z","submitted_at":"2024-12-05T01:42:13Z","title":"ELEMENT: Episodic and Lifelong Exploration via Maximum Entropy","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T22:12:10.448382Z"},"links":{"citing_paper":"/paper/2412.03800"},"observation_digest":"sha256:e927bb3312b2d4be51131ae47b3a1beb69dd43755b0bce137194f53d6c1cc70b","observation_id":"7d78fb18-396c-4ed4-b8f6-99c469647596","resolution":{"observed_at":"2026-08-11T22:12:10.448382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.00157","last_updated":"2021-09-02T10:46:36Z","snapshot_observed_at":"2026-08-16T17:59:37.786854Z","submitted_at":"2021-09-01T02:36:14Z","title":"A Survey of Exploration Methods in Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.00157","snapshot_observed_at":"2026-08-11T22:12:10.452960Z","title":"A survey of exploration methods in rein- forcement learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.03800","last_updated":"2024-12-05T01:42:13Z","snapshot_observed_at":"2026-08-15T01:01:26.542685Z","submitted_at":"2024-12-05T01:42:13Z","title":"ELEMENT: Episodic and Lifelong Exploration via Maximum Entropy","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T22:12:10.452960Z"},"links":{"cited_paper":"/paper/2109.00157","citing_paper":"/paper/2412.03800"},"observation_digest":"sha256:3472ff36f92d005c0f2a433e80d9e616a1cdbef2a66bc57d78c987f82e8171e9","observation_id":"028e9a40-e4cf-43b0-87e4-ed52803edc9a","resolution":{"observed_at":"2026-08-11T22:12:10.452960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:12:11.423417Z","title":"Behavior from the void: Unsu- pervised active pre-training,","venue":null,"work_id":"b1428479-e979-4de2-9388-91713eab9365","year":2021},"citing_paper":{"arxiv_id":"2412.03800","last_updated":"2024-12-05T01:42:13Z","snapshot_observed_at":"2026-08-15T01:01:26.542685Z","submitted_at":"2024-12-05T01:42:13Z","title":"ELEMENT: Episodic and Lifelong Exploration via Maximum Entropy","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T22:12:10.458473Z"},"links":{"citing_paper":"/paper/2412.03800"},"observation_digest":"sha256:a5b9bb6db24250ce9b6b69dde23aa423d5133396397c9404b77ea21e1b5e8b35","observation_id":"dfa868d4-0f48-4ae3-920f-e0f46e8920aa","resolution":{"observed_at":"2026-08-11T22:12:11.429642Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:12:11.398893Z","title":"Task-agnostic exploration via policy gradient of a non-parametric state entropy estimate,","venue":null,"work_id":"24245702-1eed-4acf-879d-1ee8a8da81eb","year":2021},"citing_paper":{"arxiv_id":"2412.03800","last_updated":"2024-12-05T01:42:13Z","snapshot_observed_at":"2026-08-15T01:01:26.542685Z","submitted_at":"2024-12-05T01:42:13Z","title":"ELEMENT: Episodic and Lifelong Exploration via Maximum Entropy","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T22:12:10.463371Z"},"links":{"citing_paper":"/paper/2412.03800"},"observation_digest":"sha256:ca71e0475607279e21570674350df43b3907d3262c546ed178b424982c0969ba","observation_id":"87ed81e6-07c9-4e84-9ac0-3cc73562b631","resolution":{"observed_at":"2026-08-11T22:12:11.407330Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:12:11.368876Z","title":"State entropy maximization with random encoders for efficient exploration,","venue":null,"work_id":"fd859ca5-1198-43ff-a1bb-2d5d1b478351","year":2021},"citing_paper":{"arxiv_id":"2412.03800","last_updated":"2024-12-05T01:42:13Z","snapshot_observed_at":"2026-08-15T01:01:26.542685Z","submitted_at":"2024-12-05T01:42:13Z","title":"ELEMENT: Episodic and Lifelong Exploration via Maximum Entropy","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T22:12:10.468013Z"},"links":{"citing_paper":"/paper/2412.03800"},"observation_digest":"sha256:be96eb8783852ebca2d034ebc9a26ed164e9eb80c1e98f4a5077dd64ee8488f4","observation_id":"eb191de8-b2a0-484d-b491-ad8b799e268f","resolution":{"observed_at":"2026-08-11T22:12:11.377091Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:12:11.346403Z","title":"Rényi state entropy maximization for exploration acceleration in reinforce- ment learning,","venue":null,"work_id":"9bd4ad17-f40f-4d8b-94b9-54b06ca5b70a","year":2023},"citing_paper":{"arxiv_id":"2412.03800","last_updated":"2024-12-05T01:42:13Z","snapshot_observed_at":"2026-08-15T01:01:26.542685Z","submitted_at":"2024-12-05T01:42:13Z","title":"ELEMENT: Episodic and Lifelong Exploration via Maximum Entropy","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T22:12:10.473541Z"},"links":{"citing_paper":"/paper/2412.03800"},"observation_digest":"sha256:bc84cceb10548379792e03432a07a93423b67d8c99e92627b823980431c01d80","observation_id":"0b643cbe-f33f-4f8f-be71-bea673f91770","resolution":{"observed_at":"2026-08-11T22:12:11.353153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:12:10.478641Z","title":"Provably efficient maximum entropy exploration,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.03800","last_updated":"2024-12-05T01:42:13Z","snapshot_observed_at":"2026-08-15T01:01:26.542685Z","submitted_at":"2024-12-05T01:42:13Z","title":"ELEMENT: Episodic and Lifelong Exploration via Maximum Entropy","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T22:12:10.478641Z"},"links":{"citing_paper":"/paper/2412.03800"},"observation_digest":"sha256:d0cbe34ec5d00b6b9f7d5b1305104d08229679236c1427f363e0c0da1ebcb664","observation_id":"0a43ca8c-9a57-481e-9a53-803444735f34","resolution":{"observed_at":"2026-08-11T22:12:10.478641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:12:11.311114Z","title":"Exploration by maximizing rényi entropy for reward-free rl framework,","venue":null,"work_id":"64beaf7b-01d3-4157-a3df-a33e6936176d","year":2021},"citing_paper":{"arxiv_id":"2412.03800","last_updated":"2024-12-05T01:42:13Z","snapshot_observed_at":"2026-08-15T01:01:26.542685Z","submitted_at":"2024-12-05T01:42:13Z","title":"ELEMENT: Episodic and Lifelong Exploration via Maximum Entropy","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T22:12:10.486084Z"},"links":{"citing_paper":"/paper/2412.03800"},"observation_digest":"sha256:72ca59b5518a62aae3ce2bb47aa2df5bb00148d83b44639ce39c0a61128a3a48","observation_id":"2ace4f4e-c37e-4cf7-b272-de1cec876758","resolution":{"observed_at":"2026-08-11T22:12:11.316098Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.15623","last_updated":"2023-11-07T10:35:45Z","snapshot_observed_at":"2026-08-18T17:00:27.459437Z","submitted_at":"2022-05-31T09:05:58Z","title":"k-Means Maximum Entropy Exploration","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.15623","snapshot_observed_at":"2026-08-11T22:12:10.491883Z","title":"k-means maximum en- tropy exploration,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.03800","last_updated":"2024-12-05T01:42:13Z","snapshot_observed_at":"2026-08-15T01:01:26.542685Z","submitted_at":"2024-12-05T01:42:13Z","title":"ELEMENT: Episodic and Lifelong Exploration via Maximum Entropy","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T22:12:10.491883Z"},"links":{"cited_paper":"/paper/2205.15623","citing_paper":"/paper/2412.03800"},"observation_digest":"sha256:8d8255e9d5f88479fc37bb14c0ca8c3287c9d8f4f268f1e62423f97f737e0bf7","observation_id":"67554e8c-80f1-4241-ae5c-291fefb1b285","resolution":{"observed_at":"2026-08-11T22:12:10.491883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:12:11.292966Z","title":"Rein- forcement learning with prototypical representations,","venue":null,"work_id":"ff3f85db-0274-4a9d-82ad-ef299d8270bb","year":2021},"citing_paper":{"arxiv_id":"2412.03800","last_updated":"2024-12-05T01:42:13Z","snapshot_observed_at":"2026-08-15T01:01:26.542685Z","submitted_at":"2024-12-05T01:42:13Z","title":"ELEMENT: Episodic and Lifelong Exploration via Maximum Entropy","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T22:12:10.496799Z"},"links":{"citing_paper":"/paper/2412.03800"},"observation_digest":"sha256:a7408436b7efe0374f65570a0a5aad2dfacc85bd84e3dd6659ad4ff8663acf7b","observation_id":"466bb66f-87a6-40be-a791-e657d4f49a0d","resolution":{"observed_at":"2026-08-11T22:12:11.298792Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08059","last_updated":"2023-06-06T13:35:42Z","snapshot_observed_at":"2026-08-16T15:48:15.606341Z","submitted_at":"2023-03-14T16:51:14Z","title":"Fast Rates for Maximum Entropy Exploration","version":2},"cited_work":{"arxiv_id":"2303.08059","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.08059","snapshot_observed_at":"2026-08-11T22:12:10.852170Z","title":"Fast Rates for Maximum Entropy Exploration","venue":"stat.ML","work_id":"dac80692-9087-4367-9e04-51bd301141a4","year":2023},"citing_paper":{"arxiv_id":"2412.03800","last_updated":"2024-12-05T01:42:13Z","snapshot_observed_at":"2026-08-15T01:01:26.542685Z","submitted_at":"2024-12-05T01:42:13Z","title":"ELEMENT: Episodic and Lifelong Exploration via Maximum Entropy","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T22:12:10.501913Z"},"links":{"cited_paper":"/paper/2303.08059","citing_paper":"/paper/2412.03800"},"observation_digest":"sha256:2886dc02cd7e2f17dfa8ac2f6ba930be552e69b87063b7e132df54fdd3fbad1d","observation_id":"d402ce92-7475-4077-85e0-592fb8406bb7","resolution":{"observed_at":"2026-08-11T22:12:10.857959Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:12:11.270837Z","title":"Nearest neighbor estimates of entropy,","venue":null,"work_id":"2e69765d-9ecd-46fd-9f22-798d7039d302","year":2003},"citing_paper":{"arxiv_id":"2412.03800","last_updated":"2024-12-05T01:42:13Z","snapshot_observed_at":"2026-08-15T01:01:26.542685Z","submitted_at":"2024-12-05T01:42:13Z","title":"ELEMENT: Episodic and Lifelong Exploration via Maximum Entropy","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T22:12:10.507278Z"},"links":{"citing_paper":"/paper/2412.03800"},"observation_digest":"sha256:3c418bfc06a43a3a42042b558cfb7cf280a7820d3c3f3b469fe8d9f1a843d1ac","observation_id":"daf2b326-9af9-4ce1-b7ef-74e31c939249","resolution":{"observed_at":"2026-08-11T22:12:11.277508Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:12:11.246991Z","title":"Unifying count-based ex- 14 ploration and intrinsic motivation,","venue":null,"work_id":"dc69d9e3-d331-461a-b6f1-42c03fb97042","year":2016},"citing_paper":{"arxiv_id":"2412.03800","last_updated":"2024-12-05T01:42:13Z","snapshot_observed_at":"2026-08-15T01:01:26.542685Z","submitted_at":"2024-12-05T01:42:13Z","title":"ELEMENT: Episodic and Lifelong Exploration via Maximum Entropy","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T22:12:10.511931Z"},"links":{"citing_paper":"/paper/2412.03800"},"observation_digest":"sha256:df451bc4fdf68a79af7077f88239519ae5dc2959587f9e4f61f6b58ffb4978d8","observation_id":"3e09ad2d-99f6-4e88-b23c-b8342c39c969","resolution":{"observed_at":"2026-08-11T22:12:11.253612Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1806.00553","last_updated":"2018-11-24T00:29:31Z","snapshot_observed_at":"2026-08-14T19:08:21.388243Z","submitted_at":"2018-06-01T22:09:51Z","title":"Deep Curiosity Search: Intra-Life Exploration Can Improve Performance on Challenging Deep Reinforcement Learning Problems","version":3},"cited_work":{"arxiv_id":"1806.00553","doi":null,"metadata_source":"pith","pith_arxiv_id":"1806.00553","snapshot_observed_at":"2026-08-11T22:12:10.827156Z","title":"Deep Curiosity Search: Intra-Life Exploration Can Improve Performance on Challenging Deep Reinforcement Learning Problems","venue":"cs.AI","work_id":"f8a2368b-1913-47f6-b2ce-01c92150a678","year":2018},"citing_paper":{"arxiv_id":"2412.03800","last_updated":"2024-12-05T01:42:13Z","snapshot_observed_at":"2026-08-15T01:01:26.542685Z","submitted_at":"2024-12-05T01:42:13Z","title":"ELEMENT: Episodic and Lifelong Exploration via Maximum Entropy","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T22:12:10.517345Z"},"links":{"cited_paper":"/paper/1806.00553","citing_paper":"/paper/2412.03800"},"observation_digest":"sha256:eca12a0a6b0de6d72341c8a37ffa93d77883a5fcc0861e9280c22213581240d3","observation_id":"be0bbd50-5ce7-4068-99d4-5cbbc999850d","resolution":{"observed_at":"2026-08-11T22:12:10.832670Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1901.10995","last_updated":"2021-02-26T21:21:11Z","snapshot_observed_at":"2026-08-14T17:23:27.494191Z","submitted_at":"2019-01-30T18:40:37Z","title":"Go-Explore: a New Approach for Hard-Exploration Problems","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.10995","snapshot_observed_at":"2026-08-11T22:12:10.522361Z","title":"Go-explore: a new approach for hard- exploration problems,","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2412.03800","last_updated":"2024-12-05T01:42:13Z","snapshot_observed_at":"2026-08-15T01:01:26.542685Z","submitted_at":"2024-12-05T01:42:13Z","title":"ELEMENT: Episodic and Lifelong Exploration via Maximum Entropy","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T22:12:10.522361Z"},"links":{"cited_paper":"/paper/1901.10995","citing_paper":"/paper/2412.03800"},"observation_digest":"sha256:9942056f3334f4b5bf5f475a5d4b4c4a0967bcbaeb3d9d4ffd3692cc0e8f71de","observation_id":"8eae2060-8000-4b57-90b7-3dd7952d38b8","resolution":{"observed_at":"2026-08-11T22:12:10.522361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.06038","last_updated":"2020-02-14T13:57:22Z","snapshot_observed_at":"2026-08-16T00:01:17.496734Z","submitted_at":"2020-02-14T13:57:22Z","title":"Never Give Up: Learning Directed Exploration Strategies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.06038","snapshot_observed_at":"2026-08-11T22:12:10.528675Z","title":"Never give up: Learn- ing directed exploration strategies,","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2412.03800","last_updated":"2024-12-05T01:42:13Z","snapshot_observed_at":"2026-08-15T01:01:26.542685Z","submitted_at":"2024-12-05T01:42:13Z","title":"ELEMENT: Episodic and Lifelong Exploration via Maximum Entropy","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T22:12:10.528675Z"},"links":{"cited_paper":"/paper/2002.06038","citing_paper":"/paper/2412.03800"},"observation_digest":"sha256:c8714ec1f5e4dbbb9224b5523f5d23b8f79d30d44cc3b11ea20a6bcb80e5631e","observation_id":"4cb2c3cd-f75f-423c-9129-45605e5451f2","resolution":{"observed_at":"2026-08-11T22:12:10.528675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:12:11.220845Z","title":"Measures of entropy from data using infinitely divisible kernels,","venue":null,"work_id":"8ad446d8-8b94-4cd8-8115-59b837286a43","year":2014},"citing_paper":{"arxiv_id":"2412.03800","last_updated":"2024-12-05T01:42:13Z","snapshot_observed_at":"2026-08-15T01:01:26.542685Z","submitted_at":"2024-12-05T01:42:13Z","title":"ELEMENT: Episodic and Lifelong Exploration via Maximum Entropy","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T22:12:10.533428Z"},"links":{"citing_paper":"/paper/2412.03800"},"observation_digest":"sha256:f6bb66581419dd952175a6739a04100eb0f1a001452332b67303a2c151c96afb","observation_id":"01767c6f-83eb-40f4-a398-d7d2b740f933","resolution":{"observed_at":"2026-08-11T22:12:11.226531Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:12:11.199963Z","title":"Fast approximate nearest-neighbor search with k-nearest neighbor graph,","venue":null,"work_id":"307b5f13-7950-4c90-a0ba-93a171b68a07","year":2011},"citing_paper":{"arxiv_id":"2412.03800","last_updated":"2024-12-05T01:42:13Z","snapshot_observed_at":"2026-08-15T01:01:26.542685Z","submitted_at":"2024-12-05T01:42:13Z","title":"ELEMENT: Episodic and Lifelong Exploration via Maximum Entropy","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T22:12:10.537669Z"},"links":{"citing_paper":"/paper/2412.03800"},"observation_digest":"sha256:d968c44b5cef6e8a888fcbc884989eb1f5d372177f71f45167124efd11fee33c","observation_id":"1d816566-1997-44b8-93c5-9392ce839159","resolution":{"observed_at":"2026-08-11T22:12:11.205493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1602.06819","last_updated":"2016-02-22T15:33:57Z","snapshot_observed_at":"2026-08-14T22:09:19.059184Z","submitted_at":"2016-02-22T15:33:57Z","title":"Fast Online k-nn Graph Building","version":1},"cited_work":{"arxiv_id":"1602.06819","doi":null,"metadata_source":"pith","pith_arxiv_id":"1602.06819","snapshot_observed_at":"2026-08-11T22:12:10.756892Z","title":"Fast Online k-nn Graph Building","venue":"cs.DS","work_id":"f4940702-1733-4e74-9122-1999ad272387","year":2016},"citing_paper":{"arxiv_id":"2412.03800","last_updated":"2024-12-05T01:42:13Z","snapshot_observed_at":"2026-08-15T01:01:26.542685Z","submitted_at":"2024-12-05T01:42:13Z","title":"ELEMENT: Episodic and Lifelong Exploration via Maximum Entropy","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T22:12:10.542603Z"},"links":{"cited_paper":"/paper/1602.06819","citing_paper":"/paper/2412.03800"},"observation_digest":"sha256:37481be587389a0536b2126dc82cdd7b19d3e6ede5565d4727806814acc6209a","observation_id":"9aeed2cd-c43f-42f8-bdbc-979060ca6de3","resolution":{"observed_at":"2026-08-11T22:12:10.763502Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:12:11.181992Z","title":"On measures of entropy and information,","venue":null,"work_id":"dac0023c-5969-44ef-be50-0ffb4925988b","year":1961},"citing_paper":{"arxiv_id":"2412.03800","last_updated":"2024-12-05T01:42:13Z","snapshot_observed_at":"2026-08-15T01:01:26.542685Z","submitted_at":"2024-12-05T01:42:13Z","title":"ELEMENT: Episodic and Lifelong Exploration via Maximum Entropy","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T22:12:10.547422Z"},"links":{"citing_paper":"/paper/2412.03800"},"observation_digest":"sha256:70bfec3ba775d06ab51d50fcbeb420c55347997b2c1435631f570fb5036f5778","observation_id":"7588d030-987f-4036-a751-de082e9476a4","resolution":{"observed_at":"2026-08-11T22:12:11.187835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:12:11.154509Z","title":null,"venue":null,"work_id":"5389c1a3-36f4-4c4f-84f7-e464c5e6dce3","year":2010},"citing_paper":{"arxiv_id":"2412.03800","last_updated":"2024-12-05T01:42:13Z","snapshot_observed_at":"2026-08-15T01:01:26.542685Z","submitted_at":"2024-12-05T01:42:13Z","title":"ELEMENT: Episodic and Lifelong Exploration via Maximum Entropy","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T22:12:10.551693Z"},"links":{"citing_paper":"/paper/2412.03800"},"observation_digest":"sha256:63d31f55afff7ce84d98e7025f7571e677f6be0bb9af879351f2e4597dc74ddb","observation_id":"25d68102-6a8e-4432-bfc4-c1eb745fcc4b","resolution":{"observed_at":"2026-08-11T22:12:11.160832Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:12:11.134375Z","title":"Remarks on some nonparametric estimates of a density function,","venue":null,"work_id":"51ca74ba-ae47-4f60-8a75-2257cf51505f","year":2011},"citing_paper":{"arxiv_id":"2412.03800","last_updated":"2024-12-05T01:42:13Z","snapshot_observed_at":"2026-08-15T01:01:26.542685Z","submitted_at":"2024-12-05T01:42:13Z","title":"ELEMENT: Episodic and Lifelong Exploration via Maximum Entropy","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T22:12:10.555859Z"},"links":{"citing_paper":"/paper/2412.03800"},"observation_digest":"sha256:52430a8bde4740afca454b24f3d4246ce18db2ec3aa528cf10cd7b5467a7935b","observation_id":"c8e3da3c-0b03-43a2-8d4f-a94a8eb01acb","resolution":{"observed_at":"2026-08-11T22:12:11.140732Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.05274","last_updated":"2020-02-28T16:02:59Z","snapshot_observed_at":"2026-08-14T16:16:38.304748Z","submitted_at":"2019-06-12T17:57:02Z","title":"Efficient Exploration via State Marginal Matching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.05274","snapshot_observed_at":"2026-08-11T22:12:10.560120Z","title":"Efficient exploration via state marginal matching,","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2412.03800","last_updated":"2024-12-05T01:42:13Z","snapshot_observed_at":"2026-08-15T01:01:26.542685Z","submitted_at":"2024-12-05T01:42:13Z","title":"ELEMENT: Episodic and Lifelong Exploration via Maximum Entropy","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T22:12:10.560120Z"},"links":{"cited_paper":"/paper/1906.05274","citing_paper":"/paper/2412.03800"},"observation_digest":"sha256:74fd6aaf90e4def9a5ad5f7c5d18ce4a382a531c8867d33b34870178f13e216f","observation_id":"743c0fb5-fae3-4876-afd1-a9fade7bd8fe","resolution":{"observed_at":"2026-08-11T22:12:10.560120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:12:11.117404Z","title":"Trust region policy optimization,","venue":null,"work_id":"1e1d96ad-82de-42b1-865d-2db66328aaea","year":2015},"citing_paper":{"arxiv_id":"2412.03800","last_updated":"2024-12-05T01:42:13Z","snapshot_observed_at":"2026-08-15T01:01:26.542685Z","submitted_at":"2024-12-05T01:42:13Z","title":"ELEMENT: Episodic and Lifelong Exploration via Maximum Entropy","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T22:12:10.564736Z"},"links":{"citing_paper":"/paper/2412.03800"},"observation_digest":"sha256:3258ab63d8670692f49527fe4d3f27597bc3afc40136f9f1bbac2d8ffab3f4cd","observation_id":"f644971c-531c-4ed1-892d-d350913d00af","resolution":{"observed_at":"2026-08-11T22:12:11.122586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:12:11.098540Z","title":"Curiosity-driven exploration by self-supervised predic- tion,","venue":null,"work_id":"64da940d-2edc-4604-a45f-7bace33156a1","year":2017},"citing_paper":{"arxiv_id":"2412.03800","last_updated":"2024-12-05T01:42:13Z","snapshot_observed_at":"2026-08-15T01:01:26.542685Z","submitted_at":"2024-12-05T01:42:13Z","title":"ELEMENT: Episodic and Lifelong Exploration via Maximum Entropy","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T22:12:10.568701Z"},"links":{"citing_paper":"/paper/2412.03800"},"observation_digest":"sha256:0a4faaa2a782515ba77b3bca0683404d9a54593d41f8728c62f3358106df717b","observation_id":"675f21fa-0b97-46d7-8e2b-7db9d01fdf36","resolution":{"observed_at":"2026-08-11T22:12:11.105320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:12:11.073491Z","title":"Exploration by random network distillation,","venue":null,"work_id":"15c286da-3239-4c2d-8591-0e040ebe473b","year":2019},"citing_paper":{"arxiv_id":"2412.03800","last_updated":"2024-12-05T01:42:13Z","snapshot_observed_at":"2026-08-15T01:01:26.542685Z","submitted_at":"2024-12-05T01:42:13Z","title":"ELEMENT: Episodic and Lifelong Exploration via Maximum Entropy","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T22:12:10.572801Z"},"links":{"citing_paper":"/paper/2412.03800"},"observation_digest":"sha256:b86c5ab4801afca051c2267ca5d438645d121804fefeaac37ec1978607aee5dc","observation_id":"5134a18c-6440-4f39-ade5-033b6c1a0ba5","resolution":{"observed_at":"2026-08-11T22:12:11.084724Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:12:11.052394Z","title":"Learning and information theory,","venue":null,"work_id":"5ac57d65-49aa-4505-9ffe-b8ebfdb94558","year":1972},"citing_paper":{"arxiv_id":"2412.03800","last_updated":"2024-12-05T01:42:13Z","snapshot_observed_at":"2026-08-15T01:01:26.542685Z","submitted_at":"2024-12-05T01:42:13Z","title":"ELEMENT: Episodic and Lifelong Exploration via Maximum Entropy","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T22:12:10.577538Z"},"links":{"citing_paper":"/paper/2412.03800"},"observation_digest":"sha256:e18a5be2bb38d8ad0debdfdf6b8517962054d703e3cb110ce12472849cd84255","observation_id":"e7c797b7-f521-4461-9686-d7235ae013b6","resolution":{"observed_at":"2026-08-11T22:12:11.058344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:12:11.032139Z","title":null,"venue":null,"work_id":"497b8166-1837-44c4-9778-d340b6c60c32","year":1976},"citing_paper":{"arxiv_id":"2412.03800","last_updated":"2024-12-05T01:42:13Z","snapshot_observed_at":"2026-08-15T01:01:26.542685Z","submitted_at":"2024-12-05T01:42:13Z","title":"ELEMENT: Episodic and Lifelong Exploration via Maximum Entropy","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T22:12:10.581802Z"},"links":{"citing_paper":"/paper/2412.03800"},"observation_digest":"sha256:9f0c0d2a30a6a747ed1c2616d26253f64c39f88560c6ae3734d9dd60dd1127f1","observation_id":"842f4da9-2050-4bdb-a0ca-a6b3acf89067","resolution":{"observed_at":"2026-08-11T22:12:11.037976Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:12:11.014140Z","title":"Unsupervised state representation learning in atari,","venue":null,"work_id":"e16ce37f-9568-4582-99ee-da39b4ed2d37","year":2019},"citing_paper":{"arxiv_id":"2412.03800","last_updated":"2024-12-05T01:42:13Z","snapshot_observed_at":"2026-08-15T01:01:26.542685Z","submitted_at":"2024-12-05T01:42:13Z","title":"ELEMENT: Episodic and Lifelong Exploration via Maximum Entropy","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T22:12:10.586208Z"},"links":{"citing_paper":"/paper/2412.03800"},"observation_digest":"sha256:15335579973b5b780e4bbb0883f2b558f9afc8a2fc6fb2c30ace95c898063902","observation_id":"e2dacd99-2916-46ca-9a95-10de42dd0682","resolution":{"observed_at":"2026-08-11T22:12:11.019573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:12:10.995619Z","title":"Learning guidance rewards with trajectory-space smoothing,","venue":null,"work_id":"5104dd71-00c1-4970-8bf8-ba532d2a50b1","year":2020},"citing_paper":{"arxiv_id":"2412.03800","last_updated":"2024-12-05T01:42:13Z","snapshot_observed_at":"2026-08-15T01:01:26.542685Z","submitted_at":"2024-12-05T01:42:13Z","title":"ELEMENT: Episodic and Lifelong Exploration via Maximum Entropy","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T22:12:10.590428Z"},"links":{"citing_paper":"/paper/2412.03800"},"observation_digest":"sha256:837eab296e52802f6450dba03979bfa0a5eeddb3b211b22a2bc130d9503d3ab2","observation_id":"3e90250a-27a0-4fbe-8107-f934b91e2013","resolution":{"observed_at":"2026-08-11T22:12:11.001386Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.13485","last_updated":"2022-03-17T07:01:28Z","snapshot_observed_at":"2026-08-16T17:39:08.887455Z","submitted_at":"2021-11-26T13:23:36Z","title":"Learning Long-Term Reward Redistribution via Randomized Return Decomposition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.13485","snapshot_observed_at":"2026-08-11T22:12:10.594853Z","title":"Learning long- term reward redistribution via randomized return decom- position,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.03800","last_updated":"2024-12-05T01:42:13Z","snapshot_observed_at":"2026-08-15T01:01:26.542685Z","submitted_at":"2024-12-05T01:42:13Z","title":"ELEMENT: Episodic and Lifelong Exploration via Maximum Entropy","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T22:12:10.594853Z"},"links":{"cited_paper":"/paper/2111.13485","citing_paper":"/paper/2412.03800"},"observation_digest":"sha256:4deb39a32b5717137f701cd5ec8934eb3e2c35f517c18991e7e6df5fefb192d4","observation_id":"68be9271-8664-452c-8f4e-0b90f90c6cc5","resolution":{"observed_at":"2026-08-11T22:12:10.594853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:12:10.976945Z","title":"Reinforcement learning with trajectory feedback,","venue":null,"work_id":"944da2c9-514b-446a-b856-4335dfe1679c","year":2021},"citing_paper":{"arxiv_id":"2412.03800","last_updated":"2024-12-05T01:42:13Z","snapshot_observed_at":"2026-08-15T01:01:26.542685Z","submitted_at":"2024-12-05T01:42:13Z","title":"ELEMENT: Episodic and Lifelong Exploration via Maximum Entropy","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T22:12:10.599405Z"},"links":{"citing_paper":"/paper/2412.03800"},"observation_digest":"sha256:d617faa4e8dabe2aeaaf84b9336f293a8de9070b57c89a673ee2bebdc544fbaa","observation_id":"c9624c9a-1515-42b6-ac21-037b30a1b793","resolution":{"observed_at":"2026-08-11T22:12:10.981705Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-17T07:51:41.384508Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-11T22:12:10.603972Z","title":"Soft actor-critic algorithms and applications,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.03800","last_updated":"2024-12-05T01:42:13Z","snapshot_observed_at":"2026-08-15T01:01:26.542685Z","submitted_at":"2024-12-05T01:42:13Z","title":"ELEMENT: Episodic and Lifelong Exploration via Maximum Entropy","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T22:12:10.603972Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2412.03800"},"observation_digest":"sha256:04b458f463dc285cb84bd3f3e9c1dddd02d8fa0d94322162c7dcc5532a43674a","observation_id":"c6308577-318b-4f9b-a622-a7f177590cc9","resolution":{"observed_at":"2026-08-11T22:12:10.603972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:12:10.960557Z","title":"Asynchronous methods for deep reinforcement learning,","venue":null,"work_id":"31e07955-d1f7-4066-94bd-c41830ab3841","year":2016},"citing_paper":{"arxiv_id":"2412.03800","last_updated":"2024-12-05T01:42:13Z","snapshot_observed_at":"2026-08-15T01:01:26.542685Z","submitted_at":"2024-12-05T01:42:13Z","title":"ELEMENT: Episodic and Lifelong Exploration via Maximum Entropy","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T22:12:10.608707Z"},"links":{"citing_paper":"/paper/2412.03800"},"observation_digest":"sha256:d66fdecd095f574cc187efbb0a1a5ae9417dfe8495925e65381cca6902089b11","observation_id":"5177a388-032c-46fd-a115-bf58277ab8d5","resolution":{"observed_at":"2026-08-11T22:12:10.965356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:12:10.613296Z","title":"Openai gym,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.03800","last_updated":"2024-12-05T01:42:13Z","snapshot_observed_at":"2026-08-15T01:01:26.542685Z","submitted_at":"2024-12-05T01:42:13Z","title":"ELEMENT: Episodic and Lifelong Exploration via Maximum Entropy","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T22:12:10.613296Z"},"links":{"citing_paper":"/paper/2412.03800"},"observation_digest":"sha256:16d9df5e510a4aba40fcb3d4d510f1d98e79f08f9f1af7cbd1d78a493cd5e926","observation_id":"780d229b-da92-42d5-b59c-8c6ae2db4ac7","resolution":{"observed_at":"2026-08-11T22:12:10.613296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-11T22:12:10.617509Z","title":"Offline reinforcement learning: Tutorial, review, and perspectives on open problems,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2412.03800","last_updated":"2024-12-05T01:42:13Z","snapshot_observed_at":"2026-08-15T01:01:26.542685Z","submitted_at":"2024-12-05T01:42:13Z","title":"ELEMENT: Episodic and Lifelong Exploration via Maximum Entropy","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T22:12:10.617509Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2412.03800"},"observation_digest":"sha256:5bd7882513182e815ebb7bd76bc901fa6b3c63c10c7da599b92d731f9fd861f2","observation_id":"c2d299dc-753e-4be1-91ac-b3d41be3ae37","resolution":{"observed_at":"2026-08-11T22:12:10.617509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:12:10.622232Z","title":"Reward-free exploration for reinforcement learning,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.03800","last_updated":"2024-12-05T01:42:13Z","snapshot_observed_at":"2026-08-15T01:01:26.542685Z","submitted_at":"2024-12-05T01:42:13Z","title":"ELEMENT: Episodic and Lifelong Exploration via Maximum Entropy","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T22:12:10.622232Z"},"links":{"citing_paper":"/paper/2412.03800"},"observation_digest":"sha256:0ffa9c8b10702e1261a84779ed4d2adab63ffad23f8670f6d48c8d946966914b","observation_id":"601ba026-b711-421c-89cc-9308da8498de","resolution":{"observed_at":"2026-08-11T22:12:10.622232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:12:10.920134Z","title":"Con- servative q-learning for offline reinforcement learning,","venue":null,"work_id":"b0c4c515-becf-4aef-901c-68671c8c14dd","year":2020},"citing_paper":{"arxiv_id":"2412.03800","last_updated":"2024-12-05T01:42:13Z","snapshot_observed_at":"2026-08-15T01:01:26.542685Z","submitted_at":"2024-12-05T01:42:13Z","title":"ELEMENT: Episodic and Lifelong Exploration via Maximum Entropy","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T22:12:10.626633Z"},"links":{"citing_paper":"/paper/2412.03800"},"observation_digest":"sha256:1acd56e00ed147e2f488a68251e78d0c65e55d38c1844a0679a390d354c59397","observation_id":"5150a38b-0141-47e0-ab16-1a57aac4aa15","resolution":{"observed_at":"2026-08-11T22:12:10.925720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1805.01954","last_updated":"2018-05-11T21:48:52Z","snapshot_observed_at":"2026-08-14T19:18:37.366856Z","submitted_at":"2018-05-04T22:36:58Z","title":"Behavioral Cloning from Observation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.01954","snapshot_observed_at":"2026-08-11T22:12:10.631091Z","title":"Behavioral cloning from observation,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.03800","last_updated":"2024-12-05T01:42:13Z","snapshot_observed_at":"2026-08-15T01:01:26.542685Z","submitted_at":"2024-12-05T01:42:13Z","title":"ELEMENT: Episodic and Lifelong Exploration via Maximum Entropy","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T22:12:10.631091Z"},"links":{"cited_paper":"/paper/1805.01954","citing_paper":"/paper/2412.03800"},"observation_digest":"sha256:396ac4ac012f6870a0019bfda03199ae94d3d94e58840bcdffe005906b19af61","observation_id":"7cd5afec-9972-44b7-ae25-2fc0b13070e4","resolution":{"observed_at":"2026-08-11T22:12:10.631091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.03800","last_updated":"2024-12-05T01:42:13Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-15T01:01:26.542685Z","submitted_at":"2024-12-05T01:42:13Z","title":"ELEMENT: Episodic and Lifelong Exploration via Maximum Entropy"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":15,"verified_exact":3,"verified_fuzzy":22},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 0 inbound Pith citation observations for arXiv:2412.03800."}