{"as_of":"2026-08-18T08:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5e3484ec59a1863759bc5d5f9f6ad125def2668a81c4045a1d064ba7be4a8b5b","coverage":[{"denominator":70,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":70,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T13:21:18.474336Z","state":"measured"},{"denominator":70,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":70,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2502.07279/citation-record","integrity":"/paper/2502.07279/integrity","json":"/paper/2502.07279/citation-record.json","paper":"/paper/2502.07279"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:21:19.546860Z","title":"Deep reinforcement learning at the edge of the statistical precipice","venue":null,"work_id":"3d7603f2-6ac8-461d-92b2-58e21f280eab","year":2021},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-14T17:42:32.702857Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.114277Z"},"links":{"citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:315045f4a8e81019468073551dbbb757cd5e976755d59b41cada6a2102d8bf9b","observation_id":"717804df-2c64-4226-83eb-f028019cddf1","resolution":{"observed_at":"2026-08-08T13:21:19.552117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:21:18.120405Z","title":"Tenenbaum, Tommi S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-14T17:42:32.702857Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.120405Z"},"links":{"citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:68b4c58623ffa98bde99775b8c0348182da4be7034ca790b142f59db8f5abb3b","observation_id":"1186c289-b8cd-485a-8f62-13bd7c4d93da","resolution":{"observed_at":"2026-08-08T13:21:18.120405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12399","last_updated":"2024-10-30T14:34:49Z","snapshot_observed_at":"2026-08-16T13:51:09.314558Z","submitted_at":"2024-05-20T22:51:05Z","title":"Diffusion for World Modeling: Visual Details Matter in Atari","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12399","snapshot_observed_at":"2026-08-08T13:21:18.125931Z","title":"Diffusion for world modeling: Visual details matter in atari","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-14T17:42:32.702857Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.125931Z"},"links":{"cited_paper":"/paper/2405.12399","citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:5e77198759f6e09611866f63fe56bdf876a1bd635503f2ca47314eb93020c507","observation_id":"52013a13-f6fb-4638-a35d-f2950327fed6","resolution":{"observed_at":"2026-08-08T13:21:18.125931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:21:19.521624Z","title":"Random polytopes, convex bodies, and approximation","venue":null,"work_id":"d8150c27-9d9b-4ce0-a8e4-d1245ee77897","year":2004},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-14T17:42:32.702857Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.132825Z"},"links":{"citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:4cb4971afd097bf8a3f248b7ac1d6dde04587ef1d907cd8202e33bf58a275ea3","observation_id":"1c04bd1b-5546-4893-bbf7-dd6bb3d3540b","resolution":{"observed_at":"2026-08-08T13:21:19.526532Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16030","last_updated":"2024-05-25T03:07:56Z","snapshot_observed_at":"2026-08-16T13:49:34.142146Z","submitted_at":"2024-05-25T03:07:56Z","title":"Constrained Ensemble Exploration for Unsupervised Skill Discovery","version":1},"cited_work":{"arxiv_id":"2405.16030","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.16030","snapshot_observed_at":"2026-08-08T13:21:18.932250Z","title":"Constrained Ensemble Exploration for Unsupervised Skill Discovery","venue":"cs.LG","work_id":"9533d703-363a-4f62-8824-9e61258e3dda","year":2024},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-14T17:42:32.702857Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.138225Z"},"links":{"cited_paper":"/paper/2405.16030","citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:5894cb8f70085da0bf130feac2b681005922cca7edd687d1e8122cd3a8e0cf52","observation_id":"b5f258a2-ebde-445b-a142-3e292e93ebe1","resolution":{"observed_at":"2026-08-08T13:21:18.939754Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:21:18.144431Z","title":"Exploration by random network distillation","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-14T17:42:32.702857Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.144431Z"},"links":{"citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:fe830348b2abad945656cba537c0bec4d81a6ab088fc26f36160f488d0ea8c94","observation_id":"8f7e1583-b62b-47d7-81c5-d76e8d9c4e00","resolution":{"observed_at":"2026-08-08T13:21:18.144431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:21:19.495032Z","title":"Explore, discover and learn: Unsupervised discovery of state-covering skills","venue":null,"work_id":"ca5331d9-77ed-439b-b72c-16b08cb37c7c","year":2020},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-14T17:42:32.702857Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.150828Z"},"links":{"citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:41736dc094065f527097a092bbfe9af1a2d937a8f3f5006de85cb542bd04b1b3","observation_id":"9ce0c823-a0ac-4384-888a-ad82f96ec597","resolution":{"observed_at":"2026-08-08T13:21:19.500380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02316","last_updated":"2025-06-10T14:50:48Z","snapshot_observed_at":"2026-08-14T10:46:30.249972Z","submitted_at":"2025-02-04T13:37:14Z","title":"DIME:Diffusion-Based Maximum Entropy Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02316","snapshot_observed_at":"2026-08-08T13:21:18.155791Z","title":"Dime: Diffusion-based maximum entropy reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-14T17:42:32.702857Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.155791Z"},"links":{"cited_paper":"/paper/2502.02316","citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:3936713b16b84f5395f91c685f79d4f430d06c1b637c58cd981164082e1fb7d0","observation_id":"4f41f3bf-524c-4d7d-b5ec-4ce13f26c927","resolution":{"observed_at":"2026-08-08T13:21:18.155791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01392","last_updated":"2024-12-10T01:32:23Z","snapshot_observed_at":"2026-08-16T13:38:04.174848Z","submitted_at":"2024-07-01T15:43:25Z","title":"Diffusion Forcing: Next-token Prediction Meets Full-Sequence Diffusion","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01392","snapshot_observed_at":"2026-08-08T13:21:18.160941Z","title":"Diffusion forcing: Next-token prediction meets full-sequence diffusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-14T17:42:32.702857Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.160941Z"},"links":{"cited_paper":"/paper/2407.01392","citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:4a91dec99477fb9be37a2ac6c6164226bf023f63f8082815055cc4b2f9dc64c5","observation_id":"749b2cf6-799b-4bcd-ad89-0bd4e41b92a5","resolution":{"observed_at":"2026-08-08T13:21:18.160941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02644","last_updated":"2024-01-05T05:28:40Z","snapshot_observed_at":"2026-08-16T14:29:42.154695Z","submitted_at":"2024-01-05T05:28:40Z","title":"Simple Hierarchical Planning with Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02644","snapshot_observed_at":"2026-08-08T13:21:18.166804Z","title":"Simple hierarchical planning with diffusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-14T17:42:32.702857Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.166804Z"},"links":{"cited_paper":"/paper/2401.02644","citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:29a86bd2347bfac40d29d881a968c620b0d951c5230ba816fd26d8fe844e9669","observation_id":"193876ed-7802-427e-94db-c299f5ddd8df","resolution":{"observed_at":"2026-08-08T13:21:18.166804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:21:19.478977Z","title":"Offline reinforcement learning via high-fidelity generative behavior modeling","venue":null,"work_id":"f0bee4d6-10e5-4447-92cc-054470acac1b","year":2023},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-14T17:42:32.702857Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.172641Z"},"links":{"citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:71c063ff123843b3f650f6a8d2fee6252f5cdc0063330d4602e64d72286889f8","observation_id":"249abdf1-5bc1-4cb2-b12b-91895894bbe9","resolution":{"observed_at":"2026-08-08T13:21:19.484341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.09024","last_updated":"2024-10-30T07:31:43Z","snapshot_observed_at":"2026-08-16T13:34:52.211017Z","submitted_at":"2024-07-12T06:32:36Z","title":"Aligning Diffusion Behaviors with Q-functions for Efficient Continuous Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.09024","snapshot_observed_at":"2026-08-08T13:21:18.177946Z","title":"Aligning diffusion behaviors with q-functions for efficient continuous control","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-14T17:42:32.702857Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.177946Z"},"links":{"cited_paper":"/paper/2407.09024","citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:8b56e946090fb8193318d9a761bbd56b63a92a0023e084809579706e11fca65b","observation_id":"b00d0d5a-5bcb-4ec0-81b1-cf47f5dbac27","resolution":{"observed_at":"2026-08-08T13:21:18.177946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:21:18.183415Z","title":"Diffusion policy: Visuomotor policy learning via action diffusion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-14T17:42:32.702857Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.183415Z"},"links":{"citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:71cb221ac3c8570178812e4a1b1a50b8d2e2314d070ca096cf7dc516b29bbefe","observation_id":"20988d13-2fcd-4b7a-9bad-507db77e9192","resolution":{"observed_at":"2026-08-08T13:21:18.183415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14687","last_updated":"2024-05-20T04:23:45Z","snapshot_observed_at":"2026-08-14T03:13:28.801183Z","submitted_at":"2022-09-29T11:12:27Z","title":"Diffusion Posterior Sampling for General Noisy Inverse Problems","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14687","snapshot_observed_at":"2026-08-08T13:21:18.188814Z","title":"Diffusion posterior sampling for general noisy inverse problems","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-14T17:42:32.702857Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.188814Z"},"links":{"cited_paper":"/paper/2209.14687","citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:8a7c269226172813426b0d65fa53fe09bf5fe8a9a098350e8e83560eec883627","observation_id":"b8dca37e-e625-40fc-98d4-dffeb92cb3b0","resolution":{"observed_at":"2026-08-08T13:21:18.188814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:21:18.194341Z","title":"Diffusion models beat gans on image synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-14T17:42:32.702857Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.194341Z"},"links":{"citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:9a0709214f381ab14a269e7fad68a0bd15c92bfbe8d6551b61337166a46aaf87","observation_id":"f1b9aff1-ba8b-4410-81e3-dbf0334efd1a","resolution":{"observed_at":"2026-08-08T13:21:18.194341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03570","last_updated":"2024-10-15T20:56:47Z","snapshot_observed_at":"2026-08-16T14:21:13.488059Z","submitted_at":"2024-02-05T22:43:57Z","title":"Diffusion World Model: Future Modeling Beyond Step-by-Step Rollout for Offline Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03570","snapshot_observed_at":"2026-08-08T13:21:18.199380Z","title":"Diffusion world model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-14T17:42:32.702857Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.199380Z"},"links":{"cited_paper":"/paper/2402.03570","citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:b500f85e85eb5d73e62bfbe2e3a3bbc8a5bb0d97064e1224f1280eff2876bba4","observation_id":"5bc01a3b-00f9-4a54-837c-210713bbf508","resolution":{"observed_at":"2026-08-08T13:21:18.199380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:21:19.442517Z","title":"Diversity is all you need: Learning skills without a reward function","venue":null,"work_id":"8c6534c3-ad9b-4656-886f-fa8f67e4a94d","year":2018},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-14T17:42:32.702857Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.204573Z"},"links":{"citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:8ab2cafd85750e1783032550d9b5804be44ed16a0632ddf1c236ffe10dc7e955","observation_id":"cba315ae-fa8a-4bee-abeb-1f10bb41e019","resolution":{"observed_at":"2026-08-08T13:21:19.447422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:21:19.426469Z","title":"The information geometry of unsupervised reinforcement learning","venue":null,"work_id":"a41d95ee-643a-4b7d-9f78-d2707068677c","year":2021},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-14T17:42:32.702857Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.209501Z"},"links":{"citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:70fd6f2339528ebe55957e47ac6475f203fd38b5587bd449ecbd07f0e29ae0ed","observation_id":"54de6cbc-71f0-46b0-a13f-32ea678baa77","resolution":{"observed_at":"2026-08-08T13:21:19.431559Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:21:19.411137Z","title":"Reinforcement learning with deep energy-based policies","venue":null,"work_id":"eb45a38e-b411-485a-81d5-9ae77eddee96","year":2017},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-14T17:42:32.702857Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.214553Z"},"links":{"citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:a914ae63230b600aa33b670b4d532b3aae58e744d225a9081e2044bbdfbb172a","observation_id":"e6ded4df-fa16-481d-ac4b-24d104174cae","resolution":{"observed_at":"2026-08-08T13:21:19.416165Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:21:19.394692Z","title":"Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor","venue":null,"work_id":"b58327d5-749c-4b6e-b9d1-9e26ecf3cf4f","year":2018},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-14T17:42:32.702857Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.219668Z"},"links":{"citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:c8adc1099b136af50476401c91aa850af035fb64834e5f6ced656ceb1c92afd0","observation_id":"8b9f12ab-cea0-4ef4-984c-bbdd091494d1","resolution":{"observed_at":"2026-08-08T13:21:19.400294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10573","last_updated":"2023-05-19T18:31:04Z","snapshot_observed_at":"2026-08-14T17:40:51.391072Z","submitted_at":"2023-04-20T18:04:09Z","title":"IDQL: Implicit Q-Learning as an Actor-Critic Method with Diffusion Policies","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10573","snapshot_observed_at":"2026-08-08T13:21:18.224350Z","title":"Idql: Implicit q-learning as an actor-critic method with diffusion policies","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-14T17:42:32.702857Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.224350Z"},"links":{"cited_paper":"/paper/2304.10573","citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:20658d7dd821d6a665f340062a71391b624ee6816c253474c277cf844ec7a0d9","observation_id":"1803d2cc-0e49-4e91-8a24-4828acd0e416","resolution":{"observed_at":"2026-08-08T13:21:18.224350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:21:19.379105Z","title":"Diffusion model is an effective planner and data synthesizer for multi-task reinforcement learning","venue":null,"work_id":"cae2f33b-3ab5-4769-874e-51fd1e6e6b43","year":2023},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-14T17:42:32.702857Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.229805Z"},"links":{"citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:c90702911cbe3e7be676f415e12b09319834f36ff7fa129068966461fb35053c","observation_id":"d90fbec2-cc75-4562-a0d7-519a7e761017","resolution":{"observed_at":"2026-08-08T13:21:19.384186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:21:18.234847Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-14T17:42:32.702857Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.234847Z"},"links":{"citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:a72f428f3ab80566537d8ff98782d5269cddf0f598266b8982213a0dcaf76764","observation_id":"65d6ffed-8431-4bc1-a236-6b8da9905ac9","resolution":{"observed_at":"2026-08-08T13:21:18.234847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17827","last_updated":"2025-01-29T18:18:00Z","snapshot_observed_at":"2026-08-16T12:58:18.369416Z","submitted_at":"2025-01-29T18:18:00Z","title":"Langevin Soft Actor-Critic: Efficient Exploration through Uncertainty-Driven Critic Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17827","snapshot_observed_at":"2026-08-08T13:21:18.239564Z","title":"Langevin soft actor-critic: Efficient exploration through uncertainty-driven critic learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-14T17:42:32.702857Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.239564Z"},"links":{"cited_paper":"/paper/2501.17827","citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:82af8afb2e3109bf3e0e0c444d239fb4478cf77f7cd8e9d4c5b0a8d6ab3950e0","observation_id":"09ba4fbd-d15c-448d-86d4-586560b38a47","resolution":{"observed_at":"2026-08-08T13:21:18.239564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:21:19.353531Z","title":"Planning with diffusion for flexible behavior synthesis","venue":null,"work_id":"ee54ed3c-1b78-416a-8a65-c7514fb7b28d","year":2022},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-14T17:42:32.702857Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.245569Z"},"links":{"citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:a8c9c48d5cf8a76e55725b3c5331147dbeca3d4ade97cb46fc55af72b86dc435","observation_id":"64ea5b7d-a4d1-46a6-b3d7-bc072f27085f","resolution":{"observed_at":"2026-08-08T13:21:19.358510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:21:18.250301Z","title":"Efficient diffusion policies for offline reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-14T17:42:32.702857Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.250301Z"},"links":{"citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:09a5ecfb2bf38af54431a947c58b1278c04498c17cd37b16d4b859766354001c","observation_id":"0c81c733-6952-4b95-b4ef-2d8cb7a0c569","resolution":{"observed_at":"2026-08-08T13:21:18.250301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:21:19.328103Z","title":"Unsupervised skill discovery with bottleneck option learning","venue":null,"work_id":"6d4c4d9e-0253-4bc5-8b09-6ceddb98f5eb","year":2021},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-14T17:42:32.702857Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.255235Z"},"links":{"citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:bf896c375d42cd359dc460ed799a9e89407c5b4c059f3ffef9811c4120ac87c1","observation_id":"3204f4ed-570d-404d-a18a-3d0ca8e4e2a1","resolution":{"observed_at":"2026-08-08T13:21:19.333288Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:21:18.259982Z","title":"Offline reinforcement learning with implicit q-learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-14T17:42:32.702857Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.259982Z"},"links":{"citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:ece0727c24382602bf5758e3dc95f0d5d69bf3d2e913402991a4cbb82107dd3b","observation_id":"edc71b78-a83a-4795-9c54-6c4638cda4b5","resolution":{"observed_at":"2026-08-08T13:21:18.259982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:21:19.301421Z","title":"Unsuper- vised reinforcement learning with contrastive intrinsic control","venue":null,"work_id":"727f19ec-c817-4ba3-a726-f2b793db63c4","year":2022},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-14T17:42:32.702857Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.264755Z"},"links":{"citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:9954959924e87a79f5835f7ebae2053f548bcd6eab8cedf5121b40036c6ad19c","observation_id":"73b8f274-5633-4882-8931-202c37755d65","resolution":{"observed_at":"2026-08-08T13:21:19.306391Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:21:19.283669Z","title":"Urlb: Unsupervised reinforcement learning benchmark","venue":null,"work_id":"1080cd0c-27e0-4e6a-9a05-7ef213472d04","year":2021},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-14T17:42:32.702857Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.269581Z"},"links":{"citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:5e5f87447350ac79779951a0110a412326c4fef7511ebfe50b6af83a39dc81be","observation_id":"cf259c37-eb98-47a3-ad23-3cb9c6052bb5","resolution":{"observed_at":"2026-08-08T13:21:19.289871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.05274","last_updated":"2020-02-28T16:02:59Z","snapshot_observed_at":"2026-08-14T16:16:38.304748Z","submitted_at":"2019-06-12T17:57:02Z","title":"Efficient Exploration via State Marginal Matching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.05274","snapshot_observed_at":"2026-08-08T13:21:18.274465Z","title":"Efficient exploration via state marginal matching","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-14T17:42:32.702857Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.274465Z"},"links":{"cited_paper":"/paper/1906.05274","citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:c072e7f424983d8ad3cb0e3b1f2def42f2890845318993996dde55eb35ba4687","observation_id":"b4104a14-fb61-4278-a931-3d2289529bc0","resolution":{"observed_at":"2026-08-08T13:21:18.274465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:21:19.267297Z","title":"Hierarchical diffusion for offline decision making","venue":null,"work_id":"2bc9a59e-6c50-44b8-908c-c67d4dd9516a","year":2023},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-14T17:42:32.702857Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.279537Z"},"links":{"citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:916ae25cb8ac6176cfd20f1c1b762cdd653cde741b38bf58ed8162eb2c7ccd4e","observation_id":"5c091b6d-b0e9-499a-b58b-8156c8a0d9ec","resolution":{"observed_at":"2026-08-08T13:21:19.272069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00681","last_updated":"2024-06-02T09:32:28Z","snapshot_observed_at":"2026-08-16T13:47:02.513221Z","submitted_at":"2024-06-02T09:32:28Z","title":"Learning Multimodal Behaviors from Scratch with Diffusion Policy Gradient","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00681","snapshot_observed_at":"2026-08-08T13:21:18.284794Z","title":"Learning multimodal behaviors from scratch with diffusion policy gradient","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-14T17:42:32.702857Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.284794Z"},"links":{"cited_paper":"/paper/2406.00681","citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:80da4abe4daddc796ebfa6dacfa138ae3700db02022592ef350b96cb0182c8b1","observation_id":"5d47d839-47e1-4e91-8bf6-b317946c851b","resolution":{"observed_at":"2026-08-08T13:21:18.284794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:21:19.252177Z","title":"Adaptdiffuser: Diffusion models as adaptive self-evolving planners","venue":null,"work_id":"ca014f79-03dc-402d-abfc-905761a4cd0b","year":2023},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-14T17:42:32.702857Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.290217Z"},"links":{"citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:6b40b8546d0db5ecac72620ef7cf02ab1fba4590b086b1965d8d5a65e72c103b","observation_id":"6c2cff4f-45cc-4e34-84b6-a9c51d4e44ad","resolution":{"observed_at":"2026-08-08T13:21:19.256958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1509.02971","last_updated":"2019-07-05T10:47:27Z","snapshot_observed_at":"2026-08-16T22:06:26.835611Z","submitted_at":"2015-09-09T23:01:36Z","title":"Continuous control with deep reinforcement learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.02971","snapshot_observed_at":"2026-08-08T13:21:18.295604Z","title":"Continuous control with deep reinforcement learning","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-14T17:42:32.702857Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.295604Z"},"links":{"cited_paper":"/paper/1509.02971","citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:723ee176b9097db0bef46938ae17568e8f6a15f5680995ced347e5da9735d701","observation_id":"bb26dcbb-b4dd-4744-8451-210dee826867","resolution":{"observed_at":"2026-08-08T13:21:18.295604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:21:19.236742Z","title":"Aps: Active pretraining with successor features","venue":null,"work_id":"1de90850-61de-4076-b47b-7661a0afcf3b","year":2021},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-14T17:42:32.702857Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.301156Z"},"links":{"citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:1e2e7a0803d9f32fd2db81858f9a5b963f01d3506ad21fb3f581d84c69fbaf6e","observation_id":"acacfe4a-278d-49ad-9b0e-3b4e0ab72907","resolution":{"observed_at":"2026-08-08T13:21:19.241608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:21:19.221271Z","title":"Behavior from the void: Unsupervised active pre-training","venue":null,"work_id":"d64f287d-9c82-4010-9dc0-dd13ce35230e","year":2021},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-14T17:42:32.702857Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.307110Z"},"links":{"citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:ea4d2ceea098e12126697921a6637a3d4103cdaf7e9cd304e7be4673da5f1fbd","observation_id":"6e3ab296-d29d-45aa-8575-4f2845740779","resolution":{"observed_at":"2026-08-08T13:21:19.226391Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12448","last_updated":"2024-09-03T18:40:47Z","snapshot_observed_at":"2026-08-16T13:33:29.593508Z","submitted_at":"2024-07-17T09:56:51Z","title":"Energy-Guided Diffusion Sampling for Offline-to-Online Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12448","snapshot_observed_at":"2026-08-08T13:21:18.313075Z","title":"Energy-guided diffusion sampling for offline-to-online reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-14T17:42:32.702857Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.313075Z"},"links":{"cited_paper":"/paper/2407.12448","citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:82767495d6e740b839907858eb6d84a222af27836c940fcd3179bb69f130b4fb","observation_id":"436e4d5e-93f0-458f-9091-e6ccdef8eb7a","resolution":{"observed_at":"2026-08-08T13:21:18.313075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:21:19.204515Z","title":"Contrastive energy prediction for exact energy-guided diffusion sampling in offline reinforcement learning","venue":null,"work_id":"eda4fcec-8881-4adf-9f72-7ede9af282e6","year":2023},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-14T17:42:32.702857Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.318224Z"},"links":{"citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:652de60aec8b94c5c36166f68779789256a6a42331420770816858b7b6e04c0d","observation_id":"43d3f187-783d-4d0c-bf6d-39429be652df","resolution":{"observed_at":"2026-08-08T13:21:19.210145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:21:18.323013Z","title":"Dpm-solver: A fast ode solver for diffusion probabilistic model sampling in around 10 steps","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-14T17:42:32.702857Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.323013Z"},"links":{"citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:2b3505be4e3e40e48cd700cec1522ae5869ef8a175cf8abebd7bf2531a1960f6","observation_id":"d6dd9ac4-0c13-4e8e-ba70-a58255ea0506","resolution":{"observed_at":"2026-08-08T13:21:18.323013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:21:19.177012Z","title":"Synthetic experience replay.Advances in Neural Information Processing Systems, 36, 2024","venue":null,"work_id":"1536079c-e752-4cb6-a59d-19e9eff35982","year":2024},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-14T17:42:32.702857Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.328698Z"},"links":{"citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:8a3f457c4373c2f3dce64a7d82d606ab596271f2e01e3e450dd0c0e17279eb78","observation_id":"cab513be-a52c-4aa6-841e-378ec63bd8f9","resolution":{"observed_at":"2026-08-08T13:21:19.182147Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.00361","last_updated":"2025-06-30T03:48:44Z","snapshot_observed_at":"2026-08-17T01:44:29.143459Z","submitted_at":"2025-02-01T07:55:06Z","title":"Efficient Online Reinforcement Learning for Diffusion Policy","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.00361","snapshot_observed_at":"2026-08-08T13:21:18.333364Z","title":"Soft diffusion actor-critic: Efficient online reinforcement learning for diffusion policy","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-14T17:42:32.702857Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.333364Z"},"links":{"cited_paper":"/paper/2502.00361","citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:192f42510a272d0a435306a97083376fd5b5c8631d5c23aa5dd28182c73ac64d","observation_id":"e1fcfedc-9fa5-464d-813c-f463941d62e6","resolution":{"observed_at":"2026-08-08T13:21:18.333364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06685","last_updated":"2024-12-09T17:28:03Z","snapshot_observed_at":"2026-08-13T05:32:21.574534Z","submitted_at":"2024-12-09T17:28:03Z","title":"Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06685","snapshot_observed_at":"2026-08-08T13:21:18.339718Z","title":"Policy agnostic rl: Offline rl and online rl fine-tuning of any class and backbone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-14T17:42:32.702857Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.339718Z"},"links":{"cited_paper":"/paper/2412.06685","citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:00809e0b0e6333a9e1c4e9149ec068ce11311fe22a600022551be92f740dfcd8","observation_id":"4c5de78b-2d75-439a-83d5-9af270e71cc1","resolution":{"observed_at":"2026-08-08T13:21:18.339718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:21:19.161636Z","title":"Curiosity-driven exploration via latent bayesian surprise","venue":null,"work_id":"cd310671-ebf9-4783-aa8c-5ccfc4e24472","year":2022},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-14T17:42:32.702857Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.344637Z"},"links":{"citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:d08dbabad1aa399b897f25e2de0df367528e93aa693fa680a98598bfb5eaeb61","observation_id":"ad88db33-c4b8-4834-933b-e230cbf6614d","resolution":{"observed_at":"2026-08-08T13:21:19.166694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:21:19.146269Z","title":"Lipschitz-constrained unsupervised skill discovery","venue":null,"work_id":"56b91315-35fa-4348-9fa3-78861581df40","year":2022},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-14T17:42:32.702857Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.349181Z"},"links":{"citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:aea6715078d9ff0facf2f4b90f94691a497a8d32137de641233fdf0c7b1a29f2","observation_id":"e36c7829-ae27-43f0-8d40-9e40197bdf24","resolution":{"observed_at":"2026-08-08T13:21:19.151235Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08887","last_updated":"2024-03-10T04:30:17Z","snapshot_observed_at":"2026-08-16T14:52:27.542277Z","submitted_at":"2023-10-13T06:43:11Z","title":"METRA: Scalable Unsupervised RL with Metric-Aware Abstraction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08887","snapshot_observed_at":"2026-08-08T13:21:18.353849Z","title":"Metra: Scalable unsupervised rl with metric-aware abstraction","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-14T17:42:32.702857Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.353849Z"},"links":{"cited_paper":"/paper/2310.08887","citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:0b9e6362e6b3c7c59bc9eda189a832d452f8afa5863d3ef6a201ad41d92057d9","observation_id":"25988992-dc49-4b2d-b2c8-54d202233e5e","resolution":{"observed_at":"2026-08-08T13:21:18.353849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:21:19.129692Z","title":"Curiosity-driven exploration by self-supervised prediction","venue":null,"work_id":"81f61734-c28b-499a-a7c8-7b637b1ac489","year":2017},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-14T17:42:32.702857Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.358862Z"},"links":{"citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:9e0b209bf92d4de934b25ce47740216e29c03139c61a5dc7425e753d81e71012","observation_id":"de555d34-5ec6-4044-b0ab-c4e20ecf47c2","resolution":{"observed_at":"2026-08-08T13:21:19.135131Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:21:19.112760Z","title":"Self-supervised exploration via disagreement","venue":null,"work_id":"f1cb5614-00f3-4426-befa-903518ecc9dc","year":2019},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-14T17:42:32.702857Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.363809Z"},"links":{"citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:71b36da55f353b02f58dcff1c6817bcb48a2a9aeca4679b39afa629176b757e2","observation_id":"360a91dc-9430-4d88-ad63-b63cf128d0fd","resolution":{"observed_at":"2026-08-08T13:21:19.118151Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.00177","last_updated":"2019-10-07T20:23:21Z","snapshot_observed_at":"2026-08-13T13:59:34.315271Z","submitted_at":"2019-10-01T02:23:38Z","title":"Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.00177","snapshot_observed_at":"2026-08-08T13:21:18.368484Z","title":"Advantage-weighted regression: Simple and scalable off-policy reinforcement learning","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-14T17:42:32.702857Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.368484Z"},"links":{"cited_paper":"/paper/1910.00177","citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:76f924387e93a5483faea9cb1a293862338a8214b4ad037bbb0fcdf8af80c72f","observation_id":"b957b3af-87ce-4b1b-b3ef-1e63cc384755","resolution":{"observed_at":"2026-08-08T13:21:18.368484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11752","last_updated":"2025-02-13T23:18:56Z","snapshot_observed_at":"2026-08-17T19:17:24.656164Z","submitted_at":"2023-12-18T23:31:01Z","title":"Learning a Diffusion Model Policy from Rewards via Q-Score Matching","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11752","snapshot_observed_at":"2026-08-08T13:21:18.374992Z","title":"Learning a diffusion model policy from rewards via q-score matching","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-14T17:42:32.702857Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.374992Z"},"links":{"cited_paper":"/paper/2312.11752","citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:982be10db22b3ad242a693ccb7eb36daff676dfe4dbccad619df1563089ee733","observation_id":"42042865-f0ce-403b-a6f5-260f47240610","resolution":{"observed_at":"2026-08-08T13:21:18.374992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00588","snapshot_observed_at":"2026-08-08T13:21:18.380367Z","title":"Diffusion policy policy optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-14T17:42:32.702857Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.380367Z"},"links":{"cited_paper":"/paper/2409.00588","citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:3ae852f19c48846be3f0187336f71e8f14b3a0d30d75c4b8f4424a9adc307230","observation_id":"06931fde-8a40-45aa-87d0-7d1de4e1d46c","resolution":{"observed_at":"2026-08-08T13:21:18.380367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:21:18.385361Z","title":"Photorealistic text-to- image diffusion models with deep language understanding","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-14T17:42:32.702857Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.385361Z"},"links":{"citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:40c5e3b42818fbaa6484fb5ed8c1fff9cc8eb5140d5de8e75bf12c3f457a61a1","observation_id":"2707d75e-063d-4aec-be49-31b33b7b274d","resolution":{"observed_at":"2026-08-08T13:21:18.385361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-08T13:21:18.390208Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-14T17:42:32.702857Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.390208Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:36d98aacedad13760a5120ed3956fede8db0c0c538a7468e63ccd98c15a86fd2","observation_id":"db3205d2-3abc-442f-97a3-48c031397268","resolution":{"observed_at":"2026-08-08T13:21:18.390208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:21:18.395721Z","title":"Deep unsupervised learning using nonequilibrium thermodynamics","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-14T17:42:32.702857Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.395721Z"},"links":{"citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:43603b3286424356f59b43729d08f7287fe818befc199b2d1a24aeb3faca3327","observation_id":"cbbf8218-1a96-4e75-b11d-10589a6f930c","resolution":{"observed_at":"2026-08-08T13:21:18.395721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:21:18.400244Z","title":"Denoising diffusion implicit models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-14T17:42:32.702857Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.400244Z"},"links":{"citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:a4409d872c5b140e78e7d5885e14aca459d9c183afaa6d61ef0554048360139e","observation_id":"9c1c4d90-8598-49f0-8f25-d4866102963a","resolution":{"observed_at":"2026-08-08T13:21:18.400244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:21:18.404894Z","title":"Score-based generative modeling through stochastic differential equations","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-14T17:42:32.702857Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.404894Z"},"links":{"citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:058439b2bc10dc1224feb7dc1451d3708cbff71aed262d2ddf3a4e9d475faac7","observation_id":"413bb471-9086-4afb-904a-9a6070a93c95","resolution":{"observed_at":"2026-08-08T13:21:18.404894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:21:18.409791Z","title":"Reinforcement learning: An introduction","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-14T17:42:32.702857Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.409791Z"},"links":{"citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:3cc8bc4e478cf79675615ecf15cc6f570ea0e7c00059fb66f345be4204916a35","observation_id":"0b3437f2-eb5b-4c53-89d8-2a520ae2f4b7","resolution":{"observed_at":"2026-08-08T13:21:18.409791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-01T20:24:08.300098Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-08T13:21:18.414534Z","title":"Deepmind control suite","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-14T17:42:32.702857Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.414534Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:b804418ce7dc237c5dae4f2c7cac27967ac6bc27cf05b619b9f376dc27f60574","observation_id":"55ee6be8-6836-40f9-a899-c5f22e3d4788","resolution":{"observed_at":"2026-08-08T13:21:18.414534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18082","last_updated":"2025-05-08T23:56:41Z","snapshot_observed_at":"2026-08-16T13:06:31.710539Z","submitted_at":"2024-10-23T17:59:52Z","title":"Prioritized Generative Replay","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18082","snapshot_observed_at":"2026-08-08T13:21:18.420119Z","title":"Prioritized generative replay","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-14T17:42:32.702857Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.420119Z"},"links":{"cited_paper":"/paper/2410.18082","citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:4ece08fad46f706470cb4a99587b19901d88d43c6fa0030fe715d4d52e26eeb1","observation_id":"bce0a378-af0f-4c70-a587-9312f03ea012","resolution":{"observed_at":"2026-08-08T13:21:18.420119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:21:18.424969Z","title":"Diffusion policies as an expressive policy class for offline reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-14T17:42:32.702857Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.424969Z"},"links":{"citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:d3f58a0acf489a9503553688426b1ad686b03d1454cbe3d7c54afcbb693eb801","observation_id":"6594c9c2-0ac2-47fb-9fb0-2a70427a63b8","resolution":{"observed_at":"2026-08-08T13:21:18.424969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:21:19.034155Z","title":"A problem in geometric probability","venue":null,"work_id":"acb94a2c-e1ea-47ad-b58e-d69cafd57ea3","year":1962},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-14T17:42:32.702857Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.429537Z"},"links":{"citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:8ad83fdacfef8f0915769c6e4984b38072c1e14e64452e01c3a2c079f4aef185","observation_id":"0198e1c6-8411-45ae-951a-24aca56b6b25","resolution":{"observed_at":"2026-08-08T13:21:19.039086Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18076","last_updated":"2025-07-11T20:30:30Z","snapshot_observed_at":"2026-08-16T13:06:31.778636Z","submitted_at":"2024-10-23T17:58:45Z","title":"Leveraging Skills from Unlabeled Prior Data for Efficient Online Exploration","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18076","snapshot_observed_at":"2026-08-08T13:21:18.434308Z","title":"Leveraging skills from unlabeled prior data for efficient online exploration","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-14T17:42:32.702857Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.434308Z"},"links":{"cited_paper":"/paper/2410.18076","citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:939092e904ba7103f8030e5192d38c258ad83a1cca3e6d15f515aa3e513a548e","observation_id":"5944f1a6-f8ea-44a9-90e7-e9a2249fdadb","resolution":{"observed_at":"2026-08-08T13:21:18.434308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13122","last_updated":"2023-05-22T15:23:41Z","snapshot_observed_at":"2026-08-16T15:31:03.272444Z","submitted_at":"2023-05-22T15:23:41Z","title":"Policy Representation via Diffusion Probability Model for Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13122","snapshot_observed_at":"2026-08-08T13:21:18.438947Z","title":"Policy representation via diffusion probability model for reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-14T17:42:32.702857Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.438947Z"},"links":{"cited_paper":"/paper/2305.13122","citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:d19f82790e19c02927caa6faa7b9fe4284d61a88a19fa3b327233d44b7f4eaf8","observation_id":"3f30d08a-8ca5-447b-b349-8d05edb0bc5b","resolution":{"observed_at":"2026-08-08T13:21:18.438947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:21:19.017480Z","title":"Behavior contrastive learning for unsupervised skill discovery","venue":null,"work_id":"1a75baf9-bd3c-42bf-8c58-98050138a35b","year":2023},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-14T17:42:32.702857Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.443810Z"},"links":{"citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:c88784d03bb840fcce8d9e9e03eddd14dfa0dc2adfb2dccbe9486b978b2f570a","observation_id":"78c1c545-d060-40a5-be76-0c7b9837b1b8","resolution":{"observed_at":"2026-08-08T13:21:19.022950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:21:19.001749Z","title":"Peac: Unsupervised pre-training for cross-embodiment reinforcement learning","venue":null,"work_id":"e407eb96-736f-421c-941f-df8d0f4dae1a","year":2024},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-14T17:42:32.702857Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.448752Z"},"links":{"citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:78c39f78b2684f943a390cb15b22625111edb6c52f485d2ec92c36468df5078d","observation_id":"a5ec26a0-6739-42d7-9d04-108188dd472f","resolution":{"observed_at":"2026-08-08T13:21:19.006929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04436","last_updated":"2022-09-17T12:52:26Z","snapshot_observed_at":"2026-08-17T13:50:28.675330Z","submitted_at":"2022-06-09T11:57:54Z","title":"Towards Safe Reinforcement Learning via Constraining Conditional Value-at-Risk","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.04436","snapshot_observed_at":"2026-08-08T13:21:18.453588Z","title":"Towards safe reinforcement learning via constraining conditional value-at-risk","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-14T17:42:32.702857Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.453588Z"},"links":{"cited_paper":"/paper/2206.04436","citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:01fa8bd6956dd846c1ec18ff0f870677a210195408179bc20072734bbf81be94","observation_id":"6ba8d291-d21f-4541-8de4-667a1bc26e33","resolution":{"observed_at":"2026-08-08T13:21:18.453588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:21:18.984386Z","title":"Automatic intrinsic reward shaping for exploration in deep reinforcement learning","venue":null,"work_id":"7cb1e253-2570-4226-b0b6-7dc451cbc8a6","year":2023},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-14T17:42:32.702857Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.459069Z"},"links":{"citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:cd73fbabb1d02c8cfac490253b1ca316beedd5469cb5698bd8e9fc3650428fe3","observation_id":"5376eb95-3c8f-4f54-84ab-3ed8f27c2477","resolution":{"observed_at":"2026-08-08T13:21:18.989867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.00498","last_updated":"2023-02-22T03:55:34Z","snapshot_observed_at":"2026-08-16T16:27:31.435568Z","submitted_at":"2022-10-02T12:11:44Z","title":"EUCLID: Towards Efficient Unsupervised Reinforcement Learning with Multi-choice Dynamics Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.00498","snapshot_observed_at":"2026-08-08T13:21:18.464264Z","title":"Euclid: Towards efficient unsupervised reinforcement learning with multi-choice dynamics model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-14T17:42:32.702857Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.464264Z"},"links":{"cited_paper":"/paper/2210.00498","citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:9f94328033f403cf2b2d8b8a4376a08baf42a5b6584bec3590deea1482c1d91a","observation_id":"97a9345c-5642-4da6-94fc-5352cf84b381","resolution":{"observed_at":"2026-08-08T13:21:18.464264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:21:18.968781Z","title":"A mixture of surprises for unsupervised reinforcement learning","venue":null,"work_id":"a36296f8-bda4-45c1-a12b-c5633e425589","year":2022},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-14T17:42:32.702857Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.469375Z"},"links":{"citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:a3a335949a48c336a53a6f6d851e1f478cb63243840a19c1bb66c845069f49f6","observation_id":"7d7c98b1-be79-47c8-b37e-c988112b88fa","resolution":{"observed_at":"2026-08-08T13:21:18.973702Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01223","last_updated":"2024-02-23T14:42:57Z","snapshot_observed_at":"2026-08-16T14:46:32.788105Z","submitted_at":"2023-11-02T13:23:39Z","title":"Diffusion Models for Reinforcement Learning: A Survey","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01223","snapshot_observed_at":"2026-08-08T13:21:18.474336Z","title":"∞X i=0 γi (R(si, ai) − βDKL(π(·|si)∥πd(·|si))) s0 = s, a0 = a # =Es∼ρ0,a∼π(·|s)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-14T17:42:32.702857Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.474336Z"},"links":{"cited_paper":"/paper/2311.01223","citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:8ec1869131bfd41e73d1c70b5c4b47791545b070765e8919a637f51c0a9f8f23","observation_id":"a33c2e8f-595f-448c-ba50-fecddc257fad","resolution":{"observed_at":"2026-08-08T13:21:18.474336Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-14T17:42:32.702857Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning"},"reference_resolution":{"displayed":70,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":40,"verified_exact":1,"verified_fuzzy":28},"total_outbound_references":70},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 70 of 70 outbound references and 0 inbound Pith citation observations for arXiv:2502.07279."}