{"as_of":"2026-08-09T23:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4881ab78e3ca50bcc463e27bfcdf12639def6d64fe04d22d493c7bcecf3f12c7","coverage":[{"denominator":26,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":26,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:32:35.308340Z","state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T03:18:45.143694Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.05477","last_updated":"2025-07-07T21:09:16Z","snapshot_observed_at":"2026-08-09T14:56:41.112679Z","submitted_at":"2025-07-07T21:09:16Z","title":"Epistemically-guided forward-backward exploration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.05477","snapshot_observed_at":"2026-08-03T03:18:45.143694Z","title":"Epistemically-guided forward-backward exploration.arxiv:2507.05477, July 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.08557","last_updated":"2026-06-30T09:31:26Z","snapshot_observed_at":"2026-08-09T14:57:06.127218Z","submitted_at":"2026-02-09T11:54:45Z","title":"Combined Constrained Sampling and Reinforcement Learning for Robotic Manipulation","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-03T03:18:45.143694Z"},"links":{"cited_paper":"/paper/2507.05477","citing_paper":"/paper/2602.08557"},"observation_digest":"sha256:34a65782807a5568c3214a678cb8485b760ffea261e5055ae12e14c6eb7cec71","observation_id":"c699018c-5239-4955-9582-2b8d5e5957f6","resolution":{"observed_at":"2026-08-03T03:18:45.143694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.05477/citation-record","integrity":"/paper/2507.05477/integrity","json":"/paper/2507.05477/citation-record.json","paper":"/paper/2507.05477"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:32:35.876827Z","title":null,"venue":null,"work_id":"1f690eb8-d528-477c-853b-1c6e727867aa","year":2025},"citing_paper":{"arxiv_id":"2507.05477","last_updated":"2025-07-07T21:09:16Z","snapshot_observed_at":"2026-08-09T14:56:41.112679Z","submitted_at":"2025-07-07T21:09:16Z","title":"Epistemically-guided forward-backward exploration","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:35.308340Z"},"links":{"citing_paper":"/paper/2507.05477"},"observation_digest":"sha256:5c01f129d91c49fa887a1780aceb728d9b51844de01a6dee3fa12a1167c5342f","observation_id":"cdb6e8ec-0078-45c9-98fe-1e9521d04c37","resolution":{"observed_at":"2026-08-06T19:32:35.882126Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.15191","last_updated":"2021-10-28T15:07:01Z","snapshot_observed_at":"2026-08-09T14:57:39.780606Z","submitted_at":"2021-10-28T15:07:01Z","title":"URLB: Unsupervised Reinforcement Learning Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.15191","snapshot_observed_at":"2026-08-06T19:32:33.850798Z","title":"Urlb: Unsupervised reinforcement learning benchmark","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.05477","last_updated":"2025-07-07T21:09:16Z","snapshot_observed_at":"2026-08-09T14:56:41.112679Z","submitted_at":"2025-07-07T21:09:16Z","title":"Epistemically-guided forward-backward exploration","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:33.850798Z"},"links":{"cited_paper":"/paper/2110.15191","citing_paper":"/paper/2507.05477"},"observation_digest":"sha256:a23e45797443819901945990133c0410897a7dfb71b1abc4e19d2de87af34d1b","observation_id":"6a562b5b-dfad-4cdb-bdee-9306df3dcf24","resolution":{"observed_at":"2026-08-06T19:32:33.850798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.00161","last_updated":"2022-03-30T01:09:18Z","snapshot_observed_at":"2026-08-09T14:57:49.714551Z","submitted_at":"2022-02-01T00:36:29Z","title":"CIC: Contrastive Intrinsic Control for Unsupervised Skill Discovery","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.00161","snapshot_observed_at":"2026-08-06T19:32:33.928269Z","title":"Cic: Contrastive intrinsic control for unsupervised skill discovery","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.05477","last_updated":"2025-07-07T21:09:16Z","snapshot_observed_at":"2026-08-09T14:56:41.112679Z","submitted_at":"2025-07-07T21:09:16Z","title":"Epistemically-guided forward-backward exploration","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:33.928269Z"},"links":{"cited_paper":"/paper/2202.00161","citing_paper":"/paper/2507.05477"},"observation_digest":"sha256:36aae0c0a9ea28c65b1c78951153c66b5134552e44c9975a89a1b02bf8d11df5","observation_id":"bbe4c8fa-a521-4713-9492-3c4af3489c6a","resolution":{"observed_at":"2026-08-06T19:32:33.928269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.05274","last_updated":"2020-02-28T16:02:59Z","snapshot_observed_at":"2026-08-09T14:57:36.265847Z","submitted_at":"2019-06-12T17:57:02Z","title":"Efficient Exploration via State Marginal Matching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.05274","snapshot_observed_at":"2026-08-06T19:32:34.022256Z","title":"Efficient exploration via state marginal matching","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2507.05477","last_updated":"2025-07-07T21:09:16Z","snapshot_observed_at":"2026-08-09T14:56:41.112679Z","submitted_at":"2025-07-07T21:09:16Z","title":"Epistemically-guided forward-backward exploration","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:34.022256Z"},"links":{"cited_paper":"/paper/1906.05274","citing_paper":"/paper/2507.05477"},"observation_digest":"sha256:4cdcabdfbb0a26cd9969fa00a6f8f0410abe38079d8caef19aea729befd16723","observation_id":"c80051a4-0e9e-4d70-8278-c2f8451cdb5e","resolution":{"observed_at":"2026-08-06T19:32:34.022256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:32:35.924387Z","title":"Radford M Neal","venue":null,"work_id":"27eff850-dc8a-454d-88e7-ef37f1fdd345","year":2019},"citing_paper":{"arxiv_id":"2507.05477","last_updated":"2025-07-07T21:09:16Z","snapshot_observed_at":"2026-08-09T14:56:41.112679Z","submitted_at":"2025-07-07T21:09:16Z","title":"Epistemically-guided forward-backward exploration","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:34.439504Z"},"links":{"citing_paper":"/paper/2507.05477"},"observation_digest":"sha256:257158e65bae8d306e6999a6a47212222f5f6edde9de8961ddf6c5c15acc2f25","observation_id":"5b94f7de-60d6-4108-869e-25694130c221","resolution":{"observed_at":"2026-08-06T19:32:35.929750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08887","last_updated":"2024-03-10T04:30:17Z","snapshot_observed_at":"2026-07-06T16:32:19.417168Z","submitted_at":"2023-10-13T06:43:11Z","title":"METRA: Scalable Unsupervised RL with Metric-Aware Abstraction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08887","snapshot_observed_at":"2026-08-06T19:32:34.678091Z","title":"arXiv:2310.08887","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.05477","last_updated":"2025-07-07T21:09:16Z","snapshot_observed_at":"2026-08-09T14:56:41.112679Z","submitted_at":"2025-07-07T21:09:16Z","title":"Epistemically-guided forward-backward exploration","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:34.678091Z"},"links":{"cited_paper":"/paper/2310.08887","citing_paper":"/paper/2507.05477"},"observation_digest":"sha256:f10e8fb5fe27e519b932a075b9a1eb34a73574503e3767712834fe276f7ad76a","observation_id":"f604d288-2360-4d34-ba4f-800fe8a22f7a","resolution":{"observed_at":"2026-08-06T19:32:34.678091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06615","last_updated":"2025-03-01T03:07:31Z","snapshot_observed_at":"2026-08-01T19:29:13.076681Z","submitted_at":"2024-06-07T04:25:38Z","title":"Language Guided Skill Discovery","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06615","snapshot_observed_at":"2026-08-06T19:32:34.742766Z","title":"arXiv:2406.06615 [cs]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.05477","last_updated":"2025-07-07T21:09:16Z","snapshot_observed_at":"2026-08-09T14:56:41.112679Z","submitted_at":"2025-07-07T21:09:16Z","title":"Epistemically-guided forward-backward exploration","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:34.742766Z"},"links":{"cited_paper":"/paper/2406.06615","citing_paper":"/paper/2507.05477"},"observation_digest":"sha256:a3dfa6b9748013b07809e44811c7b744e7b7ca4bd7ff3702921f7544d66883d8","observation_id":"4da52897-9655-4248-9d09-20fe993c5e94","resolution":{"observed_at":"2026-08-06T19:32:34.742766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.14226","last_updated":"2022-05-12T14:07:48Z","snapshot_observed_at":"2026-08-09T14:58:05.705411Z","submitted_at":"2021-07-29T17:58:04Z","title":"Learning more skills through optimistic exploration","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.14226","snapshot_observed_at":"2026-08-06T19:32:34.884188Z","title":"arXiv:2107.14226 [cs]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.05477","last_updated":"2025-07-07T21:09:16Z","snapshot_observed_at":"2026-08-09T14:56:41.112679Z","submitted_at":"2025-07-07T21:09:16Z","title":"Epistemically-guided forward-backward exploration","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:34.884188Z"},"links":{"cited_paper":"/paper/2107.14226","citing_paper":"/paper/2507.05477"},"observation_digest":"sha256:f7aec653206f172f5fbda7d2d78f9b07f514324505cc9030b578419c009ea4d2","observation_id":"d2a7ebc6-ec23-4b10-9906-8f82151745c5","resolution":{"observed_at":"2026-08-06T19:32:34.884188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12371","last_updated":"2023-10-30T15:18:01Z","snapshot_observed_at":"2026-08-09T14:57:33.671378Z","submitted_at":"2023-06-21T16:26:59Z","title":"Optimistic Active Exploration of Dynamical Systems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.12371","snapshot_observed_at":"2026-08-06T19:32:34.955726Z","title":"arXiv:2306.12371 [cs, eess]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.05477","last_updated":"2025-07-07T21:09:16Z","snapshot_observed_at":"2026-08-09T14:56:41.112679Z","submitted_at":"2025-07-07T21:09:16Z","title":"Epistemically-guided forward-backward exploration","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:34.955726Z"},"links":{"cited_paper":"/paper/2306.12371","citing_paper":"/paper/2507.05477"},"observation_digest":"sha256:1679df130ebae0662423a2508fcaa2b5e046d1bd028f21b03366d0eddaf44d5e","observation_id":"15aae158-40fe-4f56-93e7-c91e517cbd88","resolution":{"observed_at":"2026-08-06T19:32:34.955726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-01T20:24:08.300098Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-06T19:32:35.041566Z","title":"Deepmind control suite","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.05477","last_updated":"2025-07-07T21:09:16Z","snapshot_observed_at":"2026-08-09T14:56:41.112679Z","submitted_at":"2025-07-07T21:09:16Z","title":"Epistemically-guided forward-backward exploration","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:35.041566Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2507.05477"},"observation_digest":"sha256:b9730a11227adc1d815bfc7b0f73be88bf99d17bdc2541709bfa3b1b225eb25e","observation_id":"62811960-c9fe-4002-94d9-59eee7640de7","resolution":{"observed_at":"2026-08-06T19:32:35.041566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14935","last_updated":"2023-03-01T18:01:09Z","snapshot_observed_at":"2026-08-09T18:51:25.703906Z","submitted_at":"2022-09-29T16:54:05Z","title":"Does Zero-Shot Reinforcement Learning Exist?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14935","snapshot_observed_at":"2026-08-06T19:32:35.184044Z","title":"Does zero-shot reinforcement learning exist? arXiv preprint arXiv:2209.14935,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.05477","last_updated":"2025-07-07T21:09:16Z","snapshot_observed_at":"2026-08-09T14:56:41.112679Z","submitted_at":"2025-07-07T21:09:16Z","title":"Epistemically-guided forward-backward exploration","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:35.184044Z"},"links":{"cited_paper":"/paper/2209.14935","citing_paper":"/paper/2507.05477"},"observation_digest":"sha256:377f89fcfaf60954534a47dc5f332810feeb3a8361abbc67cc3ac19fc8834e0b","observation_id":"1c619615-fd57-4838-a56b-cba765c42db2","resolution":{"observed_at":"2026-08-06T19:32:35.184044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04586","last_updated":"2018-10-10T15:25:49Z","snapshot_observed_at":"2026-08-09T14:58:28.480957Z","submitted_at":"2018-10-10T15:25:49Z","title":"The Laplacian in RL: Learning Representations with Efficient Approximations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04586","snapshot_observed_at":"2026-08-06T19:32:35.242918Z","title":"The laplacian in rl: Learning representations with efficient approximations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.05477","last_updated":"2025-07-07T21:09:16Z","snapshot_observed_at":"2026-08-09T14:56:41.112679Z","submitted_at":"2025-07-07T21:09:16Z","title":"Epistemically-guided forward-backward exploration","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:35.242918Z"},"links":{"cited_paper":"/paper/1810.04586","citing_paper":"/paper/2507.05477"},"observation_digest":"sha256:f33f2298109fe355427af09b5d1a836f7969ab6971980373b9b80feb40aa5ef0","observation_id":"77cb6181-fbbd-4067-baac-2d5a52d15009","resolution":{"observed_at":"2026-08-06T19:32:35.242918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:32:35.908813Z","title":"Zero-shot whole-body humanoid control via behavioral foundation models","venue":null,"work_id":"1815e824-c74a-4fbc-8f9f-139c29a96315","year":2025},"citing_paper":{"arxiv_id":"2507.05477","last_updated":"2025-07-07T21:09:16Z","snapshot_observed_at":"2026-08-09T14:56:41.112679Z","submitted_at":"2025-07-07T21:09:16Z","title":"Epistemically-guided forward-backward exploration","version":1},"reference_index":1933,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:35.099232Z"},"links":{"citing_paper":"/paper/2507.05477"},"observation_digest":"sha256:10b91a41ba84441d0e1ebe8cc8039b98f6b5e8be7f2f139517a552ec370a149b","observation_id":"676f0145-bdb0-4d8f-99ef-19571b11c0fa","resolution":{"observed_at":"2026-08-06T19:32:35.913648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:32:34.298741Z","title":"DOI: 10.1162/neco.1992.4.4.590","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2507.05477","last_updated":"2025-07-07T21:09:16Z","snapshot_observed_at":"2026-08-09T14:56:41.112679Z","submitted_at":"2025-07-07T21:09:16Z","title":"Epistemically-guided forward-backward exploration","version":1},"reference_index":1992,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:34.298741Z"},"links":{"citing_paper":"/paper/2507.05477"},"observation_digest":"sha256:19236a55721943895e8fecd8837bbfb464f20b5bdcc9659b2ff0f20b83848976","observation_id":"531c8646-018c-473a-a6ed-235cc464fba4","resolution":{"observed_at":"2026-08-06T19:32:34.298741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1802.06070","last_updated":"2018-10-09T23:19:52Z","snapshot_observed_at":"2026-07-06T06:23:52.853341Z","submitted_at":"2018-02-16T18:57:57Z","title":"Diversity is All You Need: Learning Skills without a Reward Function","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.06070","snapshot_observed_at":"2026-08-06T19:32:33.542854Z","title":"Diversity is all you need: Learning skills without a reward function","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.05477","last_updated":"2025-07-07T21:09:16Z","snapshot_observed_at":"2026-08-09T14:56:41.112679Z","submitted_at":"2025-07-07T21:09:16Z","title":"Epistemically-guided forward-backward exploration","version":1},"reference_index":1993,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:33.542854Z"},"links":{"cited_paper":"/paper/1802.06070","citing_paper":"/paper/2507.05477"},"observation_digest":"sha256:dea3cf89073f02abc4d05e153c0a5113201545681d9e55294a5027d180c93bd2","observation_id":"7005b169-85fc-423d-9a58-9cf57bae26a3","resolution":{"observed_at":"2026-08-06T19:32:33.542854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:32:35.940276Z","title":"ISBN 978-1-4471-2099-5","venue":null,"work_id":"7254631d-e17d-4504-9383-45c159a42d01","year":null},"citing_paper":{"arxiv_id":"2507.05477","last_updated":"2025-07-07T21:09:16Z","snapshot_observed_at":"2026-08-09T14:56:41.112679Z","submitted_at":"2025-07-07T21:09:16Z","title":"Epistemically-guided forward-backward exploration","version":1},"reference_index":1994,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:34.132215Z"},"links":{"citing_paper":"/paper/2507.05477"},"observation_digest":"sha256:6bba0b4c33a89a9b1a60dd362a4c1ef9ad04a53b495f5021f11cc7508da6bea6","observation_id":"7c4e8fa0-3681-4a58-9c0a-0d60078c85d7","resolution":{"observed_at":"2026-08-06T19:32:35.944762Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:32:33.355943Z","title":"URL https://doi.org/10","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.05477","last_updated":"2025-07-07T21:09:16Z","snapshot_observed_at":"2026-08-09T14:56:41.112679Z","submitted_at":"2025-07-07T21:09:16Z","title":"Epistemically-guided forward-backward exploration","version":1},"reference_index":1995,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:33.355943Z"},"links":{"citing_paper":"/paper/2507.05477"},"observation_digest":"sha256:2b344b0bdbf7f2a445fbf79284644323b551f7dec5d9188d86003c70cb944dcf","observation_id":"c4b11d40-6f3f-4bcc-b430-ab609c598dfc","resolution":{"observed_at":"2026-08-06T19:32:33.355943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.05030","last_updated":"2020-01-27T18:14:54Z","snapshot_observed_at":"2026-08-09T14:58:07.177385Z","submitted_at":"2019-06-12T09:39:05Z","title":"Fast Task Inference with Variational Intrinsic Successor Features","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.05030","snapshot_observed_at":"2026-08-06T19:32:33.717439Z","title":"Fast task inference with variational intrinsic successor features.arXiv preprint arXiv:1906.05030,","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2507.05477","last_updated":"2025-07-07T21:09:16Z","snapshot_observed_at":"2026-08-09T14:56:41.112679Z","submitted_at":"2025-07-07T21:09:16Z","title":"Epistemically-guided forward-backward exploration","version":1},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:33.717439Z"},"links":{"cited_paper":"/paper/1906.05030","citing_paper":"/paper/2507.05477"},"observation_digest":"sha256:d1f5ba5817b09a5483bb7bd865a19bb83c77e4dcfb9915947e5767b3b291d2a3","observation_id":"ce0df517-ea97-4ee1-b44c-87f1c5958902","resolution":{"observed_at":"2026-08-06T19:32:33.717439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.12894","last_updated":"2018-10-30T17:44:42Z","snapshot_observed_at":"2026-07-06T07:11:32.319931Z","submitted_at":"2018-10-30T17:44:42Z","title":"Exploration by Random Network Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.12894","snapshot_observed_at":"2026-08-06T19:32:33.151136Z","title":"Exploration by random network distillation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.05477","last_updated":"2025-07-07T21:09:16Z","snapshot_observed_at":"2026-08-09T14:56:41.112679Z","submitted_at":"2025-07-07T21:09:16Z","title":"Epistemically-guided forward-backward exploration","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:33.151136Z"},"links":{"cited_paper":"/paper/1810.12894","citing_paper":"/paper/2507.05477"},"observation_digest":"sha256:80368ed2e826c0aad4a01b3c55f2f4d89f63ffe47e5e0ebded82439def6dcb74","observation_id":"5830355e-4360-4c3d-9795-0f345f6414b8","resolution":{"observed_at":"2026-08-06T19:32:33.151136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:32:35.893107Z","title":"• Point-mass Maze: a 2-dimensional continuous maze with four rooms","venue":null,"work_id":"a9be5941-053d-40d4-89c4-1a73e5af05c5","year":2022},"citing_paper":{"arxiv_id":"2507.05477","last_updated":"2025-07-07T21:09:16Z","snapshot_observed_at":"2026-08-09T14:56:41.112679Z","submitted_at":"2025-07-07T21:09:16Z","title":"Epistemically-guided forward-backward exploration","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:35.297820Z"},"links":{"citing_paper":"/paper/2507.05477"},"observation_digest":"sha256:50758582b1e3feba1a663bc6ea5da40658bd0139c1c41fa83f5850c86803ca62","observation_id":"8e5e35de-bd22-491f-9209-6b9d9f23960b","resolution":{"observed_at":"2026-08-06T19:32:35.897838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05026","last_updated":"2025-06-22T16:19:25Z","snapshot_observed_at":"2026-08-09T14:57:37.011929Z","submitted_at":"2024-10-07T13:26:36Z","title":"Active Fine-Tuning of Multi-Task Policies","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05026","snapshot_observed_at":"2026-08-06T19:32:32.656141Z","title":"Active fine-tuning of generalist policies","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.05477","last_updated":"2025-07-07T21:09:16Z","snapshot_observed_at":"2026-08-09T14:56:41.112679Z","submitted_at":"2025-07-07T21:09:16Z","title":"Epistemically-guided forward-backward exploration","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:32.656141Z"},"links":{"cited_paper":"/paper/2410.05026","citing_paper":"/paper/2507.05477"},"observation_digest":"sha256:81c28ad715c631031955dac7e7c1f348116da38b3e2426d97c8f85b336bc9afe","observation_id":"af17d13d-4f92-4f39-a413-e950ea7b2171","resolution":{"observed_at":"2026-08-06T19:32:32.656141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.01657","last_updated":"2020-02-14T23:20:43Z","snapshot_observed_at":"2026-08-09T14:58:04.904559Z","submitted_at":"2019-07-02T21:32:19Z","title":"Dynamics-Aware Unsupervised Discovery of Skills","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.01657","snapshot_observed_at":"2026-08-06T19:32:34.807117Z","title":null,"venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2507.05477","last_updated":"2025-07-07T21:09:16Z","snapshot_observed_at":"2026-08-09T14:56:41.112679Z","submitted_at":"2025-07-07T21:09:16Z","title":"Epistemically-guided forward-backward exploration","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:34.807117Z"},"links":{"cited_paper":"/paper/1907.01657","citing_paper":"/paper/2507.05477"},"observation_digest":"sha256:ac541a5de6e0b19ed544423c7723da4d14b91f682c9ba84ae32f4fbd097aaa70","observation_id":"6c34781e-890b-4cc6-b75c-9f2be1a45cb6","resolution":{"observed_at":"2026-08-06T19:32:34.807117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.07123","last_updated":"2021-01-18T15:33:26Z","snapshot_observed_at":"2026-08-09T14:57:50.184993Z","submitted_at":"2021-01-18T15:33:26Z","title":"Learning Successor States and Goal-Dependent Values: A Mathematical Viewpoint","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.07123","snapshot_observed_at":"2026-08-06T19:32:32.924634Z","title":"Charles Blundell, Julien Cornebise, Koray Kavukcuoglu, and Daan Wierstra","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.05477","last_updated":"2025-07-07T21:09:16Z","snapshot_observed_at":"2026-08-09T14:56:41.112679Z","submitted_at":"2025-07-07T21:09:16Z","title":"Epistemically-guided forward-backward exploration","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:32.924634Z"},"links":{"cited_paper":"/paper/2101.07123","citing_paper":"/paper/2507.05477"},"observation_digest":"sha256:fd7755e965621370f7610b6339fe9ef86c267bd5c784cbaa016c73d0af7cdfe2","observation_id":"0211dde7-c40f-4a47-b775-6b561654b0ed","resolution":{"observed_at":"2026-08-06T19:32:32.924634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.00914","last_updated":"2022-02-08T07:34:26Z","snapshot_observed_at":"2026-08-09T14:57:38.077331Z","submitted_at":"2022-02-02T08:29:04Z","title":"Lipschitz-constrained Unsupervised Skill Discovery","version":2},"cited_work":{"arxiv_id":"2202.00914","doi":null,"metadata_source":"pith","pith_arxiv_id":"2202.00914","snapshot_observed_at":"2026-08-06T19:32:35.513436Z","title":"Lipschitz-constrained Unsupervised Skill Discovery","venue":"cs.LG","work_id":"75212e78-e7c1-4554-835d-ef487d32135d","year":2022},"citing_paper":{"arxiv_id":"2507.05477","last_updated":"2025-07-07T21:09:16Z","snapshot_observed_at":"2026-08-09T14:56:41.112679Z","submitted_at":"2025-07-07T21:09:16Z","title":"Epistemically-guided forward-backward exploration","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:34.547165Z"},"links":{"cited_paper":"/paper/2202.00914","citing_paper":"/paper/2507.05477"},"observation_digest":"sha256:a2f8ba912d0ca17583d11ae14069932fe1d31c1bc9851c44f95321ae9a8b5fbd","observation_id":"9eeb93ea-b163-4843-9734-e7a12e0c7c8f","resolution":{"observed_at":"2026-08-06T19:32:35.520346Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.05103","last_updated":"2023-06-03T23:35:22Z","snapshot_observed_at":"2026-08-09T14:58:39.766308Z","submitted_at":"2023-02-10T08:03:09Z","title":"Controllability-Aware Unsupervised Skill Discovery","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.05103","snapshot_observed_at":"2026-08-06T19:32:34.611173Z","title":"Seohong Park, Oleh Rybkin, and Sergey Levine","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.05477","last_updated":"2025-07-07T21:09:16Z","snapshot_observed_at":"2026-08-09T14:56:41.112679Z","submitted_at":"2025-07-07T21:09:16Z","title":"Epistemically-guided forward-backward exploration","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:34.611173Z"},"links":{"cited_paper":"/paper/2302.05103","citing_paper":"/paper/2507.05477"},"observation_digest":"sha256:9a1dac2a03838cb7545df975eba06ad242c0e89c38ec83eda462e55767e95b6f","observation_id":"2b930376-b3a1-4e4f-8d88-e3bbeb837eb2","resolution":{"observed_at":"2026-08-06T19:32:34.611173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15178","last_updated":"2024-10-30T10:11:03Z","snapshot_observed_at":"2026-08-09T14:58:39.160451Z","submitted_at":"2023-09-26T18:20:20Z","title":"Zero-Shot Reinforcement Learning from Low Quality Data","version":3},"cited_work":{"arxiv_id":"2309.15178","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.15178","snapshot_observed_at":"2026-08-06T19:32:35.592586Z","title":"Zero-Shot Reinforcement Learning from Low Quality Data","venue":"cs.LG","work_id":"3bd036c1-5c8a-4989-b981-c4d20d04e9c1","year":2023},"citing_paper":{"arxiv_id":"2507.05477","last_updated":"2025-07-07T21:09:16Z","snapshot_observed_at":"2026-08-09T14:56:41.112679Z","submitted_at":"2025-07-07T21:09:16Z","title":"Epistemically-guided forward-backward exploration","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:33.788031Z"},"links":{"cited_paper":"/paper/2309.15178","citing_paper":"/paper/2507.05477"},"observation_digest":"sha256:a307d0c1e6e7ae97e854e8506ce3b2c6641b51d6b56a131488e108a6b97dc350","observation_id":"4f5c7d2c-430d-4106-9127-8cbf6170698e","resolution":{"observed_at":"2026-08-06T19:32:35.597985Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.05477","last_updated":"2025-07-07T21:09:16Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T14:56:41.112679Z","submitted_at":"2025-07-07T21:09:16Z","title":"Epistemically-guided forward-backward exploration"},"reference_resolution":{"displayed":26,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":20,"verified_exact":1,"verified_fuzzy":4},"total_outbound_references":26},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 26 of 26 outbound references and 1 inbound Pith citation observation for arXiv:2507.05477."}