{"as_of":"2026-08-10T06:19:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b2c5e472ea5d24b996fa1c4d2ec4b464f5723b8fbdb492281b856dfda9d71466","coverage":[{"denominator":74,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":74,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T22:41:38.230312Z","state":"measured"},{"denominator":74,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":74,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.21044/citation-record","integrity":"/paper/2506.21044/integrity","json":"/paper/2506.21044/citation-record.json","paper":"/paper/2506.21044"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:33.145979Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-08T15:33:51.215391Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:33.145979Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:3e7f05682d5322be76cc30f3b1e6bb0e401774fd501e9a9122db8f7e4f1cb207","observation_id":"90c85963-0971-41b0-9aa5-55b627618389","resolution":{"observed_at":"2026-08-06T22:41:33.145979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:39.318865Z","title":"M., Crump, T., and Far, B","venue":null,"work_id":"a0d356bb-5656-4db3-8089-40b7574190c3","year":2022},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-08T15:33:51.215391Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:33.201982Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:b2f0f21882563ce95466e01e5b311264dec171a2521e888317889da381cbe5fc","observation_id":"1da8fa44-ed1a-4839-883e-e382ad82a665","resolution":{"observed_at":"2026-08-06T22:41:39.322974Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.01495","last_updated":"2018-02-23T10:04:20Z","snapshot_observed_at":"2026-08-05T02:06:43.683268Z","submitted_at":"2017-07-05T17:55:53Z","title":"Hindsight Experience Replay","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.01495","snapshot_observed_at":"2026-08-06T22:41:33.306850Z","title":"Hindsight experience replay","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-08T15:33:51.215391Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:33.306850Z"},"links":{"cited_paper":"/paper/1707.01495","citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:d4011d874e449c20683495c54bcc812ff0145dc66c9d753c7af8a43fd3031c3d","observation_id":"b46a063f-888c-427f-b844-28504c636e07","resolution":{"observed_at":"2026-08-06T22:41:33.306850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08464","last_updated":"2024-12-09T08:50:46Z","snapshot_observed_at":"2026-08-10T02:41:44.501563Z","submitted_at":"2024-07-11T13:01:18Z","title":"TLDR: Unsupervised Goal-Conditioned RL via Temporal Distance-Aware Representations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08464","snapshot_observed_at":"2026-08-06T22:41:33.424348Z","title":"Tldr: Unsupervised goal-conditioned rl via temporal distance-aware representations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-08T15:33:51.215391Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:33.424348Z"},"links":{"cited_paper":"/paper/2407.08464","citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:11be66b032e5903e540f73dafe9f9cfaa40b9be2bccfcd13c980443065cbe0f6","observation_id":"88f1255f-08d8-45f4-a571-a72faee19108","resolution":{"observed_at":"2026-08-06T22:41:33.424348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:39.305901Z","title":"K., and Konidaris, G","venue":null,"work_id":"7ac1a028-3f77-4ecf-9f43-97dc91e96246","year":2021},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-08T15:33:51.215391Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:33.518360Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:8718c84c3c45941ff4be8f61471f57b8a15dac6718384207fdec28c4c76c11d0","observation_id":"1ea52e5c-7a75-40e5-8676-473c33a22ed3","resolution":{"observed_at":"2026-08-06T22:41:39.310533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:39.293193Z","title":"Constrained ensemble exploration for unsupervised skill discovery","venue":null,"work_id":"5a8bf0df-fffd-4c69-a4f6-50e5823c9506","year":2024},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-08T15:33:51.215391Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:33.609290Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:1bb24704a14620bfeb8125a9346fb382e8ae33b49dd7c3c99b8287aa48d3d1b7","observation_id":"0e414a57-7eaf-4db7-9a17-26479fb26d17","resolution":{"observed_at":"2026-08-06T22:41:39.297553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:39.279888Z","title":"X., Tanner, J., Vuong, Q., Walling, A., Wang, H., and Zhilinsky, U","venue":null,"work_id":"7dad8a5f-73ec-4f05-8190-e73fa224055b","year":2024},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-08T15:33:51.215391Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:33.703614Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:bb73d42c4e3b48f4982e9e0e5ef57de208cc36777345feac6e4a7d872d80c839","observation_id":"9a4094e2-9f68-4cd4-bdfe-ea633f5bcc5d","resolution":{"observed_at":"2026-08-06T22:41:39.283764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:39.265449Z","title":"Exploration by random network distillation","venue":null,"work_id":"da131bad-69e6-4d47-863e-97a04fad662c","year":2019},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-08T15:33:51.215391Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:33.785283Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:7b45fdcb48a43040e7c71ddc8c47651d4444546d06a890cf2ec729f3f7b815d9","observation_id":"0f826a26-1c03-4767-ade4-ceeb660bfa10","resolution":{"observed_at":"2026-08-06T22:41:39.270252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:39.251041Z","title":"Explore, discover and learn: Unsupervised discovery of state-covering skills","venue":null,"work_id":"9e307ef5-d9fa-49f7-a7e6-2982368696d2","year":2020},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-08T15:33:51.215391Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:33.836290Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:796a558605323aaacb8e23e7b46b22607d3c0570e8d69d11d159ff45f175f58f","observation_id":"55067e30-d11b-4a7b-9452-07042e042327","resolution":{"observed_at":"2026-08-06T22:41:39.256300Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:39.236567Z","title":"Language as a cognitive tool to imagine goals in curiosity driven exploration","venue":null,"work_id":"3f153ad6-4f61-45e0-a4f5-097513413601","year":2020},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-08T15:33:51.215391Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:33.917944Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:9b2b16f0ee0dc829f98dd2339f7ec1a202f380de92c840ffd8aa94acc56672ff","observation_id":"6f836df7-b49c-4975-87b2-7d70de188e82","resolution":{"observed_at":"2026-08-06T22:41:39.241660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:39.222192Z","title":"Autotelic agents with intrinsically motivated goal-conditioned reinforcement learning: a short survey","venue":null,"work_id":"abde6b12-f6e5-4bdc-b9f9-e5c5846097fb","year":2022},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-08T15:33:51.215391Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:34.005894Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:14fce1f82f5b6e865728f24b78890d167d2f87a71ff4a222989df224a37f1f9b","observation_id":"0b03d062-5f28-41ad-bee5-78a4176256fd","resolution":{"observed_at":"2026-08-06T22:41:39.227451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:39.207801Z","title":"Goal-conditioned imitation learning","venue":null,"work_id":"784064dd-be11-4cf9-90e0-2e28b9e1ad1e","year":2019},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-08T15:33:51.215391Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:34.090668Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:e5bc08a021266d36dbe1d5edf3174bb52cd53b613050620e3382c2a171f17fc9","observation_id":"ba3fe812-2a9d-4457-abdc-473cae2bb186","resolution":{"observed_at":"2026-08-06T22:41:39.212302Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:39.192857Z","title":"Adversarial intrinsic motivation for reinforcement learning","venue":null,"work_id":"d9599649-e653-4817-9231-e3b6f721a166","year":2021},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-08T15:33:51.215391Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:34.203128Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:e3257ec99c76832e650be2d0928c70ae140a62b8829a718616ed1ff6af5e60b7","observation_id":"a5494acd-cb81-4cd8-a6e5-f246fab0f8bd","resolution":{"observed_at":"2026-08-06T22:41:39.198143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:39.179293Z","title":"Diversity is all you need: Learning skills without a reward function","venue":null,"work_id":"4578d606-731a-4608-a952-fefab304897f","year":2019},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-08T15:33:51.215391Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:34.247740Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:1c70857aa0b6d25a844302504165de219010e1a63c16158ea654c32aa3402285","observation_id":"e284d72f-c053-4426-b2b3-0abe976a1ce9","resolution":{"observed_at":"2026-08-06T22:41:39.184132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.08909","last_updated":"2021-04-19T18:33:47Z","snapshot_observed_at":"2026-08-08T15:56:27.804944Z","submitted_at":"2020-11-17T19:58:56Z","title":"C-Learning: Learning to Achieve Goals via Recursive Classification","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.08909","snapshot_observed_at":"2026-08-06T22:41:34.332286Z","title":"C-learning: Learning to achieve goals via recursive classification","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-08T15:33:51.215391Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:34.332286Z"},"links":{"cited_paper":"/paper/2011.08909","citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:7b009d5eb7c89daa6cfe48d481fd0ffbaa80b3ea2843f4b1876d0d33449e5e01","observation_id":"143187d5-3f4d-4258-9ef2-695f91139aa3","resolution":{"observed_at":"2026-08-06T22:41:34.332286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:39.165779Z","title":null,"venue":null,"work_id":"d7c2bb20-44d7-4c3a-8b99-441caf363eab","year":2022},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-08T15:33:51.215391Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:34.417950Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:40d3f83eac9605d9c6017b12a79b7e5206e63a8b8b0a65446ec4ec61d2e8d423","observation_id":"20c0ea5b-129c-4409-bda9-7de5ec4a561b","resolution":{"observed_at":"2026-08-06T22:41:39.170092Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:39.152368Z","title":"Curriculum-guided hindsight experience replay","venue":null,"work_id":"f58f1579-70f5-4803-9284-0584935b2ccc","year":2019},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-08T15:33:51.215391Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:34.468891Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:293fc329dd9a163bf896165cd723c07c1ab084d9098e7333c186504550a5f90e","observation_id":"d9147cd4-2c24-4fa6-b982-d8eec0274326","resolution":{"observed_at":"2026-08-06T22:41:39.156692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:34.473619Z","title":"Automatic goal generation for reinforcement learning agents","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-08T15:33:51.215391Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:34.473619Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:bca5f22d309ab0679c292a1364c8e5dbc51cc451d7b4e5721bc580ba5d95b6ed","observation_id":"a5e18089-2bb6-4ebf-b2dd-aa137296a80a","resolution":{"observed_at":"2026-08-06T22:41:34.473619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1806.09614","last_updated":"2018-09-21T11:20:05Z","snapshot_observed_at":"2026-07-06T06:46:42.258795Z","submitted_at":"2018-06-25T12:06:28Z","title":"Accuracy-based Curriculum Learning in Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.09614","snapshot_observed_at":"2026-08-06T22:41:34.578090Z","title":"Accuracy-based curriculum learning in deep reinforcement learning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-08T15:33:51.215391Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:34.578090Z"},"links":{"cited_paper":"/paper/1806.09614","citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:da3cde4b4dec9cee7bb0ad0902f49e9eb56ea3f618be14f7334420f51fab127f","observation_id":"7d6cf578-631c-4d71-849a-32e0cf78ae83","resolution":{"observed_at":"2026-08-06T22:41:34.578090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:39.129023Z","title":"D4rl: Datasets for deep data-driven reinforcement learning, 2020","venue":null,"work_id":"49bba89f-7b72-4e9c-9471-a99b8fd003a1","year":2020},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-08T15:33:51.215391Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:34.762057Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:2072ff45cee01a7cf0b13494973335cf34fb0bf1252c66d6db0295029877e0a9","observation_id":"ccb63044-06ba-4f5f-8633-324719177297","resolution":{"observed_at":"2026-08-06T22:41:39.133429Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06088","last_updated":"2020-10-02T19:49:10Z","snapshot_observed_at":"2026-08-08T14:57:05.363720Z","submitted_at":"2019-12-12T17:26:47Z","title":"Learning to Reach Goals via Iterated Supervised Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06088","snapshot_observed_at":"2026-08-06T22:41:34.963486Z","title":"Learning to reach goals via iterated supervised learning","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-08T15:33:51.215391Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:34.963486Z"},"links":{"cited_paper":"/paper/1912.06088","citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:646853fe0f74f793ad9247460738a35ec02e3b018e0a29a3b1075e3383356bdd","observation_id":"77335ca6-e087-4292-8657-b2892f585840","resolution":{"observed_at":"2026-08-06T22:41:34.963486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:35.121608Z","title":"and Oudeyer, P.-Y","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-08T15:33:51.215391Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:35.121608Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:f348a92bd8558ed8d0e3964b7070b6a25a2c37bc76c6c5a9ce960b6a2fbdfe85","observation_id":"53a1012f-57ab-4f05-a980-b04548088400","resolution":{"observed_at":"2026-08-06T22:41:35.121608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:39.106361Z","title":"J., and Wierstra, D","venue":null,"work_id":"7d47703d-544f-4e45-b4f9-08379c73b696","year":2016},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-08T15:33:51.215391Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:35.261687Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:ea4e2f0f587b621651c0eba4195b44724d29824bcd0e363befbcccfd30acb381","observation_id":"50abf721-f062-4549-8f28-ca8c2852b4eb","resolution":{"observed_at":"2026-08-06T22:41:39.110596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:35.471301Z","title":"Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-08T15:33:51.215391Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:35.471301Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:12da9976a6e9d20f5ac6bb2bfdf7d483ebe092e6bcb740f3903c201b9fd829a5","observation_id":"37668b98-4ab1-4136-be9f-db203f06ca2b","resolution":{"observed_at":"2026-08-06T22:41:35.471301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1802.07461","last_updated":"2018-02-21T08:13:12Z","snapshot_observed_at":"2026-07-06T06:24:32.238575Z","submitted_at":"2018-02-21T08:13:12Z","title":"Emergence of Structured Behaviors from Curiosity-Based Intrinsic Motivation","version":1},"cited_work":{"arxiv_id":"1802.07461","doi":null,"metadata_source":"pith","pith_arxiv_id":"1802.07461","snapshot_observed_at":"2026-08-06T22:41:38.457113Z","title":"Emergence of Structured Behaviors from Curiosity-Based Intrinsic Motivation","venue":"cs.LG","work_id":"653ba206-6be0-484d-80fa-bbc4577e0afa","year":2018},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-08T15:33:51.215391Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:35.692807Z"},"links":{"cited_paper":"/paper/1802.07461","citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:bebfbc8d658a20ab897f02b420778a0fc1429a8e456c86f2883134fbaae74cc0","observation_id":"a1cbfc2f-458d-472e-a9bb-20c95be91d63","resolution":{"observed_at":"2026-08-06T22:41:38.461935Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:39.084022Z","title":"Exploration in deep reinforcement learning: From single-agent to multiagent domain","venue":null,"work_id":"53a6c5c0-ce8f-4bf3-85ec-9dcd84d22fc1","year":2023},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-08T15:33:51.215391Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:35.858079Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:84972eaf945cf10353e658d44d2f6a65014bd792ca2878aeff7342786a8ea988","observation_id":"33de2148-99d3-48aa-8870-312b786ce215","resolution":{"observed_at":"2026-08-06T22:41:39.089016Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04268","last_updated":"2024-06-06T17:15:02Z","snapshot_observed_at":"2026-07-06T18:26:37.581248Z","submitted_at":"2024-06-06T17:15:02Z","title":"Open-Endedness is Essential for Artificial Superhuman Intelligence","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04268","snapshot_observed_at":"2026-08-06T22:41:36.029860Z","title":"Open-endedness is essential for artificial superhuman intelligence","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-08T15:33:51.215391Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:36.029860Z"},"links":{"cited_paper":"/paper/2406.04268","citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:485b6dc4eccada4093ac4e8cd11d901393bf2836b08c82485371e2ae2050c0f2","observation_id":"3a774f42-b30f-4306-8538-3989effc3200","resolution":{"observed_at":"2026-08-06T22:41:36.029860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:39.070487Z","title":"Unsupervised curricula for visual meta-reinforcement learning","venue":null,"work_id":"4aa7ba9a-53e4-425e-8dc6-1f9814812d56","year":2019},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-08T15:33:51.215391Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:36.228723Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:1322fe10ebd584d4909641ba7368e3d0065616181d0dd730d30bded55bfbf741","observation_id":"ce161550-23c4-49d2-a496-0089d72ad128","resolution":{"observed_at":"2026-08-06T22:41:39.074905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:36.398189Z","title":"A comprehensive survey on self-interpretable neural networks","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-08T15:33:51.215391Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:36.398189Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:e9fb448cb2cf8bb810961c8ad6acb4b9f1f2beecb8675995d1a5b79eb27c6376","observation_id":"63d64998-cf2b-468f-9fe6-c4c89b7cb46e","resolution":{"observed_at":"2026-08-06T22:41:36.398189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02439","last_updated":"2022-01-13T22:40:12Z","snapshot_observed_at":"2026-07-06T11:54:47.559384Z","submitted_at":"2021-10-06T01:01:39Z","title":"Replay-Guided Adversarial Environment Design","version":2},"cited_work":{"arxiv_id":"2110.02439","doi":null,"metadata_source":"pith","pith_arxiv_id":"2110.02439","snapshot_observed_at":"2026-08-06T22:41:38.323217Z","title":"Replay-Guided Adversarial Environment Design","venue":"cs.LG","work_id":"9d350d83-862a-4753-ad7c-c5f54da84364","year":2021},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-08T15:33:51.215391Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:36.601070Z"},"links":{"cited_paper":"/paper/2110.02439","citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:0ae2fbaefbe0974d780d15348b94550f5f50451af58d11a3912e14cf2c3e1061","observation_id":"f843fe81-8fb2-4a69-a52a-25fa443fe92a","resolution":{"observed_at":"2026-08-06T22:41:38.328725Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:39.057205Z","title":"Prioritized level replay","venue":null,"work_id":"5584c6bf-41ce-4856-aa42-a4ae4096205e","year":2021},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-08T15:33:51.215391Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:36.669110Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:c02c617caf0b9778bcaeac05fe141c90e4f8e19ce59f66f71344c24ac40a3512","observation_id":"1fabd924-f58b-4583-b50b-12a9223ad4f0","resolution":{"observed_at":"2026-08-06T22:41:39.061604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:39.042971Z","title":null,"venue":null,"work_id":"2fd69ad3-1cd7-47d9-b0cf-2682dc8a5404","year":1993},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-08T15:33:51.215391Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:36.714340Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:5f470d484a20ae5a092ba803aee4a65b6b119e51e21c60ab1a877929a5ac77ad","observation_id":"d4f15ff1-9b76-4682-98e1-2f2825d64cbe","resolution":{"observed_at":"2026-08-06T22:41:39.047719Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:36.740268Z","title":"and Oudeyer, P.-Y","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-08T15:33:51.215391Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:36.740268Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:c03b4158922cf77ecece9b55088a181d74b913cabf50e0a8591e211a58a7d7c3","observation_id":"844b097e-fc4a-44d9-959f-3033e3aa5941","resolution":{"observed_at":"2026-08-06T22:41:36.740268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:39.022414Z","title":"K., Lee, H., Hwang, D., Park, S., Min, K., and Choo, J","venue":null,"work_id":"3fe7cf1f-612a-421a-b6ff-f3dca41b7d9f","year":2024},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-08T15:33:51.215391Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:36.814734Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:fbdc6fc81c35107991446f8462e9f847d2248d5f95d2487d8627fcb7a62d991c","observation_id":"3b147d4b-9840-417d-a8ce-3fcd0f63d7b5","resolution":{"observed_at":"2026-08-06T22:41:39.026333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:39.007439Z","title":"Unsupervised skill discovery with bottleneck option learning, 2021","venue":null,"work_id":"eddf565e-14b3-420d-8207-d56673951575","year":2021},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-08T15:33:51.215391Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:36.865430Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:053611b1d4505daebb1fe88aaca10f65b58e024774e40aef28b4abc271fa8189","observation_id":"e96c04cd-b09c-4589-87e6-e8d3b65bec21","resolution":{"observed_at":"2026-08-06T22:41:39.012568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:38.993996Z","title":"Active world model learning with progress curiosity","venue":null,"work_id":"07ffeae9-ae39-4997-a6b4-fb436360fe6e","year":2020},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-08T15:33:51.215391Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:36.942087Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:7f4838fe8854b5af9039b8c8cb53efb1fe2f37cd5914088cbafd30c0c5f1927c","observation_id":"31c84aeb-d9aa-468b-842f-3722166e7392","resolution":{"observed_at":"2026-08-06T22:41:38.998539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:38.980687Z","title":"Exploration in deep reinforcement learning: A survey","venue":null,"work_id":"1f7a56bc-9da6-425d-a310-a1ef51369d1c","year":2022},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-08T15:33:51.215391Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:37.015977Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:2f50d00b723ec0ac7c0157a5769e3cd81580c7c7a472dcbc7fd39dd6d5f82b5e","observation_id":"661f3f1b-5f3b-4fb8-947c-aef0e73963a1","resolution":{"observed_at":"2026-08-06T22:41:38.985466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:38.966924Z","title":"B., Yarats, D., Rajeswaran, A., and Abbeel, P","venue":null,"work_id":"23a9c6da-4f27-4834-8f67-2029e5d09aa9","year":2022},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-08T15:33:51.215391Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:37.079101Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:d67fa0694b12e0e623382661751b30d99c5c9e1233e604e524ff151fbc456681","observation_id":"b6d116a6-a48f-4cab-8144-738129961de2","resolution":{"observed_at":"2026-08-06T22:41:38.971539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:38.952745Z","title":"and Seo, S.-W","venue":null,"work_id":"cac21016-1e06-4dbb-a744-9235adc7b647","year":2023},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-08T15:33:51.215391Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:37.143371Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:bd90f55a40f6ae5a251d6058cea81b7868e612de051a7e0d71d52c2fe52a804c","observation_id":"7fb3eaea-27e2-4d7f-b4c3-a3b8e91864d3","resolution":{"observed_at":"2026-08-06T22:41:38.957700Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:38.939111Z","title":"Revisiting graph adversarial attack and defense from a data distribution perspective","venue":null,"work_id":"afe81809-5db8-44fa-878d-9e4c4a3fc870","year":2023},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-08T15:33:51.215391Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:37.200699Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:0a6c82d89c1cb946eeb215e78bd210f14f1b839255e4e1740f57b9bf344cdffb","observation_id":"95fd50be-07ad-4499-b263-8839f0ba694b","resolution":{"observed_at":"2026-08-06T22:41:38.944068Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:38.925336Z","title":"Boosting the adversarial robustness of graph neural networks: An ood perspective","venue":null,"work_id":"2258032e-96f5-4cab-b1d0-e6dec4e5622d","year":2024},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-08T15:33:51.215391Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:37.273877Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:8becec074b9f2853dba4e582d18b6a31bb3df61293a8fe17400cae340b105a78","observation_id":"5cbd798b-7508-4414-98dd-1f02158d4e1f","resolution":{"observed_at":"2026-08-06T22:41:38.929948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05804","last_updated":"2024-08-11T15:49:00Z","snapshot_observed_at":"2026-08-09T17:44:46.971943Z","submitted_at":"2024-08-11T15:49:00Z","title":"A Single Goal is All You Need: Skills and Exploration Emerge from Contrastive RL without Rewards, Demonstrations, or Subgoals","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.05804","snapshot_observed_at":"2026-08-06T22:41:37.321403Z","title":"A single goal is all you need: Skills and exploration emerge from contrastive rl without rewards, demonstrations, or subgoals","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-08T15:33:51.215391Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:37.321403Z"},"links":{"cited_paper":"/paper/2408.05804","citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:f561f001efb857525db937fe40024a0a788461e0fe0b9aa5dd987428d8d6899a","observation_id":"8972b79e-4f56-4c4d-879d-e3ff63f6d453","resolution":{"observed_at":"2026-08-06T22:41:37.321403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:38.911383Z","title":"Choreographer: Learning and adapting skills in imagination","venue":null,"work_id":"9c9bb606-f398-4a81-83b5-fb7cbfea7071","year":2022},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-08T15:33:51.215391Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:37.365884Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:b7356f67384530b4fb39f46804f198b48288e1789cddba4c191dc3e855ef65f0","observation_id":"17c92cf3-8124-4217-8929-958f476c3f8b","resolution":{"observed_at":"2026-08-06T22:41:38.916681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:38.897871Z","title":"Planning with goal-conditioned policies","venue":null,"work_id":"b4210aff-35ff-4be5-be2a-4e504cb09c34","year":2019},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-08T15:33:51.215391Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:37.462003Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:adc2832135f7212175953b0898fcc9df260545eea7161857eaf4ed4353103b52","observation_id":"57d2ebd6-1b94-4784-b061-afed5604589b","resolution":{"observed_at":"2026-08-06T22:41:38.901968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:38.884979Z","title":"Wasserstein dependency measure for representation learning","venue":null,"work_id":"3016ddcc-0230-4901-94ef-02ccda156a2d","year":2019},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-08T15:33:51.215391Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:37.499235Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:32fb1395dce044e193868379eb13c1ab0aaa851acae0738db230c5567efa7246","observation_id":"06538529-6818-4526-94fe-164caa8d0a93","resolution":{"observed_at":"2026-08-06T22:41:38.889465Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:38.871767Z","title":"Lipschitz-constrained unsupervised skill discovery","venue":null,"work_id":"a2507c5d-58d0-4293-861e-4bc0f8d60a2c","year":2022},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-08T15:33:51.215391Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:37.582284Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:d3c48d2c1c91bea21bebdb46cd50363aef66af327f1cddb6dd336e811df0559c","observation_id":"cb1c474e-9636-4702-886b-d7f66500ee3f","resolution":{"observed_at":"2026-08-06T22:41:38.876381Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:38.858788Z","title":"Hiql: Offline goal-conditioned rl with latent states as actions","venue":null,"work_id":"d050609f-001e-4c04-9b34-41c289aa29b8","year":2024},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-08T15:33:51.215391Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:37.652587Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:39be9af9e2c88278c0fb62759a5896f8a9e23bfd26ccc3ec04a683bb72b517d5","observation_id":"2318ca52-4a84-4898-b339-788fcc50afb8","resolution":{"observed_at":"2026-08-06T22:41:38.863376Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:38.845729Z","title":"Foundation policies with hilbert representations","venue":null,"work_id":"30593d81-f7eb-44a2-a10c-54309797840c","year":2024},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-08T15:33:51.215391Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:37.697677Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:7f321c0b3ab90b04b6ea9930883ec4326fc662fa74e968c579959ee5fb25a8b9","observation_id":"edf572e2-741e-428e-8fa2-e7cf5223703b","resolution":{"observed_at":"2026-08-06T22:41:38.849816Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:38.832704Z","title":"METRA : Scalable unsupervised RL with metric-aware abstraction","venue":null,"work_id":"b2b0f687-69dd-416c-af15-cd819499c137","year":2024},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-08T15:33:51.215391Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:37.797162Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:c6c3297a6e678e998d63669840bd77726f0f72a0969f183e00d37948c8cd70ea","observation_id":"1c666100-dff7-49e6-9bb4-4666000b500c","resolution":{"observed_at":"2026-08-06T22:41:38.837059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:38.819762Z","title":"Evolving curricula with regret-based environment design","venue":null,"work_id":"df70f6a8-8e4a-4154-b0d1-b6d0b878ccfd","year":2022},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-08T15:33:51.215391Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:37.867902Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:80f2304405bbe90c7dae628ec2973988e4d108972c08c340cb18dea201bac5c2","observation_id":"b04ca4b0-c24e-47a8-a6e3-beb4780880fa","resolution":{"observed_at":"2026-08-06T22:41:38.824248Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:38.805909Z","title":"A., and Darrell, T","venue":null,"work_id":"c570e2b0-9d2f-4132-8745-91734ab4ac22","year":2017},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-08T15:33:51.215391Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:37.943248Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:513a47114e419508fa08fa19e044d0dca5a4f761a63de6e732bf30f9f60be2cf","observation_id":"06fc72e3-eb0c-41b2-aeec-450f54d74c22","resolution":{"observed_at":"2026-08-06T22:41:38.810397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:38.791935Z","title":"H., Dalal, M., Lin, S., Nair, A., Bahl, S., and Levine, S","venue":null,"work_id":"06304c72-e63f-4925-b26e-20e973c466e8","year":2020},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-08T15:33:51.215391Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:38.036854Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:b2df380a44d264569d9b262c5054a98b4bc29c3c8c609b7cc0d4dde2df27c0a6","observation_id":"99fba55d-032c-4e6b-9bbb-6e0f2bb19b85","resolution":{"observed_at":"2026-08-06T22:41:38.796256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2003.04664","last_updated":"2020-05-28T20:51:40Z","snapshot_observed_at":"2026-08-09T01:09:42.786424Z","submitted_at":"2020-03-10T12:38:31Z","title":"Automatic Curriculum Learning For Deep RL: A Short Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.04664","snapshot_observed_at":"2026-08-06T22:41:38.079354Z","title":"Automatic curriculum learning for deep rl: A short survey","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-08T15:33:51.215391Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:38.079354Z"},"links":{"cited_paper":"/paper/2003.04664","citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:3ccefd7511f2b8b3a40bcc56b1b5065a9906a9a841cc0e2aa47c57a352dd5f50","observation_id":"9cfa1ce2-4d30-42d0-8d0b-d85150d118b1","resolution":{"observed_at":"2026-08-06T22:41:38.079354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:38.779065Z","title":null,"venue":null,"work_id":"537632b8-1ebd-4fb1-bd40-9beb97efe565","year":2024},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-08T15:33:51.215391Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:38.121688Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:5c9e75d0748c6cd6661fcb0c8bb40495dd9a2db9c184bad018d2f13d59ab9892","observation_id":"428819a6-0947-4e3d-90bb-107c5f699bdb","resolution":{"observed_at":"2026-08-06T22:41:38.783134Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:38.765739Z","title":"Prioritized experience replay","venue":null,"work_id":"c9aff55f-fba2-4e87-8433-27899ac2d7c9","year":2016},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-08T15:33:51.215391Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:38.131699Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:8afce0dc00cb9a921c237b319b4b8fd1b1318a3622f5abd222e57988c47c0a58","observation_id":"20125f29-6832-4238-89d4-625fbd6c8abc","resolution":{"observed_at":"2026-08-06T22:41:38.770421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-06T22:41:38.139133Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-08T15:33:51.215391Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:38.139133Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:5c06486aa4309318cb9661eb08e78a3b6e4247f023337c7f4c36e6ba65762bbe","observation_id":"c49c44bb-ec1b-4384-93b5-5b9283d4a7b8","resolution":{"observed_at":"2026-08-06T22:41:38.139133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:38.750452Z","title":"Dynamics-aware unsupervised discovery of skills","venue":null,"work_id":"0eda6792-aa51-461a-8e00-f27e4a62747e","year":2020},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-08T15:33:51.215391Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:38.149622Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:d12a0885bc23b0cd7ff7154c5cae0060ecbc8ef513a3edf1014922f6b7835bf7","observation_id":"37147148-54ea-48b5-ae05-9d0211ef2774","resolution":{"observed_at":"2026-08-06T22:41:38.755575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:38.735437Z","title":"Deterministic policy gradient algorithms","venue":null,"work_id":"2cb942d7-b420-4880-acd2-2675cd2c9f51","year":2014},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-08T15:33:51.215391Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:38.157683Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:1b5356926ff1e6410da29b9174cf6c4dd20806c97bfdf3592ee3915bf4fc7550","observation_id":"3ece75c2-8146-4a87-aac1-db7807dc5998","resolution":{"observed_at":"2026-08-06T22:41:38.740517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:38.720401Z","title":"A general reinforcement learning algorithm that masters chess, shogi, and go through self-play","venue":null,"work_id":"7658185c-c743-4a29-af13-e768e7dead00","year":2018},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-08T15:33:51.215391Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:38.165986Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:f501748d8bd57e16f8055320c63765d0ee25180d41ef1805ac6e7d9b5bb07f37","observation_id":"ae196208-c010-45c4-9dee-eea8293b97e0","resolution":{"observed_at":"2026-08-06T22:41:38.725250Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:38.706437Z","title":"Intrinsic motivation and automatic curricula via asymmetric self-play","venue":null,"work_id":"1010575a-4e60-4c67-972c-86b5d3190305","year":2018},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-08T15:33:51.215391Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:38.170823Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:1c4cc88bce51a8d42ec6e4b3b4f113cb57e02825784e599ffb08895c31b727b8","observation_id":"05395d97-732b-444f-971b-fd92e2885772","resolution":{"observed_at":"2026-08-06T22:41:38.710934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:38.692066Z","title":"Policy continuation with hindsight inverse dynamics","venue":null,"work_id":"50ea453f-3663-4a14-9e05-20bf88e699e6","year":2019},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-08T15:33:51.215391Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:38.174661Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:7596fe3ad4f4beecfd6739189db01e99a05d6535ce37f97364bc8403cd1d536a","observation_id":"72c02ece-e109-43a7-a90a-62125a6fec8f","resolution":{"observed_at":"2026-08-06T22:41:38.696597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:38.677385Z","title":"Hierarchical reinforcement learning for dynamic autonomous vehicle navigation at intelligent intersections","venue":null,"work_id":"e55d7409-250c-4423-bf39-12aca89e6d23","year":2023},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-08T15:33:51.215391Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:38.179067Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:7ad95983e1fb009b47f6c05609a0d94bd670f09253e5823ff78babbadc3c9097","observation_id":"9343b173-20df-48ed-9c25-1f9d65641445","resolution":{"observed_at":"2026-08-06T22:41:38.682455Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:38.662807Z","title":"Market-aware long-term job skill recommendation with explainable deep reinforcement learning","venue":null,"work_id":"3454ee91-8b07-4833-821b-6feb252f92cb","year":2025},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-08T15:33:51.215391Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:38.183587Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:1e3c58a687ecfb2a464c18f59b5747fc5a6d6cec6deb728eb9e11deec39bfa26","observation_id":"fdad43a7-eb70-470d-baff-90cdd4c02170","resolution":{"observed_at":"2026-08-06T22:41:38.667895Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:38.188231Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-08T15:33:51.215391Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:38.188231Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:f0ebf1d3f430fcf13cc856741afa026e69c572e4d10fb43e29db284b29757324","observation_id":"8abb6957-0f84-4e6a-b131-b2d2787a6ba8","resolution":{"observed_at":"2026-08-06T22:41:38.188231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:38.191955Z","title":"S., McAllester, D., Singh, S., and Mansour, Y","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-08T15:33:51.215391Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:38.191955Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:c3bf7bbe7214510ebdd8886e708babc25bb101d02eb1c3f1a633f78a60ccad72","observation_id":"2c1ae144-c4ff-4eb7-bd6d-223d2bb13244","resolution":{"observed_at":"2026-08-06T22:41:38.191955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:38.632264Z","title":"dm\\_control: Software and tasks for continuous control","venue":null,"work_id":"91520d11-800e-4dee-bf8e-1a3765ebce81","year":2020},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-08T15:33:51.215391Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:38.196846Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:70148850fee04c7238121fefe719220dd0b1ed94488b01f65da4d6868113c7aa","observation_id":"0c85fde9-bacb-4a1b-8a53-ba00562a2777","resolution":{"observed_at":"2026-08-06T22:41:38.637023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:38.618239Z","title":"M., Mathieu, M., Dudzik, A., Chung, J., Choi, D","venue":null,"work_id":"c0947a04-ff02-4552-882e-1879ce6dd56d","year":2019},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-08T15:33:51.215391Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:38.201024Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:ef956ee7c92411bce58fce3b6e392591df427a8d110c1a19925ccd3b5d274347","observation_id":"7fe00edc-7e18-485c-8903-9a3394f52bc8","resolution":{"observed_at":"2026-08-06T22:41:38.623333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:38.604308Z","title":"Optimal goal-reaching reinforcement learning via quasimetric learning","venue":null,"work_id":"8eb85e8d-e516-4465-84b8-09d5c45650f1","year":2023},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-08T15:33:51.215391Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:38.204893Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:d050871274f297d50d6f7d72fc15928b8cbaf354acd508bbe39cf77d638f502f","observation_id":"d7b4d0c5-2d5f-4bdc-84e9-52b926ab9d66","resolution":{"observed_at":"2026-08-06T22:41:38.608881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:38.590532Z","title":"Ski LD : Unsupervised skill discovery guided by factor interactions","venue":null,"work_id":"f41761b1-467b-4229-971d-a65edd19ce1a","year":2024},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-08T15:33:51.215391Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:38.209112Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:c1d21b0050b735ebe8716fa5da87019ee3e0f150a30d7f2a6ed0b7ebd02b53df","observation_id":"366bb4e3-00e8-4f0d-9c7f-15d14fc0b0d7","resolution":{"observed_at":"2026-08-06T22:41:38.594975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:38.577276Z","title":"A comprehensive survey of forgetting in deep learning beyond continual learning","venue":null,"work_id":"c13289bc-b6c0-400a-8a61-6ba29c6428ec","year":2024},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-08T15:33:51.215391Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:38.213181Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:6e52771d377a27609cd2dbc7d19687d54211e47ba20cab3a6d8db3b4af303452","observation_id":"14c24df4-3b5b-43a6-8166-d494a170eb41","resolution":{"observed_at":"2026-08-06T22:41:38.581685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.05865","last_updated":"2019-10-13T23:44:37Z","snapshot_observed_at":"2026-07-06T08:29:10.516150Z","submitted_at":"2019-10-13T23:44:37Z","title":"Neural Program Synthesis By Self-Learning","version":1},"cited_work":{"arxiv_id":"1910.05865","doi":null,"metadata_source":"pith","pith_arxiv_id":"1910.05865","snapshot_observed_at":"2026-08-06T22:41:38.264897Z","title":"Neural Program Synthesis By Self-Learning","venue":"cs.LG","work_id":"8897fd7a-9fd2-47cc-8346-a91fc97ae5a6","year":2019},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-08T15:33:51.215391Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:38.217400Z"},"links":{"cited_paper":"/paper/1910.05865","citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:f795e7f6ded7c124c8d31334f1c3bbbb682ce6b0d1b23726177d4d46479d8695","observation_id":"2d352df8-1244-410b-94cb-5d6481ba4334","resolution":{"observed_at":"2026-08-06T22:41:38.271036Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:38.562783Z","title":"Behavior contrastive learning for unsupervised skill discovery","venue":null,"work_id":"a847def2-0828-4acf-8d99-20783a53128f","year":2023},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-08T15:33:51.215391Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:38.222361Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:94a44a82bdbef8ba178ebb609400bb16c3eeba094a5402d797e0e1cfc4ef5671","observation_id":"499e79d3-9c9e-4f05-ba46-034c0a95d1b5","resolution":{"observed_at":"2026-08-06T22:41:38.568005Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:38.548420Z","title":"Interactive interior design recommendation via coarse-to-fine multimodal reinforcement learning","venue":null,"work_id":"706b9d57-6879-4bd6-b84e-c025949baa84","year":2023},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-08T15:33:51.215391Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:38.226237Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:ce55b62a0c2da63801241ce9483ef4b01d993e6529748772359ece41f7f17b07","observation_id":"9db995b6-e3eb-4e5b-9d9b-30ce1be6506b","resolution":{"observed_at":"2026-08-06T22:41:38.553086Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:38.533880Z","title":"Generative learning plan recommendation for employees: A performance-aware reinforcement learning approach","venue":null,"work_id":"c9a46759-4bbd-4bb7-b2e2-3252ea573355","year":2023},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-08T15:33:51.215391Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:38.230312Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:2a30690ce88ea19a014575597aa3c1fd29a0e6ad6d769a0ed2f1c3cf60f7632a","observation_id":"6c028a05-0532-41b4-8993-8abd49123dec","resolution":{"observed_at":"2026-08-06T22:41:38.538713Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T15:33:51.215391Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization"},"reference_resolution":{"displayed":74,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":20,"verified_exact":2,"verified_fuzzy":51},"total_outbound_references":74},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 74 of 74 outbound references and 0 inbound Pith citation observations for arXiv:2506.21044."}