{"as_of":"2026-08-18T12:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:517bd62fcb33f3a2cf1ed6fe5f6873ea71246d88355451708d44f71c14eff112","coverage":[{"denominator":69,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":69,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T17:50:06.496418Z","state":"measured"},{"denominator":74,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":74,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T11:36:11.391633Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-25T05:00:21.648976Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.08542","last_updated":"2024-12-11T16:59:31Z","snapshot_observed_at":"2026-08-16T14:44:16.701859Z","submitted_at":"2024-12-11T16:59:31Z","title":"MaestroMotif: Skill Design from Artificial Intelligence Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.08542","snapshot_observed_at":"2026-08-16T11:36:11.391633Z","title":"Machado, and Pierluca D’Oro","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15228","last_updated":"2025-05-16T20:58:56Z","snapshot_observed_at":"2026-08-18T11:43:14.597478Z","submitted_at":"2025-04-21T16:58:18Z","title":"A Self-Improving Coding Agent","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T11:36:11.391633Z"},"links":{"cited_paper":"/paper/2412.08542","citing_paper":"/paper/2504.15228"},"observation_digest":"sha256:66dc7042dbe3f0de38598f8bb36c7b42e192e98baa07128113ce6c76fa83b8ae","observation_id":"ffe85de8-775e-47e8-96cb-5b6c8bb0ff93","resolution":{"observed_at":"2026-08-16T11:36:11.391633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08542","last_updated":"2024-12-11T16:59:31Z","snapshot_observed_at":"2026-08-16T14:44:16.701859Z","submitted_at":"2024-12-11T16:59:31Z","title":"MaestroMotif: Skill Design from Artificial Intelligence Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.08542","snapshot_observed_at":"2026-08-16T11:16:29.684409Z","title":"Klissarov, M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.16078","last_updated":"2025-04-22T17:57:14Z","snapshot_observed_at":"2026-08-16T15:32:07.519785Z","submitted_at":"2025-04-22T17:57:14Z","title":"LLMs are Greedy Agents: Effects of RL Fine-tuning on Decision-Making Abilities","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:29.684409Z"},"links":{"cited_paper":"/paper/2412.08542","citing_paper":"/paper/2504.16078"},"observation_digest":"sha256:c14831456cc23e168ff1e77e5267a87302e9da9c73e090d773952b038aaa855c","observation_id":"95e1046d-2733-43be-832c-05820eaa8411","resolution":{"observed_at":"2026-08-16T11:16:29.684409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08542","last_updated":"2024-12-11T16:59:31Z","snapshot_observed_at":"2026-08-16T14:44:16.701859Z","submitted_at":"2024-12-11T16:59:31Z","title":"MaestroMotif: Skill Design from Artificial Intelligence Feedback","version":1},"cited_work":{"arxiv_id":"2412.08542","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.08542","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2412.08542 , year=","venue":null,"work_id":"e9cf863d-bda7-4e79-90da-b2127c3c8a68","year":null},"citing_paper":{"arxiv_id":"2604.24558","last_updated":"2026-04-27T14:47:22Z","snapshot_observed_at":"2026-08-16T08:44:50.626248Z","submitted_at":"2026-04-27T14:47:22Z","title":"Hierarchical Behaviour Spaces","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-08T03:33:48.527621Z"},"links":{"cited_paper":"/paper/2412.08542","citing_paper":"/paper/2604.24558"},"observation_digest":"sha256:4acd858276e6250665018f53206c8aaf8829a53f669fb9bf75417a2a5e86f3f8","observation_id":"7cf223ad-0ca7-4803-bddd-95b9d7d0ca99","resolution":{"observed_at":"2026-05-11T22:01:12.774139Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08542","last_updated":"2024-12-11T16:59:31Z","snapshot_observed_at":"2026-08-16T14:44:16.701859Z","submitted_at":"2024-12-11T16:59:31Z","title":"MaestroMotif: Skill Design from Artificial Intelligence Feedback","version":1},"cited_work":{"arxiv_id":"2412.08542","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.08542","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2412.08542 , year=","venue":null,"work_id":"e9cf863d-bda7-4e79-90da-b2127c3c8a68","year":null},"citing_paper":{"arxiv_id":"2605.06869","last_updated":"2026-05-12T18:33:33Z","snapshot_observed_at":"2026-08-12T09:05:52.882883Z","submitted_at":"2026-05-07T19:12:03Z","title":"Agentick: A Unified Benchmark for General Sequential Decision-Making Agents","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-11T01:22:32.713175Z"},"links":{"cited_paper":"/paper/2412.08542","citing_paper":"/paper/2605.06869"},"observation_digest":"sha256:8c60fec3b43bfc7207082528892a6e3ef451d5f04d8e0e88739d0d75fdfb1e8e","observation_id":"0150f5a1-ed7a-4c53-be4b-88a5ce04855e","resolution":{"observed_at":"2026-05-11T04:25:58.723344Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08542","last_updated":"2024-12-11T16:59:31Z","snapshot_observed_at":"2026-08-16T14:44:16.701859Z","submitted_at":"2024-12-11T16:59:31Z","title":"MaestroMotif: Skill Design from Artificial Intelligence Feedback","version":1},"cited_work":{"arxiv_id":"2412.08542","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.08542","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2412.08542 , year=","venue":null,"work_id":"e9cf863d-bda7-4e79-90da-b2127c3c8a68","year":null},"citing_paper":{"arxiv_id":"2605.23551","last_updated":"2026-05-22T12:17:09Z","snapshot_observed_at":"2026-07-06T23:33:44.335185Z","submitted_at":"2026-05-22T12:17:09Z","title":"Goal-Conditioned Agents that Learn Everything All at Once","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-05-25T04:59:48.867927Z"},"links":{"cited_paper":"/paper/2412.08542","citing_paper":"/paper/2605.23551"},"observation_digest":"sha256:220e0d493ed9f2180edf3b179ca867de27bca22d8f4fb32aef1672190983b0ce","observation_id":"868116f4-dc41-43b7-a744-ee1ee21c8bbc","resolution":{"observed_at":"2026-05-25T05:00:21.652397Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.08542/citation-record","integrity":"/paper/2412.08542/integrity","json":"/paper/2412.08542/citation-record.json","paper":"/paper/2412.08542"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2204.01691","last_updated":"2022-08-16T16:06:33Z","snapshot_observed_at":"2026-08-18T11:44:22.813405Z","submitted_at":"2022-04-04T17:57:11Z","title":"Do As I Can, Not As I Say: Grounding Language in Robotic Affordances","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.01691","snapshot_observed_at":"2026-08-11T17:50:06.201993Z","title":"Do as i can, not as i say: Grounding language in robotic affordances, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.08542","last_updated":"2024-12-11T16:59:31Z","snapshot_observed_at":"2026-08-16T14:44:16.701859Z","submitted_at":"2024-12-11T16:59:31Z","title":"MaestroMotif: Skill Design from Artificial Intelligence Feedback","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-11T17:50:06.201993Z"},"links":{"cited_paper":"/paper/2204.01691","citing_paper":"/paper/2412.08542"},"observation_digest":"sha256:8c2cc763211804fcba795ada2275e8b0d5f50dd0ee53a91f70f18680e4ae3015","observation_id":"58cfd567-bace-4ebf-800e-0855d8b672b6","resolution":{"observed_at":"2026-08-11T17:50:06.201993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:50:07.435938Z","title":"Modular multitask reinforcement learning with policy sketches","venue":null,"work_id":"596a260c-201c-4d83-b6dc-51327fe8acf5","year":2017},"citing_paper":{"arxiv_id":"2412.08542","last_updated":"2024-12-11T16:59:31Z","snapshot_observed_at":"2026-08-16T14:44:16.701859Z","submitted_at":"2024-12-11T16:59:31Z","title":"MaestroMotif: Skill Design from Artificial Intelligence Feedback","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-11T17:50:06.206987Z"},"links":{"citing_paper":"/paper/2412.08542"},"observation_digest":"sha256:b84cf7bfb7f55cd235b89bd0a9fa043b511d71c2a93d1ab3e43e24c40faf6e2c","observation_id":"137bb165-34c6-4539-9282-818027a12a80","resolution":{"observed_at":"2026-08-11T17:50:07.440718Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:50:07.423664Z","title":"Senthil, and George Dimitri Konidaris","venue":null,"work_id":"33f25fa9-6e0c-4f79-a9d7-339bfcbb5718","year":2021},"citing_paper":{"arxiv_id":"2412.08542","last_updated":"2024-12-11T16:59:31Z","snapshot_observed_at":"2026-08-16T14:44:16.701859Z","submitted_at":"2024-12-11T16:59:31Z","title":"MaestroMotif: Skill Design from Artificial Intelligence Feedback","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T17:50:06.211451Z"},"links":{"citing_paper":"/paper/2412.08542"},"observation_digest":"sha256:6365bbfbf18d2462f4f07cb3f696d60e45aad86a82e866906da070dfc9e58bda","observation_id":"d396c276-d027-4a34-ab81-f2e5ff80b9db","resolution":{"observed_at":"2026-08-11T17:50:07.427822Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:50:07.411557Z","title":"Bellemare, Sriram Srinivasan, Georg Ostrovski, Tom Schaul, David Saxton, and R \\'e mi Munos","venue":null,"work_id":"e380cddb-5a03-496e-8943-1e859087aab9","year":2016},"citing_paper":{"arxiv_id":"2412.08542","last_updated":"2024-12-11T16:59:31Z","snapshot_observed_at":"2026-08-16T14:44:16.701859Z","submitted_at":"2024-12-11T16:59:31Z","title":"MaestroMotif: Skill Design from Artificial Intelligence Feedback","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-11T17:50:06.215953Z"},"links":{"citing_paper":"/paper/2412.08542"},"observation_digest":"sha256:a16c5bbb2719cdd7fedad3c82d5bf1659b37f99cffc84af40b26885e05651b59","observation_id":"a58f98c9-f3a4-4a0a-b3b6-ccbe83e485ec","resolution":{"observed_at":"2026-08-11T17:50:07.415930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:50:06.220070Z","title":null,"venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2412.08542","last_updated":"2024-12-11T16:59:31Z","snapshot_observed_at":"2026-08-16T14:44:16.701859Z","submitted_at":"2024-12-11T16:59:31Z","title":"MaestroMotif: Skill Design from Artificial Intelligence Feedback","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-11T17:50:06.220070Z"},"links":{"citing_paper":"/paper/2412.08542"},"observation_digest":"sha256:0de2beaa9cb0d6507d4d5d7db33813cf29681fbc8541cbd7a8c84775867fac28","observation_id":"c024aa11-85af-4a27-98bd-fd06892f0b7a","resolution":{"observed_at":"2026-08-11T17:50:06.220070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.03741","last_updated":"2023-02-17T17:00:34Z","snapshot_observed_at":"2026-08-12T12:29:44.507445Z","submitted_at":"2017-06-12T17:23:59Z","title":"Deep reinforcement learning from human preferences","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.03741","snapshot_observed_at":"2026-08-11T17:50:06.224437Z","title":"Brown, Miljan Martic, Shane Legg, and Dario Amodei","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.08542","last_updated":"2024-12-11T16:59:31Z","snapshot_observed_at":"2026-08-16T14:44:16.701859Z","submitted_at":"2024-12-11T16:59:31Z","title":"MaestroMotif: Skill Design from Artificial Intelligence Feedback","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-11T17:50:06.224437Z"},"links":{"cited_paper":"/paper/1706.03741","citing_paper":"/paper/2412.08542"},"observation_digest":"sha256:532765ad488f1c5c328d06626784ff04f471fcfe219a081f0b96c0f53536d14a","observation_id":"4cda2ca2-63e1-4678-acf1-6892541d3ccc","resolution":{"observed_at":"2026-08-11T17:50:06.224437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:50:06.229138Z","title":null,"venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2412.08542","last_updated":"2024-12-11T16:59:31Z","snapshot_observed_at":"2026-08-16T14:44:16.701859Z","submitted_at":"2024-12-11T16:59:31Z","title":"MaestroMotif: Skill Design from Artificial Intelligence Feedback","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T17:50:06.229138Z"},"links":{"citing_paper":"/paper/2412.08542"},"observation_digest":"sha256:9751d77a7fcf081ccea4c4fb65e8843d212a29fa8aa759e9c8a072349f0e55ce","observation_id":"f8bf0ad2-3eae-4966-874c-7b3826d98809","resolution":{"observed_at":"2026-08-11T17:50:06.229138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:50:07.392540Z","title":"Active reward learning","venue":null,"work_id":"4e0da0b4-4656-4c12-a4ff-0144d65fdc5a","year":2014},"citing_paper":{"arxiv_id":"2412.08542","last_updated":"2024-12-11T16:59:31Z","snapshot_observed_at":"2026-08-16T14:44:16.701859Z","submitted_at":"2024-12-11T16:59:31Z","title":"MaestroMotif: Skill Design from Artificial Intelligence Feedback","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T17:50:06.232964Z"},"links":{"citing_paper":"/paper/2412.08542"},"observation_digest":"sha256:49fd522daf67c4d392d08e22836c291921dabf99dbff8995bc154da6096a434b","observation_id":"a3e71b35-88ec-4be5-bad2-cfbfbc9bf390","resolution":{"observed_at":"2026-08-11T17:50:07.396589Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:50:07.380509Z","title":"Feudal reinforcement learning","venue":null,"work_id":"998fea17-e34d-4cb7-a177-9dd25cce09f6","year":1993},"citing_paper":{"arxiv_id":"2412.08542","last_updated":"2024-12-11T16:59:31Z","snapshot_observed_at":"2026-08-16T14:44:16.701859Z","submitted_at":"2024-12-11T16:59:31Z","title":"MaestroMotif: Skill Design from Artificial Intelligence Feedback","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T17:50:06.236643Z"},"links":{"citing_paper":"/paper/2412.08542"},"observation_digest":"sha256:539a1c8ca49a015a538792fb6b369af721ebb496b33e10c5a1485b2828bd37e5","observation_id":"2fe29d7e-3dfc-46a0-8382-6b8c28229f27","resolution":{"observed_at":"2026-08-11T17:50:07.384682Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:50:07.368153Z","title":"Drescher","venue":null,"work_id":"7ee8df57-b18f-407f-a4b1-b6959f639519","year":1991},"citing_paper":{"arxiv_id":"2412.08542","last_updated":"2024-12-11T16:59:31Z","snapshot_observed_at":"2026-08-16T14:44:16.701859Z","submitted_at":"2024-12-11T16:59:31Z","title":"MaestroMotif: Skill Design from Artificial Intelligence Feedback","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T17:50:06.240419Z"},"links":{"citing_paper":"/paper/2412.08542"},"observation_digest":"sha256:ba319bdb1d95ef9f297399ed813d12c12a1c1f8fd93c41c0b27332a89f61a56d","observation_id":"f9f3dd4d-7826-44fc-a441-4a139b69556b","resolution":{"observed_at":"2026-08-11T17:50:07.372383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-08-14T18:47:26.721223Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-08-11T17:50:06.244955Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08542","last_updated":"2024-12-11T16:59:31Z","snapshot_observed_at":"2026-08-16T14:44:16.701859Z","submitted_at":"2024-12-11T16:59:31Z","title":"MaestroMotif: Skill Design from Artificial Intelligence Feedback","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T17:50:06.244955Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2412.08542"},"observation_digest":"sha256:5c68024782ed605de3b97a98ca6d1179f95f149106da48cab9701ce6ccb7b926","observation_id":"e87da5df-3086-4d12-8a65-f5f9e5ca3bf0","resolution":{"observed_at":"2026-08-11T17:50:06.244955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-11T17:50:06.250015Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08542","last_updated":"2024-12-11T16:59:31Z","snapshot_observed_at":"2026-08-16T14:44:16.701859Z","submitted_at":"2024-12-11T16:59:31Z","title":"MaestroMotif: Skill Design from Artificial Intelligence Feedback","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T17:50:06.250015Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2412.08542"},"observation_digest":"sha256:d6f0c7f31e069b29e06461133025212f52071c1edfc1ec7013edc42105f5b572","observation_id":"8381b071-cda7-4d3a-848c-a0b31aa62227","resolution":{"observed_at":"2026-08-11T17:50:06.250015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:50:06.254663Z","title":"Minedojo: Building open-ended embodied agents with internet-scale knowledge","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.08542","last_updated":"2024-12-11T16:59:31Z","snapshot_observed_at":"2026-08-16T14:44:16.701859Z","submitted_at":"2024-12-11T16:59:31Z","title":"MaestroMotif: Skill Design from Artificial Intelligence Feedback","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T17:50:06.254663Z"},"links":{"citing_paper":"/paper/2412.08542"},"observation_digest":"sha256:24e52c345c9abdde1a502691733c5911e400e991cca35665032c6e6d124ce66d","observation_id":"736d0f78-8f4f-4f21-b084-caa495e58e4c","resolution":{"observed_at":"2026-08-11T17:50:06.254663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:50:07.341438Z","title":"Hart, and Nils J","venue":null,"work_id":"e559c0b6-c68a-4e5a-989c-cab06738a7a4","year":1993},"citing_paper":{"arxiv_id":"2412.08542","last_updated":"2024-12-11T16:59:31Z","snapshot_observed_at":"2026-08-16T14:44:16.701859Z","submitted_at":"2024-12-11T16:59:31Z","title":"MaestroMotif: Skill Design from Artificial Intelligence Feedback","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-11T17:50:06.258412Z"},"links":{"citing_paper":"/paper/2412.08542"},"observation_digest":"sha256:0d4983837e1aacb01adeb6773401f4fa892218b1dc441d2a76cde54682c9be07","observation_id":"9a433a8e-88eb-4a4f-839b-38d789c1320d","resolution":{"observed_at":"2026-08-11T17:50:07.346142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:50:07.329850Z","title":"Variational intrinsic control","venue":null,"work_id":"b5d73293-a53e-473d-9ac9-f9653ac1ac05","year":2017},"citing_paper":{"arxiv_id":"2412.08542","last_updated":"2024-12-11T16:59:31Z","snapshot_observed_at":"2026-08-16T14:44:16.701859Z","submitted_at":"2024-12-11T16:59:31Z","title":"MaestroMotif: Skill Design from Artificial Intelligence Feedback","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-11T17:50:06.262519Z"},"links":{"citing_paper":"/paper/2412.08542"},"observation_digest":"sha256:6ed505644b9cffbc9dd91435665775a481c3e80a5036af648710c41b6cd58f3c","observation_id":"c967e085-3cf0-45cc-8d01-c892a1bd063d","resolution":{"observed_at":"2026-08-11T17:50:07.333552Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:50:07.318255Z","title":"u ttler, Taehwon Kwon, Donghoon Lee, Vegard Mella, Nantas Nardelli, Ivan Nazarov, Nikita Ovsov, Jack Holder, Roberta Raileanu, Karolis Ramanauskas, Tim Rockt \\","venue":null,"work_id":"a70dfc59-9a7f-4a38-aec8-be40d5b00b05","year":2021},"citing_paper":{"arxiv_id":"2412.08542","last_updated":"2024-12-11T16:59:31Z","snapshot_observed_at":"2026-08-16T14:44:16.701859Z","submitted_at":"2024-12-11T16:59:31Z","title":"MaestroMotif: Skill Design from Artificial Intelligence Feedback","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-11T17:50:06.266672Z"},"links":{"citing_paper":"/paper/2412.08542"},"observation_digest":"sha256:03ea5a2497aa0e7318f0b1aa9e4cc06a8a29d21574a85e61a18a3e50b4eef1ec","observation_id":"6258b150-4377-4a54-b181-21a646b85509","resolution":{"observed_at":"2026-08-11T17:50:07.322523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:50:07.306094Z","title":"Dungeons and data: A large-scale nethack dataset","venue":null,"work_id":"780e9802-ed44-40a2-8ef9-c6225892f83e","year":2022},"citing_paper":{"arxiv_id":"2412.08542","last_updated":"2024-12-11T16:59:31Z","snapshot_observed_at":"2026-08-16T14:44:16.701859Z","submitted_at":"2024-12-11T16:59:31Z","title":"MaestroMotif: Skill Design from Artificial Intelligence Feedback","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-11T17:50:06.270432Z"},"links":{"citing_paper":"/paper/2412.08542"},"observation_digest":"sha256:90777b9739b9d69a50651be65510ffcd96e9ccf99aef63713ac5c3038e847ca4","observation_id":"825399fc-fc59-4d19-adbb-6043b2211222","resolution":{"observed_at":"2026-08-11T17:50:07.310372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1709.04571","last_updated":"2017-09-14T00:18:44Z","snapshot_observed_at":"2026-08-14T20:33:21.775829Z","submitted_at":"2017-09-14T00:18:44Z","title":"When Waiting is not an Option : Learning Options with a Deliberation Cost","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1709.04571","snapshot_observed_at":"2026-08-11T17:50:06.274759Z","title":"When waiting is not an option : Learning options with a deliberation cost","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.08542","last_updated":"2024-12-11T16:59:31Z","snapshot_observed_at":"2026-08-16T14:44:16.701859Z","submitted_at":"2024-12-11T16:59:31Z","title":"MaestroMotif: Skill Design from Artificial Intelligence Feedback","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-11T17:50:06.274759Z"},"links":{"cited_paper":"/paper/1709.04571","citing_paper":"/paper/2412.08542"},"observation_digest":"sha256:c66a8cb5f63ddf6c5b101e2c1570795a3b6bdd2366159e0d32219d6e7b5cd876","observation_id":"bc0b6704-6e62-4635-bd98-45973b0765ad","resolution":{"observed_at":"2026-08-11T17:50:06.274759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:50:07.294213Z","title":"Exploration via elliptical episodic bonuses","venue":null,"work_id":"4313adc7-33a0-4290-90fa-fabedf9706bc","year":2022},"citing_paper":{"arxiv_id":"2412.08542","last_updated":"2024-12-11T16:59:31Z","snapshot_observed_at":"2026-08-16T14:44:16.701859Z","submitted_at":"2024-12-11T16:59:31Z","title":"MaestroMotif: Skill Design from Artificial Intelligence Feedback","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-11T17:50:06.279401Z"},"links":{"citing_paper":"/paper/2412.08542"},"observation_digest":"sha256:9cc84d6c6cae4e62da68dd63e0fe63f58e79174a245ab401fd14eee5993f8744","observation_id":"fb84a863-430b-4439-952e-2295f123ac18","resolution":{"observed_at":"2026-08-11T17:50:07.298339Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:50:07.282125Z","title":null,"venue":null,"work_id":"5ec46664-a87f-4e6d-94be-ed872aa02235","year":1969},"citing_paper":{"arxiv_id":"2412.08542","last_updated":"2024-12-11T16:59:31Z","snapshot_observed_at":"2026-08-16T14:44:16.701859Z","submitted_at":"2024-12-11T16:59:31Z","title":"MaestroMotif: Skill Design from Artificial Intelligence Feedback","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T17:50:06.283884Z"},"links":{"citing_paper":"/paper/2412.08542"},"observation_digest":"sha256:8289df5ac9f3bc005d26f5cb4e8154abb8cc8c4eef90cb85b6c53f330141f161","observation_id":"a18b4ca7-2838-4a8b-a077-ba32edaf0af1","resolution":{"observed_at":"2026-08-11T17:50:07.285986Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:50:07.269281Z","title":"Open-endedness is essential for artificial superhuman intelligence, 06 2024","venue":null,"work_id":"410763b4-205d-492d-9e7d-49a8f2fee272","year":2024},"citing_paper":{"arxiv_id":"2412.08542","last_updated":"2024-12-11T16:59:31Z","snapshot_observed_at":"2026-08-16T14:44:16.701859Z","submitted_at":"2024-12-11T16:59:31Z","title":"MaestroMotif: Skill Design from Artificial Intelligence Feedback","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-11T17:50:06.287785Z"},"links":{"citing_paper":"/paper/2412.08542"},"observation_digest":"sha256:a5b0d6fb84e0a9eb7f001e50d4981fce47349f29a55857fba57ebab16bc2f2b4","observation_id":"3bee4fe8-bb36-4a22-988f-2115b4ed6d84","resolution":{"observed_at":"2026-08-11T17:50:07.273395Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:50:07.257295Z","title":null,"venue":null,"work_id":"d3fc9dbb-fb64-446a-af32-62af5f1e9828","year":1989},"citing_paper":{"arxiv_id":"2412.08542","last_updated":"2024-12-11T16:59:31Z","snapshot_observed_at":"2026-08-16T14:44:16.701859Z","submitted_at":"2024-12-11T16:59:31Z","title":"MaestroMotif: Skill Design from Artificial Intelligence Feedback","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-11T17:50:06.291930Z"},"links":{"citing_paper":"/paper/2412.08542"},"observation_digest":"sha256:e063cb7e62ea0c6530e18217f0e1356600c0f25f1f381d3c0c885647bb839e2a","observation_id":"e990c377-7225-4081-af6f-e8912b474127","resolution":{"observed_at":"2026-08-11T17:50:07.261438Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:50:07.243789Z","title":"Options of interest: Temporal abstraction with interest functions","venue":null,"work_id":"aa41576b-528a-446f-a67e-39feb9b4ecc6","year":2020},"citing_paper":{"arxiv_id":"2412.08542","last_updated":"2024-12-11T16:59:31Z","snapshot_observed_at":"2026-08-16T14:44:16.701859Z","submitted_at":"2024-12-11T16:59:31Z","title":"MaestroMotif: Skill Design from Artificial Intelligence Feedback","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-11T17:50:06.295915Z"},"links":{"citing_paper":"/paper/2412.08542"},"observation_digest":"sha256:d0a6336e4fd82c7fd35075e9c6a252433b23d310b488b47a14b5f6654554293b","observation_id":"6711e68a-137c-44ff-96ac-5c8b362deb8f","resolution":{"observed_at":"2026-08-11T17:50:07.248119Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:50:07.231564Z","title":null,"venue":null,"work_id":"d2b39e53-7eca-46bb-afe6-b068fe41b11d","year":2023},"citing_paper":{"arxiv_id":"2412.08542","last_updated":"2024-12-11T16:59:31Z","snapshot_observed_at":"2026-08-16T14:44:16.701859Z","submitted_at":"2024-12-11T16:59:31Z","title":"MaestroMotif: Skill Design from Artificial Intelligence Feedback","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-11T17:50:06.300665Z"},"links":{"citing_paper":"/paper/2412.08542"},"observation_digest":"sha256:8ecf28a444dfa48c2db579c4f0f2b8e90d55ba2d82a753c16f29b5c2ac370a45","observation_id":"64eb8769-ca71-4adc-9880-3ba01a4cf1c5","resolution":{"observed_at":"2026-08-11T17:50:07.235751Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:50:06.304422Z","title":"Motif: Intrinsic motivation from artificial intelligence feedback","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08542","last_updated":"2024-12-11T16:59:31Z","snapshot_observed_at":"2026-08-16T14:44:16.701859Z","submitted_at":"2024-12-11T16:59:31Z","title":"MaestroMotif: Skill Design from Artificial Intelligence Feedback","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-11T17:50:06.304422Z"},"links":{"citing_paper":"/paper/2412.08542"},"observation_digest":"sha256:2c9ac7ab217f81f2804d5241dd8aa41e725134f4624dac1ff26641788fd58c7f","observation_id":"1fc87d47-db2f-4926-b6c2-cdbb31bdb224","resolution":{"observed_at":"2026-08-11T17:50:06.304422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:50:07.210728Z","title":"Keep your options open: An information-based driving principle for sensorimotor systems","venue":null,"work_id":"f62877eb-9bc6-4948-88e0-1ff02b4950cc","year":2008},"citing_paper":{"arxiv_id":"2412.08542","last_updated":"2024-12-11T16:59:31Z","snapshot_observed_at":"2026-08-16T14:44:16.701859Z","submitted_at":"2024-12-11T16:59:31Z","title":"MaestroMotif: Skill Design from Artificial Intelligence Feedback","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-11T17:50:06.308405Z"},"links":{"citing_paper":"/paper/2412.08542"},"observation_digest":"sha256:be5f3696d019cdd80254bb170f770cb8fe2931cd63651280409b20ea31df92f4","observation_id":"914032c9-ad51-4f15-808c-50011e2a8f9b","resolution":{"observed_at":"2026-08-11T17:50:07.215052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:50:06.312568Z","title":"Interactively shaping agents via human reinforcement: The tamer framework","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2412.08542","last_updated":"2024-12-11T16:59:31Z","snapshot_observed_at":"2026-08-16T14:44:16.701859Z","submitted_at":"2024-12-11T16:59:31Z","title":"MaestroMotif: Skill Design from Artificial Intelligence Feedback","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-11T17:50:06.312568Z"},"links":{"citing_paper":"/paper/2412.08542"},"observation_digest":"sha256:b54aa4c9f7bdb73a2bb890b60009894c576f86a9d36198ccda20cfcca1d322cf","observation_id":"7f331168-b01b-445c-8738-fff879ea7452","resolution":{"observed_at":"2026-08-11T17:50:06.312568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:50:07.190499Z","title":"From skills to symbols: Learning symbolic representations for abstract high-level planning","venue":null,"work_id":"b6517f8e-be8e-4102-81fd-22c396486379","year":2018},"citing_paper":{"arxiv_id":"2412.08542","last_updated":"2024-12-11T16:59:31Z","snapshot_observed_at":"2026-08-16T14:44:16.701859Z","submitted_at":"2024-12-11T16:59:31Z","title":"MaestroMotif: Skill Design from Artificial Intelligence Feedback","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-11T17:50:06.322091Z"},"links":{"citing_paper":"/paper/2412.08542"},"observation_digest":"sha256:46b73a5e66b06f0c8c4fb8018d82796cfff00f6c12958b98ee469a9bca893553","observation_id":"060cb00f-3593-4a44-b224-55f1cabc66f4","resolution":{"observed_at":"2026-08-11T17:50:07.195485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:50:06.326391Z","title":"Practice makes perfect: Planning to learn skill parameter policies","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08542","last_updated":"2024-12-11T16:59:31Z","snapshot_observed_at":"2026-08-16T14:44:16.701859Z","submitted_at":"2024-12-11T16:59:31Z","title":"MaestroMotif: Skill Design from Artificial Intelligence Feedback","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-11T17:50:06.326391Z"},"links":{"citing_paper":"/paper/2412.08542"},"observation_digest":"sha256:3ce1b50fd814a37f502c75f84697954fcdc47a03304b8d2ebec64855e5068c62","observation_id":"67cfa847-3ac3-4374-957d-56e0c425eabd","resolution":{"observed_at":"2026-08-11T17:50:06.326391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:50:06.330268Z","title":"u ttler, Nantas Nardelli, Alexander H. Miller, Roberta Raileanu, Marco Selvatici, Edward Grefenstette, and Tim Rockt \\","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.08542","last_updated":"2024-12-11T16:59:31Z","snapshot_observed_at":"2026-08-16T14:44:16.701859Z","submitted_at":"2024-12-11T16:59:31Z","title":"MaestroMotif: Skill Design from Artificial Intelligence Feedback","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-11T17:50:06.330268Z"},"links":{"citing_paper":"/paper/2412.08542"},"observation_digest":"sha256:7582545aae37dc1d2a0823eaa68b1a08119f868a1b9f80ad716c87dda99ec0a1","observation_id":"66c0ba1c-9fe4-427f-a50e-9aa05329953f","resolution":{"observed_at":"2026-08-11T17:50:06.330268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:50:06.334577Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08542","last_updated":"2024-12-11T16:59:31Z","snapshot_observed_at":"2026-08-16T14:44:16.701859Z","submitted_at":"2024-12-11T16:59:31Z","title":"MaestroMotif: Skill Design from Artificial Intelligence Feedback","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-11T17:50:06.334577Z"},"links":{"citing_paper":"/paper/2412.08542"},"observation_digest":"sha256:ca0fc3a5b7d0129f6cb3ad9a66770b2a0fd46e7948c38378b727ef83100c93f9","observation_id":"6ddcd9fd-3060-4456-8f03-c66ec95e385f","resolution":{"observed_at":"2026-08-11T17:50:06.334577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:50:06.338517Z","title":"Code as policies: Language model programs for embodied control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08542","last_updated":"2024-12-11T16:59:31Z","snapshot_observed_at":"2026-08-16T14:44:16.701859Z","submitted_at":"2024-12-11T16:59:31Z","title":"MaestroMotif: Skill Design from Artificial Intelligence Feedback","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-11T17:50:06.338517Z"},"links":{"citing_paper":"/paper/2412.08542"},"observation_digest":"sha256:73fd0359a93a02ca57522b81688a959c41d3df1f45d2cd944970b06036c69bb5","observation_id":"4cbe3cbe-b9b4-4914-8abd-a9e93af5e7e2","resolution":{"observed_at":"2026-08-11T17:50:06.338517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.11477","last_updated":"2023-09-27T07:29:44Z","snapshot_observed_at":"2026-08-12T21:21:48.006892Z","submitted_at":"2023-04-22T20:34:03Z","title":"LLM+P: Empowering Large Language Models with Optimal Planning Proficiency","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.11477","snapshot_observed_at":"2026-08-11T17:50:06.342410Z","title":"Liu, Yuqian Jiang, Xiaohan Zhang, Qian Liu, Shiqi Zhang, Joydeep Biswas, and Peter Stone","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08542","last_updated":"2024-12-11T16:59:31Z","snapshot_observed_at":"2026-08-16T14:44:16.701859Z","submitted_at":"2024-12-11T16:59:31Z","title":"MaestroMotif: Skill Design from Artificial Intelligence Feedback","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-11T17:50:06.342410Z"},"links":{"cited_paper":"/paper/2304.11477","citing_paper":"/paper/2412.08542"},"observation_digest":"sha256:51f8d7f5d80047494b1c2c82265bcd33424d46bfdeefb51623680ba35985b74b","observation_id":"51bdf37e-afd1-4fc6-932a-1412f4cb66e2","resolution":{"observed_at":"2026-08-11T17:50:06.342410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:50:07.157246Z","title":"Goal-conditioned reinforcement learning: Problems and solutions","venue":null,"work_id":"f925b050-1d9a-4b5f-a575-23a08a3768da","year":2022},"citing_paper":{"arxiv_id":"2412.08542","last_updated":"2024-12-11T16:59:31Z","snapshot_observed_at":"2026-08-16T14:44:16.701859Z","submitted_at":"2024-12-11T16:59:31Z","title":"MaestroMotif: Skill Design from Artificial Intelligence Feedback","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-11T17:50:06.347887Z"},"links":{"citing_paper":"/paper/2412.08542"},"observation_digest":"sha256:2799bbad885e072d0c223de8f934670f8ea56bbe61630af9522f0a5fa8c0cc13","observation_id":"a153dfa8-2807-45ae-a59f-19a3b5c41397","resolution":{"observed_at":"2026-08-11T17:50:07.161693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:50:07.144027Z","title":"A laplacian framework for option discovery in reinforcement learning","venue":null,"work_id":"310cec5e-078f-4cbd-8900-82b3f6de7166","year":2017},"citing_paper":{"arxiv_id":"2412.08542","last_updated":"2024-12-11T16:59:31Z","snapshot_observed_at":"2026-08-16T14:44:16.701859Z","submitted_at":"2024-12-11T16:59:31Z","title":"MaestroMotif: Skill Design from Artificial Intelligence Feedback","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-11T17:50:06.351838Z"},"links":{"citing_paper":"/paper/2412.08542"},"observation_digest":"sha256:68880a21d529564dea2eb6188d8712499be3e192dfd3227282c9657065a561bf","observation_id":"159ac966-efa9-41af-a8b4-dcf577d5b637","resolution":{"observed_at":"2026-08-11T17:50:07.148018Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:50:07.131859Z","title":"Machado, Andr \\'e Barreto, and Doina Precup","venue":null,"work_id":"985f4206-ab37-46c8-81ec-817d50e6357a","year":2023},"citing_paper":{"arxiv_id":"2412.08542","last_updated":"2024-12-11T16:59:31Z","snapshot_observed_at":"2026-08-16T14:44:16.701859Z","submitted_at":"2024-12-11T16:59:31Z","title":"MaestroMotif: Skill Design from Artificial Intelligence Feedback","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-11T17:50:06.355951Z"},"links":{"citing_paper":"/paper/2412.08542"},"observation_digest":"sha256:804b4bcc4b55d1fe2d45bc9f8b46a6f7003043e24eabdec7bc4abab6ee8e7f0c","observation_id":"f2290405-1187-4902-9ebd-e631078d6ec7","resolution":{"observed_at":"2026-08-11T17:50:07.135628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.17651","last_updated":"2023-05-25T19:13:47Z","snapshot_observed_at":"2026-08-17T09:48:37.358540Z","submitted_at":"2023-03-30T18:30:01Z","title":"Self-Refine: Iterative Refinement with Self-Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.17651","snapshot_observed_at":"2026-08-11T17:50:06.359714Z","title":"Self-refine: Iterative refinement with self-feedback","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08542","last_updated":"2024-12-11T16:59:31Z","snapshot_observed_at":"2026-08-16T14:44:16.701859Z","submitted_at":"2024-12-11T16:59:31Z","title":"MaestroMotif: Skill Design from Artificial Intelligence Feedback","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-11T17:50:06.359714Z"},"links":{"cited_paper":"/paper/2303.17651","citing_paper":"/paper/2412.08542"},"observation_digest":"sha256:e9bc508bb92acc801d87d4053c27f73e347d0048047ef2184288b29dbe9bf22c","observation_id":"d1883cf2-22b1-458e-83c1-da7ca0e2bb9a","resolution":{"observed_at":"2026-08-11T17:50:06.359714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:50:07.120212Z","title":"Concurrent hierarchical reinforcement learning","venue":null,"work_id":"ed0a4d0a-b93c-4f2d-98f3-5a8ce3f858d6","year":2005},"citing_paper":{"arxiv_id":"2412.08542","last_updated":"2024-12-11T16:59:31Z","snapshot_observed_at":"2026-08-16T14:44:16.701859Z","submitted_at":"2024-12-11T16:59:31Z","title":"MaestroMotif: Skill Design from Artificial Intelligence Feedback","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-11T17:50:06.363855Z"},"links":{"citing_paper":"/paper/2412.08542"},"observation_digest":"sha256:a3bab289295662dcf80be0c3fa7bdd71d980a2ace4422c5f791a36a24a19ebe4","observation_id":"cb0f5c7b-b459-4184-8d78-219be8b5d5aa","resolution":{"observed_at":"2026-08-11T17:50:07.124086Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:50:06.368361Z","title":"Howe, Craig A","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2412.08542","last_updated":"2024-12-11T16:59:31Z","snapshot_observed_at":"2026-08-16T14:44:16.701859Z","submitted_at":"2024-12-11T16:59:31Z","title":"MaestroMotif: Skill Design from Artificial Intelligence Feedback","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-11T17:50:06.368361Z"},"links":{"citing_paper":"/paper/2412.08542"},"observation_digest":"sha256:9fafc977064ce13b8dc88a0cfbda981e20a6c3e6faa1da30d48d85845199ac18","observation_id":"cb4782cf-d8fe-4b23-84b5-5ddf4b847f6c","resolution":{"observed_at":"2026-08-11T17:50:06.368361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:50:07.100711Z","title":null,"venue":null,"work_id":"26ad9a89-7145-4e5a-8744-d45cca84cfe6","year":2001},"citing_paper":{"arxiv_id":"2412.08542","last_updated":"2024-12-11T16:59:31Z","snapshot_observed_at":"2026-08-16T14:44:16.701859Z","submitted_at":"2024-12-11T16:59:31Z","title":"MaestroMotif: Skill Design from Artificial Intelligence Feedback","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-11T17:50:06.371824Z"},"links":{"citing_paper":"/paper/2412.08542"},"observation_digest":"sha256:4680473f055b283b51bb2ebf4cc621e10b6e36bd4e8694d944bc668d51859ecd","observation_id":"02efb005-5ddf-4603-b9c6-5dc1be3884b3","resolution":{"observed_at":"2026-08-11T17:50:07.104896Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:50:07.085452Z","title":"Q-cut - dynamic discovery of sub-goals in reinforcement learning","venue":null,"work_id":"5e41954e-8078-4338-a21c-9cd43d151e88","year":2002},"citing_paper":{"arxiv_id":"2412.08542","last_updated":"2024-12-11T16:59:31Z","snapshot_observed_at":"2026-08-16T14:44:16.701859Z","submitted_at":"2024-12-11T16:59:31Z","title":"MaestroMotif: Skill Design from Artificial Intelligence Feedback","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-11T17:50:06.375187Z"},"links":{"citing_paper":"/paper/2412.08542"},"observation_digest":"sha256:464a6c950fa82db2c088e72b9c6568bf65e900c0813d41453812516e6608c32f","observation_id":"7ab2bc44-2ad8-4b6d-9475-c8d6bcf5bf6c","resolution":{"observed_at":"2026-08-11T17:50:07.091341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:50:07.072469Z","title":"Embodied lifelong learning for task and motion planning","venue":null,"work_id":"aa5ce142-e890-4826-bcfe-b7c2e5a47b32","year":2023},"citing_paper":{"arxiv_id":"2412.08542","last_updated":"2024-12-11T16:59:31Z","snapshot_observed_at":"2026-08-16T14:44:16.701859Z","submitted_at":"2024-12-11T16:59:31Z","title":"MaestroMotif: Skill Design from Artificial Intelligence Feedback","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-11T17:50:06.378876Z"},"links":{"citing_paper":"/paper/2412.08542"},"observation_digest":"sha256:f821e5415c091528dd9b791421871ec6fcbc67dc0048e4824fedab7c64d7b7b5","observation_id":"1e7fcc68-6323-4854-9c59-08bac42ce7e0","resolution":{"observed_at":"2026-08-11T17:50:07.076869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:50:07.060301Z","title":"nle-sample-factory-baseline, 2022","venue":null,"work_id":"c0451f02-d855-4da2-ae98-66db2976149e","year":2022},"citing_paper":{"arxiv_id":"2412.08542","last_updated":"2024-12-11T16:59:31Z","snapshot_observed_at":"2026-08-16T14:44:16.701859Z","submitted_at":"2024-12-11T16:59:31Z","title":"MaestroMotif: Skill Design from Artificial Intelligence Feedback","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-11T17:50:06.383274Z"},"links":{"citing_paper":"/paper/2412.08542"},"observation_digest":"sha256:d4dfa9eb7a51794a5548b1a22ae9785de1c1418fcf09ae2543af6d166fc68420","observation_id":"6d52731a-f09e-4e5c-8c26-cb6ca188c23d","resolution":{"observed_at":"2026-08-11T17:50:07.064439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:50:07.046112Z","title":"Nethack: an illustrated guide to the mazes of menace, dec 2022","venue":null,"work_id":"1a922638-16c9-4a5f-bb5d-f337b4f5f232","year":2022},"citing_paper":{"arxiv_id":"2412.08542","last_updated":"2024-12-11T16:59:31Z","snapshot_observed_at":"2026-08-16T14:44:16.701859Z","submitted_at":"2024-12-11T16:59:31Z","title":"MaestroMotif: Skill Design from Artificial Intelligence Feedback","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-11T17:50:06.387934Z"},"links":{"citing_paper":"/paper/2412.08542"},"observation_digest":"sha256:6b01aa3b2dcfdec43dc67dc720163548d461ae5d6e850f5df29fe2786bc9bde9","observation_id":"7aa0d318-7163-4f1f-96aa-de87c7503870","resolution":{"observed_at":"2026-08-11T17:50:07.051581Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:50:07.031748Z","title":"Courville","venue":null,"work_id":"a4a926a5-103d-43d1-9867-01abd76b168f","year":2017},"citing_paper":{"arxiv_id":"2412.08542","last_updated":"2024-12-11T16:59:31Z","snapshot_observed_at":"2026-08-16T14:44:16.701859Z","submitted_at":"2024-12-11T16:59:31Z","title":"MaestroMotif: Skill Design from Artificial Intelligence Feedback","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-11T17:50:06.392445Z"},"links":{"citing_paper":"/paper/2412.08542"},"observation_digest":"sha256:a3651305ca5140c63c100cdb73264c1392c7fe1b1491af4f715f97ee3f2c56b6","observation_id":"7f4b56c5-a0ac-4ffe-96d6-d64cfe14125e","resolution":{"observed_at":"2026-08-11T17:50:07.036570Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:50:06.397227Z","title":"Sukhatme, and Vladlen Koltun","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.08542","last_updated":"2024-12-11T16:59:31Z","snapshot_observed_at":"2026-08-16T14:44:16.701859Z","submitted_at":"2024-12-11T16:59:31Z","title":"MaestroMotif: Skill Design from Artificial Intelligence Feedback","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-11T17:50:06.397227Z"},"links":{"citing_paper":"/paper/2412.08542"},"observation_digest":"sha256:39519350f351acf7b406ba6182cae9abaa78c7425d50d945ac4ff18a9e3ed196","observation_id":"d0726826-1054-4226-bbb3-f5782a1bfe97","resolution":{"observed_at":"2026-08-11T17:50:06.397227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:50:07.008888Z","title":"diff history for neural language agents, 2023 a","venue":null,"work_id":"fcdf2a52-7922-4585-94bf-c3c58fd8e686","year":2023},"citing_paper":{"arxiv_id":"2412.08542","last_updated":"2024-12-11T16:59:31Z","snapshot_observed_at":"2026-08-16T14:44:16.701859Z","submitted_at":"2024-12-11T16:59:31Z","title":"MaestroMotif: Skill Design from Artificial Intelligence Feedback","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-11T17:50:06.401323Z"},"links":{"citing_paper":"/paper/2412.08542"},"observation_digest":"sha256:52d85da7d2a48b0a2b6806dd30a259dfe43a6daee76c50fc16cead4b1dfc660d","observation_id":"290c1b5b-f223-4a35-9d6d-07323d1b1f60","resolution":{"observed_at":"2026-08-11T17:50:07.013920Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:50:06.994972Z","title":"Nethack is hard to hack, 2023 b","venue":null,"work_id":"d7a766b0-58d3-4fb3-a25d-4c1ba58eb36a","year":2023},"citing_paper":{"arxiv_id":"2412.08542","last_updated":"2024-12-11T16:59:31Z","snapshot_observed_at":"2026-08-16T14:44:16.701859Z","submitted_at":"2024-12-11T16:59:31Z","title":"MaestroMotif: Skill Design from Artificial Intelligence Feedback","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-11T17:50:06.405725Z"},"links":{"citing_paper":"/paper/2412.08542"},"observation_digest":"sha256:adce76084638487aa7f42221831f9b262046030a5e490daf95db455c312f3c97","observation_id":"d8b61072-7d39-4baa-8e71-0860a909afed","resolution":{"observed_at":"2026-08-11T17:50:06.999286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:50:06.981722Z","title":"Temporal Abstraction in Reinforcement Learning","venue":null,"work_id":"ffe045e4-e1b0-4fa7-a5a0-75f96007f080","year":2000},"citing_paper":{"arxiv_id":"2412.08542","last_updated":"2024-12-11T16:59:31Z","snapshot_observed_at":"2026-08-16T14:44:16.701859Z","submitted_at":"2024-12-11T16:59:31Z","title":"MaestroMotif: Skill Design from Artificial Intelligence Feedback","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-11T17:50:06.409903Z"},"links":{"citing_paper":"/paper/2412.08542"},"observation_digest":"sha256:669f342ce1337a4afc843d0e4167ec84f52d599d2aab711c4779d9a03777fd7b","observation_id":"2aa3c6f0-8ea0-4125-bf91-4afd1a9dd0f6","resolution":{"observed_at":"2026-08-11T17:50:06.986082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-11T17:50:06.414644Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.08542","last_updated":"2024-12-11T16:59:31Z","snapshot_observed_at":"2026-08-16T14:44:16.701859Z","submitted_at":"2024-12-11T16:59:31Z","title":"MaestroMotif: Skill Design from Artificial Intelligence Feedback","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-11T17:50:06.414644Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2412.08542"},"observation_digest":"sha256:89d95049c9853b9725d09828d1bb343a5470ff93f2807b9002943ec529cf2ec7","observation_id":"b2b4dd38-44df-41b9-bbc3-70f94f6d17e8","resolution":{"observed_at":"2026-08-11T17:50:06.414644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:50:06.969147Z","title":"Reflexion: language agents with verbal reinforcement learning","venue":null,"work_id":"62f5226f-9d95-49b1-b4c1-c01740ba9484","year":2023},"citing_paper":{"arxiv_id":"2412.08542","last_updated":"2024-12-11T16:59:31Z","snapshot_observed_at":"2026-08-16T14:44:16.701859Z","submitted_at":"2024-12-11T16:59:31Z","title":"MaestroMotif: Skill Design from Artificial Intelligence Feedback","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-11T17:50:06.419067Z"},"links":{"citing_paper":"/paper/2412.08542"},"observation_digest":"sha256:9df62498f77098cc427a0becd006a562d5c594acb1f5ab2c12f0be77032aa829","observation_id":"62fe808b-6720-489a-b511-6c819663d1d6","resolution":{"observed_at":"2026-08-11T17:50:06.973678Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:50:06.957807Z","title":"Tenenbaum, Leslie Pack Kaelbling, and Michael Katz","venue":null,"work_id":"42f7f962-9ad1-4016-a608-6a1b9b6abead","year":2023},"citing_paper":{"arxiv_id":"2412.08542","last_updated":"2024-12-11T16:59:31Z","snapshot_observed_at":"2026-08-16T14:44:16.701859Z","submitted_at":"2024-12-11T16:59:31Z","title":"MaestroMotif: Skill Design from Artificial Intelligence Feedback","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-11T17:50:06.423946Z"},"links":{"citing_paper":"/paper/2412.08542"},"observation_digest":"sha256:8094409d63887bd24557e7d59840b2fbbf6b72aadf34f54116d58be236e99598","observation_id":"2e33b19f-8649-43dd-97ad-46cdcfbe71fd","resolution":{"observed_at":"2026-08-11T17:50:06.961693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:50:06.946600Z","title":"Learning options in reinforcement learning","venue":null,"work_id":"469a8601-fa6f-4c45-9793-7e2b93b0e443","year":2002},"citing_paper":{"arxiv_id":"2412.08542","last_updated":"2024-12-11T16:59:31Z","snapshot_observed_at":"2026-08-16T14:44:16.701859Z","submitted_at":"2024-12-11T16:59:31Z","title":"MaestroMotif: Skill Design from Artificial Intelligence Feedback","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-11T17:50:06.428479Z"},"links":{"citing_paper":"/paper/2412.08542"},"observation_digest":"sha256:108bf0afc8d7f624ace626a0299c87644f79217d4ae64fe85589e1acbeebd21c","observation_id":"821e2848-6d8b-4513-a18c-dbf647b41f48","resolution":{"observed_at":"2026-08-11T17:50:06.950439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:50:06.932902Z","title":null,"venue":null,"work_id":"0b38c99d-5917-4bbc-abb9-680d038a7c51","year":2020},"citing_paper":{"arxiv_id":"2412.08542","last_updated":"2024-12-11T16:59:31Z","snapshot_observed_at":"2026-08-16T14:44:16.701859Z","submitted_at":"2024-12-11T16:59:31Z","title":"MaestroMotif: Skill Design from Artificial Intelligence Feedback","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-11T17:50:06.433101Z"},"links":{"citing_paper":"/paper/2412.08542"},"observation_digest":"sha256:99d250d439e492f4e0b48e88ef1afb164149d3f18afc911dfc6fa8df55972754","observation_id":"20731ef9-84cd-4a4f-94c1-294cc7b334f6","resolution":{"observed_at":"2026-08-11T17:50:06.936818Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:50:06.921582Z","title":"Sutton, Doina Precup, and Satinder Singh","venue":null,"work_id":"aff91613-b600-4504-852a-8e4f4db96119","year":1999},"citing_paper":{"arxiv_id":"2412.08542","last_updated":"2024-12-11T16:59:31Z","snapshot_observed_at":"2026-08-16T14:44:16.701859Z","submitted_at":"2024-12-11T16:59:31Z","title":"MaestroMotif: Skill Design from Artificial Intelligence Feedback","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-11T17:50:06.437170Z"},"links":{"citing_paper":"/paper/2412.08542"},"observation_digest":"sha256:6744b19a7e7e170c715166f18ba18f1f203a938df8f4c4eea23374570cdf1bc0","observation_id":"4ec9dc09-481a-45bd-b0bc-791c239cbf39","resolution":{"observed_at":"2026-08-11T17:50:06.925459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:50:06.908646Z","title":"Autoascend -- 1st place nethack agent for the nethack challenge at neurips 2021","venue":null,"work_id":"9359d2d9-50aa-4a7a-a5f0-cbd112379b3b","year":2021},"citing_paper":{"arxiv_id":"2412.08542","last_updated":"2024-12-11T16:59:31Z","snapshot_observed_at":"2026-08-16T14:44:16.701859Z","submitted_at":"2024-12-11T16:59:31Z","title":"MaestroMotif: Skill Design from Artificial Intelligence Feedback","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-11T17:50:06.442037Z"},"links":{"citing_paper":"/paper/2412.08542"},"observation_digest":"sha256:e3b284cab6ab09d3ffb8568df2a021cc8b740f46816b54e40cfc8938193e894d","observation_id":"b391c326-2e30-4cf5-b5fd-ba74910b3128","resolution":{"observed_at":"2026-08-11T17:50:06.913623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:50:06.896321Z","title":"Reinforcement learning with human teachers: Evidence of feedback and guidance with implications for learning performance","venue":null,"work_id":"7215e7cd-e8b2-4483-84d4-30d2bf49d691","year":2006},"citing_paper":{"arxiv_id":"2412.08542","last_updated":"2024-12-11T16:59:31Z","snapshot_observed_at":"2026-08-16T14:44:16.701859Z","submitted_at":"2024-12-11T16:59:31Z","title":"MaestroMotif: Skill Design from Artificial Intelligence Feedback","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-11T17:50:06.446680Z"},"links":{"citing_paper":"/paper/2412.08542"},"observation_digest":"sha256:b8653a12db839a3105196a4f914045d22cd786d5ec862fdb5e2abcea0612bfe1","observation_id":"a3faedc5-bc65-45eb-8ffb-1fe2904d2a42","resolution":{"observed_at":"2026-08-11T17:50:06.900456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:50:06.884755Z","title":"Does zero-shot reinforcement learning exist? In The Eleventh International Conference on Learning Representations, 2023","venue":null,"work_id":"3d83e04c-4a23-42e1-8583-f5d7d030e831","year":2023},"citing_paper":{"arxiv_id":"2412.08542","last_updated":"2024-12-11T16:59:31Z","snapshot_observed_at":"2026-08-16T14:44:16.701859Z","submitted_at":"2024-12-11T16:59:31Z","title":"MaestroMotif: Skill Design from Artificial Intelligence Feedback","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-11T17:50:06.450860Z"},"links":{"citing_paper":"/paper/2412.08542"},"observation_digest":"sha256:8c51cc20aa4ee25da6783363147c0ff9499b64fe93791e9ef776d4fc60946b29","observation_id":"9ca69d07-8aa2-4091-8106-a53243740010","resolution":{"observed_at":"2026-08-11T17:50:06.888832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:50:06.873009Z","title":"Python tutorial, volume 620","venue":null,"work_id":"88ffb8a5-5380-4ba0-b995-248a3ae5579c","year":1995},"citing_paper":{"arxiv_id":"2412.08542","last_updated":"2024-12-11T16:59:31Z","snapshot_observed_at":"2026-08-16T14:44:16.701859Z","submitted_at":"2024-12-11T16:59:31Z","title":"MaestroMotif: Skill Design from Artificial Intelligence Feedback","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-11T17:50:06.455099Z"},"links":{"citing_paper":"/paper/2412.08542"},"observation_digest":"sha256:fe8aad1921f1fdb946da084356653aed2dcd944e91b6a026e953b1ea7ebd3e54","observation_id":"ac99ff11-84ca-489e-9fa4-8d1beaff95d8","resolution":{"observed_at":"2026-08-11T17:50:06.877013Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:50:06.860955Z","title":"Feudal networks for hierarchical reinforcement learning","venue":null,"work_id":"3e4e4db2-6627-4df8-9d28-0af70c6e4913","year":2017},"citing_paper":{"arxiv_id":"2412.08542","last_updated":"2024-12-11T16:59:31Z","snapshot_observed_at":"2026-08-16T14:44:16.701859Z","submitted_at":"2024-12-11T16:59:31Z","title":"MaestroMotif: Skill Design from Artificial Intelligence Feedback","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-11T17:50:06.459789Z"},"links":{"citing_paper":"/paper/2412.08542"},"observation_digest":"sha256:54fdb8d392c55de540bff8b7bbeb441af452c4f72279e99963b5c8ffbbcfaa0a","observation_id":"4389f62e-b837-4b8f-a3b7-09800ce198c9","resolution":{"observed_at":"2026-08-11T17:50:06.864933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:50:06.848734Z","title":"Voyager: An open-ended embodied agent with large language models","venue":null,"work_id":"e8a5f2f1-6bdf-46e9-a9fd-375e3f30ca28","year":2024},"citing_paper":{"arxiv_id":"2412.08542","last_updated":"2024-12-11T16:59:31Z","snapshot_observed_at":"2026-08-16T14:44:16.701859Z","submitted_at":"2024-12-11T16:59:31Z","title":"MaestroMotif: Skill Design from Artificial Intelligence Feedback","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-11T17:50:06.463901Z"},"links":{"citing_paper":"/paper/2412.08542"},"observation_digest":"sha256:2dc44c404d15e9976e41742bd4537b0e3512c017b903514dbc931d5c4f47e305","observation_id":"0785c02a-8e1d-46f2-9cd7-6990b9d3d309","resolution":{"observed_at":"2026-08-11T17:50:06.853347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:50:06.467363Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.08542","last_updated":"2024-12-11T16:59:31Z","snapshot_observed_at":"2026-08-16T14:44:16.701859Z","submitted_at":"2024-12-11T16:59:31Z","title":"MaestroMotif: Skill Design from Artificial Intelligence Feedback","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-11T17:50:06.467363Z"},"links":{"citing_paper":"/paper/2412.08542"},"observation_digest":"sha256:520623cb329016fdc9963dcbe3525e69266e0be3203405b92f23c2ff27e52eb3","observation_id":"0a074345-0ba5-40c0-a3ba-e6ab1fcd5cc5","resolution":{"observed_at":"2026-08-11T17:50:06.467363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02868","last_updated":"2024-07-17T09:29:19Z","snapshot_observed_at":"2026-08-16T14:21:30.569362Z","submitted_at":"2024-02-05T10:30:47Z","title":"Fine-tuning Reinforcement Learning Models is Secretly a Forgetting Mitigation Problem","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02868","snapshot_observed_at":"2026-08-11T17:50:06.470977Z","title":"Fine-tuning reinforcement learning models is secretly a forgetting mitigation problem","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08542","last_updated":"2024-12-11T16:59:31Z","snapshot_observed_at":"2026-08-16T14:44:16.701859Z","submitted_at":"2024-12-11T16:59:31Z","title":"MaestroMotif: Skill Design from Artificial Intelligence Feedback","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-11T17:50:06.470977Z"},"links":{"cited_paper":"/paper/2402.02868","citing_paper":"/paper/2412.08542"},"observation_digest":"sha256:e09926effc755675000b17473b5627d2446672ff14bebfabbd0aa79b150190c6","observation_id":"e09f9c08-f7f2-49ef-8014-a744ecfef580","resolution":{"observed_at":"2026-08-11T17:50:06.470977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03629","last_updated":"2023-03-10T01:00:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-10-06T01:00:32Z","title":"ReAct: Synergizing Reasoning and Acting in Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03629","snapshot_observed_at":"2026-08-11T17:50:06.475121Z","title":"React: Synergizing reasoning and acting in language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.08542","last_updated":"2024-12-11T16:59:31Z","snapshot_observed_at":"2026-08-16T14:44:16.701859Z","submitted_at":"2024-12-11T16:59:31Z","title":"MaestroMotif: Skill Design from Artificial Intelligence Feedback","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-11T17:50:06.475121Z"},"links":{"cited_paper":"/paper/2210.03629","citing_paper":"/paper/2412.08542"},"observation_digest":"sha256:954a0c2e365215565398557ea7ba093e96beb49589c5e20c7dad9c7caf1e404a","observation_id":"15162f35-fc65-4bc2-9b97-ed6e66e2a274","resolution":{"observed_at":"2026-08-11T17:50:06.475121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:50:06.827751Z","title":"Noveld: A simple yet effective exploration criterion","venue":null,"work_id":"c3759a52-501c-4067-ae24-a29f0fcc8ac5","year":2021},"citing_paper":{"arxiv_id":"2412.08542","last_updated":"2024-12-11T16:59:31Z","snapshot_observed_at":"2026-08-16T14:44:16.701859Z","submitted_at":"2024-12-11T16:59:31Z","title":"MaestroMotif: Skill Design from Artificial Intelligence Feedback","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-11T17:50:06.479218Z"},"links":{"citing_paper":"/paper/2412.08542"},"observation_digest":"sha256:5faeee4855662e2025a9d6c023351ed7c6818806d983bcc05473f6098b7558a5","observation_id":"4c8cd7bd-24a2-44a5-be15-edc10e0377d3","resolution":{"observed_at":"2026-08-11T17:50:06.833613Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:50:06.482822Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08542","last_updated":"2024-12-11T16:59:31Z","snapshot_observed_at":"2026-08-16T14:44:16.701859Z","submitted_at":"2024-12-11T16:59:31Z","title":"MaestroMotif: Skill Design from Artificial Intelligence Feedback","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-11T17:50:06.482822Z"},"links":{"citing_paper":"/paper/2412.08542"},"observation_digest":"sha256:9605b0993b8b3792c1243651d7e3d4ce9cd7f1e1ecaab3d697b7845a03fbb934","observation_id":"5e230a5c-e34d-4a87-be1a-5a88680b59fd","resolution":{"observed_at":"2026-08-11T17:50:06.482822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:50:06.487128Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08542","last_updated":"2024-12-11T16:59:31Z","snapshot_observed_at":"2026-08-16T14:44:16.701859Z","submitted_at":"2024-12-11T16:59:31Z","title":"MaestroMotif: Skill Design from Artificial Intelligence Feedback","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-11T17:50:06.487128Z"},"links":{"citing_paper":"/paper/2412.08542"},"observation_digest":"sha256:d8993768ae31284e36b361d318c1f601d7b5db1ee95bd463db551f57ac807876","observation_id":"5720ff46-3fcf-4189-9450-16e4606d7d07","resolution":{"observed_at":"2026-08-11T17:50:06.487128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:50:06.492214Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08542","last_updated":"2024-12-11T16:59:31Z","snapshot_observed_at":"2026-08-16T14:44:16.701859Z","submitted_at":"2024-12-11T16:59:31Z","title":"MaestroMotif: Skill Design from Artificial Intelligence Feedback","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-11T17:50:06.492214Z"},"links":{"citing_paper":"/paper/2412.08542"},"observation_digest":"sha256:733e260025053da67efda1a20a837be086531bad0582908e47527beae6ea4908","observation_id":"fc778430-d7a7-4baa-a838-0dc3ce3fd0d8","resolution":{"observed_at":"2026-08-11T17:50:06.492214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:50:06.496418Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08542","last_updated":"2024-12-11T16:59:31Z","snapshot_observed_at":"2026-08-16T14:44:16.701859Z","submitted_at":"2024-12-11T16:59:31Z","title":"MaestroMotif: Skill Design from Artificial Intelligence Feedback","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-11T17:50:06.496418Z"},"links":{"citing_paper":"/paper/2412.08542"},"observation_digest":"sha256:db618eca962fdeb8972e37cbfc28520315da4d75c740f744dbce04546ea60f3e","observation_id":"5f034dd9-0daf-408a-8d16-9a277611284a","resolution":{"observed_at":"2026-08-11T17:50:06.496418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.08542","last_updated":"2024-12-11T16:59:31Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-16T14:44:16.701859Z","submitted_at":"2024-12-11T16:59:31Z","title":"MaestroMotif: Skill Design from Artificial Intelligence Feedback"},"reference_resolution":{"displayed":69,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":0,"verified_fuzzy":38},"total_outbound_references":69},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 69 of 69 outbound references and 5 inbound Pith citation observations for arXiv:2412.08542."}