{"as_of":"2026-08-12T15:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4950908014579165f42ab4184091d722d843d590e62d72a1e3fb71dc6d4b632d","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:15:48.064835Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.09041/citation-record","integrity":"/paper/2507.09041/integrity","json":"/paper/2507.09041/citation-record.json","paper":"/paper/2507.09041"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2010.13611","last_updated":"2021-05-04T19:20:46Z","snapshot_observed_at":"2026-08-06T03:14:46.253254Z","submitted_at":"2020-10-26T14:31:08Z","title":"OPAL: Offline Primitive Discovery for Accelerating Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.13611","snapshot_observed_at":"2026-08-06T18:15:42.139432Z","title":"Opal: Offline primitive discovery for acceler- ating offline reinforcement learning","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-09T05:31:23.348356Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:42.139432Z"},"links":{"cited_paper":"/paper/2010.13611","citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:2a9ef34b4b81eb796b2b5f062dd41b242d22b0c6c84b64bca91ae839a369fbb6","observation_id":"ff9dbc7f-779e-41fd-89b2-78b7f97a0a6c","resolution":{"observed_at":"2026-08-06T18:15:42.139432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:15:48.821183Z","title":"pick up the cloth","venue":null,"work_id":"50f9f50f-8dfe-4a12-8d41-1b40869fcc4b","year":null},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-09T05:31:23.348356Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:48.064835Z"},"links":{"citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:03cae1b9504f977985a868f2d6eddebe779802eb794e7ee07e35fc9ee22ef9e6","observation_id":"bfb40ee5-e43c-4cbc-b38f-6a6faa1a6810","resolution":{"observed_at":"2026-08-06T18:15:48.824409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:15:48.847227Z","title":"(2024) for goal locations","venue":null,"work_id":"5c788091-bffd-40bb-b570-a9a3eafbc5da","year":2024},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-09T05:31:23.348356Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:47.872987Z"},"links":{"citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:ad135567326db7a6b26454cb4f0fe74200848fcac2abd030a3f42fe676c26002","observation_id":"a33d863a-8050-4f76-8902-4a36bb23ce44","resolution":{"observed_at":"2026-08-06T18:15:48.849914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-06T18:15:42.647136Z","title":"π0: A vision-language-action flow model for general robot control","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-09T05:31:23.348356Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:42.647136Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:b91b5a2bc4303e7687da07b692c9587075a78c8ce7aef09f313bfab821e5cc19","observation_id":"66839269-e730-4751-a862-0c5b0834200c","resolution":{"observed_at":"2026-08-06T18:15:42.647136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-08-06T18:15:42.830579Z","title":"Rt-1: Robotics transformer for real-world control at scale","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-09T05:31:23.348356Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:42.830579Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:115b68a59fc446b97da248a3642730d1ea5f07f935ec531d85fb9449ef54ae14","observation_id":"73b157a3-f552-4a24-9015-be6a70485ba0","resolution":{"observed_at":"2026-08-06T18:15:42.830579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.12894","last_updated":"2018-10-30T17:44:42Z","snapshot_observed_at":"2026-08-12T12:07:37.369391Z","submitted_at":"2018-10-30T17:44:42Z","title":"Exploration by Random Network Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.12894","snapshot_observed_at":"2026-08-06T18:15:42.984443Z","title":"Ex- ploration by random network distillation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-09T05:31:23.348356Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:42.984443Z"},"links":{"cited_paper":"/paper/1810.12894","citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:071e73a4bf4cb6ff93d730ce4a6ee903bc4d1e3eb612f3a70dbd3f05f87bdaa2","observation_id":"f3370e52-5772-4fed-a042-fde90e6d9f98","resolution":{"observed_at":"2026-08-06T18:15:42.984443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.01483","last_updated":"2019-03-04T18:55:24Z","snapshot_observed_at":"2026-08-02T11:19:07.941053Z","submitted_at":"2018-11-05T02:12:11Z","title":"Contingency-Aware Exploration in Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.01483","snapshot_observed_at":"2026-08-06T18:15:43.135671Z","title":"Contingency-aware exploration in re- inforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-09T05:31:23.348356Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:43.135671Z"},"links":{"cited_paper":"/paper/1811.01483","citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:3749f8930d50e9aad478ba3cc8d7c90447fcd38e9a28b3b761489e1621daca17","observation_id":"02260926-b3ea-45e5-bdf7-eac5ac645540","resolution":{"observed_at":"2026-08-06T18:15:43.135671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1611.02779","last_updated":"2016-11-10T01:17:36Z","snapshot_observed_at":"2026-08-02T07:58:55.035919Z","submitted_at":"2016-11-09T00:13:29Z","title":"RL$^2$: Fast Reinforcement Learning via Slow Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.02779","snapshot_observed_at":"2026-08-06T18:15:43.645441Z","title":"L., Sutskever, I., and Abbeel, P","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-09T05:31:23.348356Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:43.645441Z"},"links":{"cited_paper":"/paper/1611.02779","citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:6b7507b55a0562cca5f5c8e6d7bc2dab54a7863aa92301b19cfb4fbcaf904b24","observation_id":"62fa7601-e0de-4b5f-a996-8178d3dc2b6b","resolution":{"observed_at":"2026-08-06T18:15:43.645441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15007","last_updated":"2024-11-30T18:07:50Z","snapshot_observed_at":"2026-08-11T10:07:43.981072Z","submitted_at":"2024-07-20T23:31:56Z","title":"Is Behavior Cloning All You Need? Understanding Horizon in Imitation Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15007","snapshot_observed_at":"2026-08-06T18:15:44.040995Z","title":"J., Block, A., and Misra, D","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-09T05:31:23.348356Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:44.040995Z"},"links":{"cited_paper":"/paper/2407.15007","citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:5033237472567dd18680d66fed48aef4a5fd5f105f89d25779a0b459b9c8b080","observation_id":"b3281106-560a-4910-a84f-1bbf866c41c7","resolution":{"observed_at":"2026-08-06T18:15:44.040995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-06T18:15:44.147549Z","title":"D4rl: Datasets for deep data-driven reinforcement learning","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-09T05:31:23.348356Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:44.147549Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:f8d10984af93f8549b41ed749cdf92ebcc39451c8ba1debdcc0c9106992c3ac6","observation_id":"81de7d67-d06f-4447-99fe-9da5621dec8e","resolution":{"observed_at":"2026-08-06T18:15:44.147549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15980","last_updated":"2024-09-27T20:10:08Z","snapshot_observed_at":"2026-07-06T19:07:16.252072Z","submitted_at":"2024-08-28T17:50:19Z","title":"In-Context Imitation Learning via Next-Token Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15980","snapshot_observed_at":"2026-08-06T18:15:44.255368Z","title":"Y ., Panitch, W","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-09T05:31:23.348356Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:44.255368Z"},"links":{"cited_paper":"/paper/2408.15980","citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:d32f7292c88bb4547af5a20eede066958e5c39dea228a33c52773d94ca7bf631","observation_id":"3a451d3c-9a7d-4613-a9f6-73a530d445ea","resolution":{"observed_at":"2026-08-06T18:15:44.255368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.10364","last_updated":"2022-02-04T14:03:07Z","snapshot_observed_at":"2026-08-10T08:48:20.737468Z","submitted_at":"2021-11-19T18:56:13Z","title":"Generalized Decision Transformer for Offline Hindsight Information Matching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.10364","snapshot_observed_at":"2026-08-06T18:15:44.367192Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-09T05:31:23.348356Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:44.367192Z"},"links":{"cited_paper":"/paper/2111.10364","citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:f106703e695459971de5fbd20aa3fd60613969092a7c2c46ae24c4feb51c8eb4","observation_id":"6ecdf627-5f25-49ee-a91b-dc225feb31c8","resolution":{"observed_at":"2026-08-06T18:15:44.367192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06088","last_updated":"2020-10-02T19:49:10Z","snapshot_observed_at":"2026-08-11T00:34:37.369946Z","submitted_at":"2019-12-12T17:26:47Z","title":"Learning to Reach Goals via Iterated Supervised Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06088","snapshot_observed_at":"2026-08-06T18:15:44.449930Z","title":"Learning to reach goals via iterated supervised learning","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-09T05:31:23.348356Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:44.449930Z"},"links":{"cited_paper":"/paper/1912.06088","citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:ed161a92015a543c7f7fcc241a3dc034103c26c0c0efe7e36efd4560af8d2c1c","observation_id":"5cf61d41-82c4-49f2-a1c1-391bcedd557c","resolution":{"observed_at":"2026-08-06T18:15:44.449930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01977","last_updated":"2023-11-06T05:53:08Z","snapshot_observed_at":"2026-08-11T03:40:37.164575Z","submitted_at":"2023-11-03T15:31:51Z","title":"RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01977","snapshot_observed_at":"2026-08-06T18:15:44.565027Z","title":"G., Rao, K., Yu, W., Fu, C., Gopalakrishnan, K., Xu, Z., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-09T05:31:23.348356Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:44.565027Z"},"links":{"cited_paper":"/paper/2311.01977","citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:a33b26febef228229093fa5f9250a1151e64942118752e3307ab16060272a55c","observation_id":"e5aa5d05-03f7-44da-8450-2a974ed1891d","resolution":{"observed_at":"2026-08-06T18:15:44.565027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20692","last_updated":"2024-05-31T08:38:25Z","snapshot_observed_at":"2026-07-06T18:23:10.807498Z","submitted_at":"2024-05-31T08:38:25Z","title":"In-Context Decision Transformer: Reinforcement Learning via Hierarchical Chain-of-Thought","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20692","snapshot_observed_at":"2026-08-06T18:15:44.651513Z","title":"In-context decision transformer: Reinforcement learn- ing via hierarchical chain-of-thought","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-09T05:31:23.348356Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:44.651513Z"},"links":{"cited_paper":"/paper/2405.20692","citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:97d25dc33fcc5f91bb930fa2e63217e8bf2ef43133ba22fcc598b8b370e214c9","observation_id":"146d1b07-f47b-41ed-b931-18e4a43e4af0","resolution":{"observed_at":"2026-08-06T18:15:44.651513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.02934","last_updated":"2020-05-06T16:14:48Z","snapshot_observed_at":"2026-07-06T09:18:09.794978Z","submitted_at":"2020-05-06T16:14:48Z","title":"Learning Adaptive Exploration Strategies in Dynamic Environments Through Informed Policy Regularization","version":1},"cited_work":{"arxiv_id":"2005.02934","doi":null,"metadata_source":"pith","pith_arxiv_id":"2005.02934","snapshot_observed_at":"2026-08-06T18:15:48.642557Z","title":"Learning Adaptive Exploration Strategies in Dynamic Environments Through Informed Policy Regularization","venue":"cs.LG","work_id":"b1d25184-6446-47a1-9569-47b7d382bbac","year":2020},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-09T05:31:23.348356Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:44.741297Z"},"links":{"cited_paper":"/paper/2005.02934","citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:5eb75997365c228e1e97514e1ec97b96be1cbf5efd440ed1ac98a90e51c641d3","observation_id":"795ba928-5177-4043-8b71-db7f03c7de79","resolution":{"observed_at":"2026-08-06T18:15:48.645862Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-06T18:15:44.853558Z","title":"J., Pertsch, K., Karamcheti, S., Xiao, T., Balakr- ishna, A., Nair, S., Rafailov, R., Foster, E., Lam, G., San- keti, P., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-09T05:31:23.348356Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:44.853558Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:1e558b3624d772bd3baa9559747f0af7ae4e4ecf23c382e3634837c58345f3c6","observation_id":"7470a545-9737-4273-805f-66e7c31b818c","resolution":{"observed_at":"2026-08-06T18:15:44.853558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.15371","last_updated":"2024-10-28T19:55:46Z","snapshot_observed_at":"2026-07-06T17:49:07.589781Z","submitted_at":"2024-03-22T17:50:43Z","title":"Can large language models explore in-context?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.15371","snapshot_observed_at":"2026-08-06T18:15:44.938881Z","title":"J., Zhang, C., and Slivkins, A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-09T05:31:23.348356Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:44.938881Z"},"links":{"cited_paper":"/paper/2403.15371","citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:53942f6e5323ed64b86cff414f8a2ff7478caa41b18c93e544bddbc7da168a02","observation_id":"097a55a6-5e4c-4383-bec7-b4b810126b6f","resolution":{"observed_at":"2026-08-06T18:15:44.938881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.13465","last_updated":"2019-12-31T18:07:43Z","snapshot_observed_at":"2026-08-11T00:34:49.919649Z","submitted_at":"2019-12-31T18:07:43Z","title":"Reward-Conditioned Policies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.13465","snapshot_observed_at":"2026-08-06T18:15:45.032209Z","title":"B., and Levine, S","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-09T05:31:23.348356Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:45.032209Z"},"links":{"cited_paper":"/paper/1912.13465","citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:0c9b4f7a587244b1d1fee7195a9a47fbb8dcdb0ca6b0cd487cbd0cdc0f619a1f","observation_id":"0e7ef5bb-d240-44de-ad57-dd99ce411702","resolution":{"observed_at":"2026-08-06T18:15:45.032209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.14215","last_updated":"2022-10-25T17:57:49Z","snapshot_observed_at":"2026-08-11T00:48:03.626777Z","submitted_at":"2022-10-25T17:57:49Z","title":"In-context Reinforcement Learning with Algorithm Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.14215","snapshot_observed_at":"2026-08-06T18:15:45.169185Z","title":"In-context reinforcement learning with algorithm distillation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-09T05:31:23.348356Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:45.169185Z"},"links":{"cited_paper":"/paper/2210.14215","citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:68e7477743c4818f92cd187ac6174261cac8ec12d080a7f7005ff52566a08009","observation_id":"afbb608b-4a04-491f-af7c-92af6364fc93","resolution":{"observed_at":"2026-08-06T18:15:45.169185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.01112","last_updated":"2021-05-06T09:06:50Z","snapshot_observed_at":"2026-08-05T12:38:48.463149Z","submitted_at":"2020-10-02T17:13:39Z","title":"FOCAL: Efficient Fully-Offline Meta-Reinforcement Learning via Distance Metric Learning and Behavior Regularization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.01112","snapshot_observed_at":"2026-08-06T18:15:45.214018Z","title":"S., Lee, L., Free- man, D., Guadarrama, S., Fischer, I., Xu, W., Jang, E., Michalewski, H., et al","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-09T05:31:23.348356Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:45.214018Z"},"links":{"cited_paper":"/paper/2010.01112","citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:ee3e65ce044b58918c339cca11d2edabfccf9bb7d10bb15562387a111f4a5a09","observation_id":"bb7ae660-7817-463a-8d44-e2a7774f8a8a","resolution":{"observed_at":"2026-08-06T18:15:45.214018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.03298","last_updated":"2021-09-25T00:37:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-08-06T20:48:30Z","title":"What Matters in Learning from Offline Human Demonstrations for Robot Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.03298","snapshot_observed_at":"2026-08-06T18:15:45.355493Z","title":"What matters in learning from offline human demonstrations for robot manipulation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-09T05:31:23.348356Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:45.355493Z"},"links":{"cited_paper":"/paper/2108.03298","citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:5d93db4ad46bc65c88e25d028aac4ce4621228bb0080bfd7d8c9f04f4a7d436a","observation_id":"60e2fd1a-701e-4aba-b631-6bbda861eacf","resolution":{"observed_at":"2026-08-06T18:15:45.355493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.03141","last_updated":"2018-02-25T04:55:20Z","snapshot_observed_at":"2026-07-06T05:50:35.749193Z","submitted_at":"2017-07-11T06:21:31Z","title":"A Simple Neural Attentive Meta-Learner","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.03141","snapshot_observed_at":"2026-08-06T18:15:45.523780Z","title":"A simple neural attentive meta-learner","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-09T05:31:23.348356Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:45.523780Z"},"links":{"cited_paper":"/paper/1707.03141","citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:91c245793a056814071bcfc0408cba04a7a85c87934fe0870542880a7a79bc3f","observation_id":"d485db85-a976-405f-82ee-fd8afe773c72","resolution":{"observed_at":"2026-08-06T18:15:45.523780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06238","last_updated":"2025-07-14T15:16:18Z","snapshot_observed_at":"2026-07-06T19:29:55.838200Z","submitted_at":"2024-10-08T17:54:03Z","title":"EVOLvE: Evaluating and Optimizing LLMs For In-Context Exploration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06238","snapshot_observed_at":"2026-08-06T18:15:45.636586Z","title":"N., Chi, E","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-09T05:31:23.348356Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:45.636586Z"},"links":{"cited_paper":"/paper/2410.06238","citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:a8ca8f922ad0891775b148c3f1e5e33814b5ed791347d71ad555a9ab8524c02f","observation_id":"372ff9fe-6ebd-42de-9587-a664a68c9133","resolution":{"observed_at":"2026-08-06T18:15:45.636586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02276","last_updated":"2024-11-04T23:33:38Z","snapshot_observed_at":"2026-07-30T23:36:30.273084Z","submitted_at":"2023-07-05T13:20:21Z","title":"First-Explore, then Exploit: Meta-Learning to Solve Hard Exploration-Exploitation Trade-Offs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.02276","snapshot_observed_at":"2026-08-06T18:15:45.786311Z","title":"and Clune, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-09T05:31:23.348356Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:45.786311Z"},"links":{"cited_paper":"/paper/2307.02276","citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:ceae54bcf2807b1977b4dfb7815e01a8fa9baa599f5e7445fcc938b909dbf0e1","observation_id":"c3267b21-5bd8-48f9-92da-3b1fa1e45fc1","resolution":{"observed_at":"2026-08-06T18:15:45.786311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15567","last_updated":"2024-05-26T17:44:52Z","snapshot_observed_at":"2026-08-07T05:14:40.258185Z","submitted_at":"2024-02-23T19:09:10Z","title":"Foundation Policies with Hilbert Representations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15567","snapshot_observed_at":"2026-08-06T18:15:45.975166Z","title":"Foundation policies with hilbert representations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-09T05:31:23.348356Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:45.975166Z"},"links":{"cited_paper":"/paper/2402.15567","citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:ca7a496725fbab6b9bc53879aa315459fa05b75ca7a9717bbb125ee1018dc9e4","observation_id":"31f13b59-f076-4a7f-a5c8-cc8841759093","resolution":{"observed_at":"2026-08-06T18:15:45.975166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:15:48.871710Z","title":"Vision-based multi-task manipulation for inexpen- sive robots using end-to-end learning from demonstration","venue":null,"work_id":"e3ddc4c5-778c-4b6e-a069-c75b78fbf265","year":2018},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-09T05:31:23.348356Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:46.166468Z"},"links":{"citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:ffc3cf4483730a519ac7c8bf03c6dcf9133d195dceb809b0cf886769963674d0","observation_id":"7d2c65f9-3f61-4edb-9214-fe45be52d940","resolution":{"observed_at":"2026-08-06T18:15:48.875551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.03801","last_updated":"2023-12-06T15:19:28Z","snapshot_observed_at":"2026-08-10T04:11:02.969633Z","submitted_at":"2023-12-06T15:19:28Z","title":"Generalization to New Sequential Decision Making Tasks with In-Context Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.03801","snapshot_observed_at":"2026-08-06T18:15:46.321234Z","title":"C., Hambro, E., Kirk, R., Henaff, M., and Raileanu, R","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-09T05:31:23.348356Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:46.321234Z"},"links":{"cited_paper":"/paper/2312.03801","citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:1e78879144d677875ce67febd6edd869a60d2f19828c959aa401c032fa7d965a","observation_id":"90ae909b-c04a-42ea-9f25-23998aeb6cb4","resolution":{"observed_at":"2026-08-06T18:15:46.321234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07071","last_updated":"2025-08-13T15:48:10Z","snapshot_observed_at":"2026-08-06T21:10:35.884042Z","submitted_at":"2024-10-09T17:15:30Z","title":"Retrieval-Augmented Decision Transformer: External Memory for In-context RL","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07071","snapshot_observed_at":"2026-08-06T18:15:46.599472Z","title":"Retrieval-augmented de- cision transformer: External memory for in-context rl","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-09T05:31:23.348356Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:46.599472Z"},"links":{"cited_paper":"/paper/2410.07071","citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:30eede2b0a7d2b57626a8be17fc349d82e1ebf575e146a828319869a85182f10","observation_id":"b162da14-636e-4fba-9f92-63a13628a46d","resolution":{"observed_at":"2026-08-06T18:15:46.599472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.10024","last_updated":"2020-11-19T18:47:40Z","snapshot_observed_at":"2026-08-10T23:47:48.049527Z","submitted_at":"2020-11-19T18:47:40Z","title":"Parrot: Data-Driven Behavioral Priors for Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.10024","snapshot_observed_at":"2026-08-06T18:15:46.657876Z","title":"Parrot: Data-driven behavioral priors for re- inforcement learning","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-09T05:31:23.348356Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:46.657876Z"},"links":{"cited_paper":"/paper/2011.10024","citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:1dde9f06103baffc2103e1283e43152276b76cbeea764d3676127f8d1ea45d78","observation_id":"0f89f866-955c-4bf4-ba38-85ca2722bb14","resolution":{"observed_at":"2026-08-06T18:15:46.657876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.02877","last_updated":"2021-09-03T22:15:10Z","snapshot_observed_at":"2026-08-07T04:02:10.973662Z","submitted_at":"2019-12-05T21:13:36Z","title":"Training Agents using Upside-Down Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.02877","snapshot_observed_at":"2026-08-06T18:15:46.817188Z","title":"K., Shyam, P., Mutz, F., Ja´skowski, W., and Schmidhuber, J","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-09T05:31:23.348356Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:46.817188Z"},"links":{"cited_paper":"/paper/1912.02877","citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:98e4e801adfe43130cc4d910273614aa387a684b06ed123b89ff39549919f3f9","observation_id":"325a3a7e-8201-4ff1-971f-797eabf7a0e8","resolution":{"observed_at":"2026-08-06T18:15:46.817188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1507.00814","last_updated":"2015-11-19T22:40:30Z","snapshot_observed_at":"2026-08-01T13:17:26.224723Z","submitted_at":"2015-07-03T04:11:15Z","title":"Incentivizing Exploration In Reinforcement Learning With Deep Predictive Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1507.00814","snapshot_observed_at":"2026-08-06T18:15:46.931088Z","title":"C., Levine, S., and Abbeel, P","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-09T05:31:23.348356Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:46.931088Z"},"links":{"cited_paper":"/paper/1507.00814","citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:b6016491ffa73dc3e032165b8f1c9ec43e37f1b4ebdabd7691d09e09dcaac8d5","observation_id":"9059c91a-0a62-442c-b61d-efe17c856aa9","resolution":{"observed_at":"2026-08-06T18:15:46.931088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12213","last_updated":"2024-05-26T19:55:26Z","snapshot_observed_at":"2026-07-06T18:16:51.116432Z","submitted_at":"2024-05-20T17:57:01Z","title":"Octo: An Open-Source Generalist Robot Policy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12213","snapshot_observed_at":"2026-08-06T18:15:47.007830Z","title":"M., Ghosh, D., Walke, H., Pertsch, K., Black, K., Mees, O., Dasari, S., Hejna, J., Kreiman, T., Xu, C., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-09T05:31:23.348356Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:47.007830Z"},"links":{"cited_paper":"/paper/2405.12213","citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:0ea0b0fd69f01d8bae331ba389cd69509db159f22a4ed6729561a0c614d95643","observation_id":"cddd209a-35af-4400-a6df-c07c7af80026","resolution":{"observed_at":"2026-08-06T18:15:47.007830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1611.05763","last_updated":"2017-01-23T12:38:24Z","snapshot_observed_at":"2026-07-06T05:19:05.390653Z","submitted_at":"2016-11-17T16:29:11Z","title":"Learning to reinforcement learn","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.05763","snapshot_observed_at":"2026-08-06T18:15:47.096413Z","title":"X., Kurth-Nelson, Z., Tirumala, D., Soyer, H., Leibo, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-09T05:31:23.348356Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:47.096413Z"},"links":{"cited_paper":"/paper/1611.05763","citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:6a5df346ec95dd61ef61addfe1b896f3a8d3c388b0aeb8e013bfae7f01d2f087","observation_id":"b03a66d1-6948-4f7c-bda9-e273d4799f61","resolution":{"observed_at":"2026-08-06T18:15:47.096413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18076","last_updated":"2025-07-11T20:30:30Z","snapshot_observed_at":"2026-07-06T19:38:35.617923Z","submitted_at":"2024-10-23T17:58:45Z","title":"Leveraging Skills from Unlabeled Prior Data for Efficient Online Exploration","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18076","snapshot_observed_at":"2026-08-06T18:15:47.138620Z","title":"Leverag- ing skills from unlabeled prior data for efficient online exploration","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-09T05:31:23.348356Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:47.138620Z"},"links":{"cited_paper":"/paper/2410.18076","citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:8ebf06a49677bb045e32337d12d16b7bba28c32cca0b2b422c6c170fe42ec3c9","observation_id":"33a8a429-6049-4687-997f-bd57fc282f9c","resolution":{"observed_at":"2026-08-06T18:15:47.138620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24108","last_updated":"2024-10-31T16:38:51Z","snapshot_observed_at":"2026-08-09T16:17:38.905893Z","submitted_at":"2024-10-31T16:38:51Z","title":"Reinforcement Learning Gradients as Vitamin for Online Finetuning Decision Transformers","version":1},"cited_work":{"arxiv_id":"2410.24108","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.24108","snapshot_observed_at":"2026-08-06T18:15:48.374816Z","title":"Reinforcement Learning Gradients as Vitamin for Online Finetuning Decision Transformers","venue":"cs.LG","work_id":"430927d8-2085-4b23-9c0d-9354059015f5","year":2024},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-09T05:31:23.348356Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:47.237851Z"},"links":{"cited_paper":"/paper/2410.24108","citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:3d73563a6bc870db77eac6be970475d76796a72b236cdc98cc35eda1fcdaed35","observation_id":"51883d58-9c0a-4517-8a96-8cde8c78d085","resolution":{"observed_at":"2026-08-06T18:15:48.433440Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00935","last_updated":"2025-08-28T20:06:01Z","snapshot_observed_at":"2026-08-09T22:12:29.385993Z","submitted_at":"2023-02-02T08:25:12Z","title":"Policy Expansion for Bridging Offline-to-Online Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00935","snapshot_observed_at":"2026-08-06T18:15:47.326956Z","title":"Policy expansion for bridging offline-to-online reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-09T05:31:23.348356Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:47.326956Z"},"links":{"cited_paper":"/paper/2302.00935","citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:1956f165a4ef0b6e2713f089367d69ed522fea47ca2c7440f1a31f5f00fd2b86","observation_id":"fb9ce7a3-292d-4538-8c65-9aa20660a83d","resolution":{"observed_at":"2026-08-06T18:15:47.326956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.08170","last_updated":"2021-11-12T03:15:55Z","snapshot_observed_at":"2026-07-06T09:29:05.834368Z","submitted_at":"2020-06-15T06:56:18Z","title":"MetaCURE: Meta Reinforcement Learning with Empowerment-Driven Exploration","version":5},"cited_work":{"arxiv_id":"2006.08170","doi":null,"metadata_source":"pith","pith_arxiv_id":"2006.08170","snapshot_observed_at":"2026-08-06T18:15:48.195790Z","title":"MetaCURE: Meta Reinforcement Learning with Empowerment-Driven Exploration","venue":"cs.AI","work_id":"bb9ae292-243c-4e81-ae29-eddffa7e2cbb","year":2020},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-09T05:31:23.348356Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:47.417541Z"},"links":{"cited_paper":"/paper/2006.08170","citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:c43c425840f0b994cd8d3c9da223e51589414c1b75337a9bb637aa21d748f813","observation_id":"37cdd30f-d2f3-4461-bc4f-23ce09c7276c","resolution":{"observed_at":"2026-08-06T18:15:48.248660Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:15:48.863650Z","title":"Deep imitation learning for complex manipulation tasks from virtual reality teleoper- ation","venue":null,"work_id":"5bdc84cb-5bfa-492d-84b6-b5188a919015","year":2018},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-09T05:31:23.348356Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:47.503432Z"},"links":{"citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:f09fc99eb07573e784f5bde77dd4c4ec4d9f85495b74979e10a622694f366ba6","observation_id":"61531bc1-3052-4de8-9495-2fb6aac61881","resolution":{"observed_at":"2026-08-06T18:15:48.866571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13705","last_updated":"2023-04-23T19:10:53Z","snapshot_observed_at":"2026-08-03T01:22:01.078078Z","submitted_at":"2023-04-23T19:10:53Z","title":"Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.13705","snapshot_observed_at":"2026-08-06T18:15:47.590155Z","title":"Z., Kumar, V ., Levine, S., and Finn, C","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-09T05:31:23.348356Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:47.590155Z"},"links":{"cited_paper":"/paper/2304.13705","citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:99aa99352368e5052b5334d19b80ecad915f4ba5a4e74ccdd6eb04e0eccfaaa3","observation_id":"c881c136-71dd-4d68-a29d-aef1647de061","resolution":{"observed_at":"2026-08-06T18:15:47.590155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.20635","last_updated":"2024-10-15T17:54:17Z","snapshot_observed_at":"2026-08-10T13:44:17.581242Z","submitted_at":"2024-07-30T08:26:44Z","title":"Autonomous Improvement of Instruction Following Skills via Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.20635","snapshot_observed_at":"2026-08-06T18:15:47.644692Z","title":"Autonomous improvement of instruction 14 Behavioral Exploration: Learning to Explore via In-Context Adaptation following skills via foundation models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-09T05:31:23.348356Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:47.644692Z"},"links":{"cited_paper":"/paper/2407.20635","citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:a66dd919d6100d9392cf69de554ef33dbe537a4f841d6d8ae1f6f769e4b754aa","observation_id":"30bce4b7-83b7-4c2e-9f98-f9490b17a353","resolution":{"observed_at":"2026-08-06T18:15:47.644692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.08348","last_updated":"2020-02-27T19:40:21Z","snapshot_observed_at":"2026-08-11T22:18:09.221124Z","submitted_at":"2019-10-18T11:44:59Z","title":"VariBAD: A Very Good Method for Bayes-Adaptive Deep RL via Meta-Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.08348","snapshot_observed_at":"2026-08-06T18:15:47.730302Z","title":"Varibad: A very good method for bayes-adaptive deep rl via meta-learning","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-09T05:31:23.348356Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:47.730302Z"},"links":{"cited_paper":"/paper/1910.08348","citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:cbbca5278ccaab1867b615633ed26c941a8e7ce06fb12f868a119cf1a735caee","observation_id":"2603762d-7459-40a6-8dc3-8993e2926b9a","resolution":{"observed_at":"2026-08-06T18:15:47.730302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:15:48.855117Z","title":"The inner induction then immediately implies the outer induction step, that we reach a terminal state at episode k in ¯C t β, so that | ¯C t+1 β | = nβ − t","venue":null,"work_id":"9c4aa1bd-5cc9-4072-b8e5-9824454fe638","year":2024},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-09T05:31:23.348356Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:47.803849Z"},"links":{"citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:ab94e1f809d2ef73fec8d0c70ae593a0519ad4005ddb4ba45783f72ae4f657af","observation_id":"b4dfb3dd-112e-4bf5-8a52-9338548a61f1","resolution":{"observed_at":"2026-08-06T18:15:48.858265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:15:48.829858Z","title":"For each task, we run with a horizon of 300 steps, and utilize the environment’s built-in success detector","venue":null,"work_id":"244e1361-d50f-4f42-949a-6946872f8199","year":2024},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-09T05:31:23.348356Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:47.983379Z"},"links":{"citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:b002b506f74ca86b6a416f093c643de3a0813e2d69663aa30ad5e98a4d2e1648","observation_id":"8279da63-2fac-4666-8a87-b6f5a0b2b396","resolution":{"observed_at":"2026-08-06T18:15:48.832832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:15:48.838890Z","title":"As stated in the text, we evaluate based on the number of goals reached (for Antmaze) or tasks completed (for Kitchen)","venue":null,"work_id":"4b565d3c-4bcc-4ba4-8e6c-bd6171ec3449","year":2024},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-09T05:31:23.348356Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":750,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:47.929647Z"},"links":{"citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:d411fce4ec9960f45389e58d5849ed9d9a52f7f7f0b0424e35a8305da359b9f3","observation_id":"0e00e78e-59f9-4e07-9a8b-919e2d910c44","resolution":{"observed_at":"2026-08-06T18:15:48.841677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:15:48.880815Z","title":"K., Yu, T., Singh, A., Phielipp, M., and Finn, C","venue":null,"work_id":"e7f12341-6b45-45c3-98d9-310d912ad7cd","year":2021},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-09T05:31:23.348356Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":2006,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:46.103102Z"},"links":{"citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:9dfd55b7b52a37925107067458b75150acbf6cc014a04c32d605d2ec0cb53dd6","observation_id":"06bbb158-007c-4972-8b65-d89688b22d1e","resolution":{"observed_at":"2026-08-06T18:15:48.883292Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.02875","last_updated":"2020-06-23T15:55:05Z","snapshot_observed_at":"2026-08-11T18:35:25.012343Z","submitted_at":"2019-12-05T21:10:08Z","title":"Reinforcement Learning Upside Down: Don't Predict Rewards -- Just Map Them to Actions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.02875","snapshot_observed_at":"2026-08-06T18:15:46.469662Z","title":"Reinforcement learning upside down: Don’t predict rewards–just map them to actions","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-09T05:31:23.348356Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":2011,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:46.469662Z"},"links":{"cited_paper":"/paper/1912.02875","citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:f60c13d528c26bb932db8f3d3306ac900a0151b913d9cfb7f0090e954c7f0595","observation_id":"159f7b58-4c8a-4f70-9822-cd365b443697","resolution":{"observed_at":"2026-08-06T18:15:46.469662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14734","last_updated":"2025-03-27T02:52:43Z","snapshot_observed_at":"2026-08-02T04:15:31.100670Z","submitted_at":"2025-03-18T21:06:21Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14734","snapshot_observed_at":"2026-08-06T18:15:42.438704Z","title":"Gr00t n1: An open foundation model for generalist humanoid robots","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-09T05:31:23.348356Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:42.438704Z"},"links":{"cited_paper":"/paper/2503.14734","citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:3d4adad3d6113118e70698c94d8d1a382159a22cdda65830eff31a036f164165","observation_id":"16687d6b-fc2d-4674-b27c-a41e40e5c70b","resolution":{"observed_at":"2026-08-06T18:15:42.438704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1901.10995","last_updated":"2021-02-26T21:21:11Z","snapshot_observed_at":"2026-07-06T07:30:05.397042Z","submitted_at":"2019-01-30T18:40:37Z","title":"Go-Explore: a New Approach for Hard-Exploration Problems","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.10995","snapshot_observed_at":"2026-08-06T18:15:43.839731Z","title":"O., and Clune, J","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-09T05:31:23.348356Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:43.839731Z"},"links":{"cited_paper":"/paper/1901.10995","citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:e8ea04f36da0c71fd490dbab29c491ac753869d532f5e88c4691dacd2f2c4e8f","observation_id":"8dece67f-c87a-4143-9c04-e5050612bac0","resolution":{"observed_at":"2026-08-06T18:15:43.839731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.10047","last_updated":"2022-12-15T23:47:39Z","snapshot_observed_at":"2026-08-08T10:14:17.551798Z","submitted_at":"2022-10-18T17:59:55Z","title":"From Play to Policy: Conditional Behavior Generation from Uncurated Robot Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.10047","snapshot_observed_at":"2026-08-06T18:15:43.348787Z","title":"Can foundation models perform zero-shot task specifi- cation for robot manipulation? In Learning for dynamics and control conference, pp","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-09T05:31:23.348356Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:43.348787Z"},"links":{"cited_paper":"/paper/2210.10047","citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:a516878dd13d28cedc3cd03d14632e6169e51ddb5800342895ddfc8678d1a0f7","observation_id":"5fec2223-9cf7-4aae-bf45-4ed6b797c76e","resolution":{"observed_at":"2026-08-06T18:15:43.348787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10751","last_updated":"2022-05-11T03:17:44Z","snapshot_observed_at":"2026-08-09T16:07:52.623918Z","submitted_at":"2021-12-20T18:55:16Z","title":"RvS: What is Essential for Offline RL via Supervised Learning?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10751","snapshot_observed_at":"2026-08-06T18:15:43.933445Z","title":"Rvs: What is essential for offline rl via supervised learn- ing? arXiv preprint arXiv:2112.10751,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-09T05:31:23.348356Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:43.933445Z"},"links":{"cited_paper":"/paper/2112.10751","citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:731c4a38833bac0ff5cf41eb33f40800af01cf88b496c1d5ed4eafa2c3019257","observation_id":"77a78522-f49a-4eb8-96e5-bd86295f3c90","resolution":{"observed_at":"2026-08-06T18:15:43.933445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.15657","last_updated":"2023-07-10T07:25:26Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-28T18:59:02Z","title":"Is Conditional Generative Modeling all you need for Decision-Making?","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.15657","snapshot_observed_at":"2026-08-06T18:15:42.188468Z","title":"Is conditional generative model- ing all you need for decision-making? arXiv preprint arXiv:2211.15657,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-09T05:31:23.348356Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:42.188468Z"},"links":{"cited_paper":"/paper/2211.15657","citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:83ab6dbcd1eae8918667ae9349aaed943d54597c8b6e9dd8fb4700af1c19b06b","observation_id":"4b748d70-c76a-49c1-86d5-ffaa173c1a62","resolution":{"observed_at":"2026-08-06T18:15:42.188468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10088","last_updated":"2024-10-14T02:02:54Z","snapshot_observed_at":"2026-08-04T09:34:09.818156Z","submitted_at":"2024-10-14T02:02:54Z","title":"The Ingredients for Robotic Diffusion Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10088","snapshot_observed_at":"2026-08-06T18:15:43.506860Z","title":"K., and Levine, S","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-09T05:31:23.348356Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:43.506860Z"},"links":{"cited_paper":"/paper/2410.10088","citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:eaf70ddbe44b891aa1c2f7ff15d74804b5022e62bd910a6a8f8f44ef3ae20913","observation_id":"ef579c6d-ab4d-43b3-84fd-1ee3b1709d66","resolution":{"observed_at":"2026-08-06T18:15:43.506860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:15:42.885629Z","title":"D., Dhariwal, P., Neelakantan, A., Shyam, P., Sastry, G., Askell, A., et al","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-09T05:31:23.348356Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:42.885629Z"},"links":{"citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:04915daf35bb2cb3f6be4b6675af9368c5208b2a1388097b3e6b77fa70b551a0","observation_id":"eedd4742-33fe-498b-9d80-465effa9fd62","resolution":{"observed_at":"2026-08-06T18:15:42.885629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.08028","last_updated":"2025-05-29T14:17:01Z","snapshot_observed_at":"2026-08-10T08:00:33.857715Z","submitted_at":"2023-01-19T12:01:41Z","title":"A Tutorial on Meta-Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.08028","snapshot_observed_at":"2026-08-06T18:15:42.311817Z","title":"Z., Xiong, Z., Zintgraf, L., Finn, C., and Whiteson, S","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-09T05:31:23.348356Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:42.311817Z"},"links":{"cited_paper":"/paper/2301.08028","citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:e527c3c3eb9f6bd1226232fc44fe9acd7471eea32093a55e390af0d753090151","observation_id":"225f2833-5557-4fcc-893b-3bf91fd56b0f","resolution":{"observed_at":"2026-08-06T18:15:42.311817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1604.07316","last_updated":"2016-04-25T16:03:56Z","snapshot_observed_at":"2026-07-06T04:53:59.754200Z","submitted_at":"2016-04-25T16:03:56Z","title":"End to End Learning for Self-Driving Cars","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1604.07316","snapshot_observed_at":"2026-08-06T18:15:42.747298Z","title":"End to end learning for self-driving cars","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-09T05:31:23.348356Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:42.747298Z"},"links":{"cited_paper":"/paper/1604.07316","citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:21c2fd90faabc7457f53b0fa2e2be12b8daa448275f655f7acab9e26abeaa89b","observation_id":"3754c8bc-55be-473a-b402-3f05da810bf7","resolution":{"observed_at":"2026-08-06T18:15:42.747298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10639","last_updated":"2023-10-16T17:57:23Z","snapshot_observed_at":"2026-08-08T13:35:58.479807Z","submitted_at":"2023-10-16T17:57:23Z","title":"Zero-Shot Robotic Manipulation with Pretrained Image-Editing Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10639","snapshot_observed_at":"2026-08-06T18:15:42.529366Z","title":"Zero-shot robotic manipulation with pretrained image-editing diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-09T05:31:23.348356Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:42.529366Z"},"links":{"cited_paper":"/paper/2310.10639","citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:3ec9982e2c951a1cc68c8605f039ae5286cce64c675a6bc56c26dcebdf5df5d5","observation_id":"1029ab3b-869a-4882-a489-959be1ab0268","resolution":{"observed_at":"2026-08-06T18:15:42.529366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T05:31:23.348356Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":46,"verified_exact":3,"verified_fuzzy":8},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 0 inbound Pith citation observations for arXiv:2507.09041."}