{"as_of":"2026-08-12T09:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a38f80038c051053a6dfe7c5baf5343c2e9685fa2038dd2945cc4c0374693fc2","coverage":[{"denominator":60,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":60,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:01:05.049084Z","state":"measured"},{"denominator":60,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":60,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.20307/citation-record","integrity":"/paper/2506.20307/integrity","json":"/paper/2506.20307/citation-record.json","paper":"/paper/2506.20307"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:06.159177Z","title":"VO Q L: Towards Optimal Regret in Model-free RL with Nonlinear Function Approximation","venue":null,"work_id":"421be87f-15a7-4782-a3ac-fbedc5c5e1ed","year":2023},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:04.751681Z"},"links":{"citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:ea94bd55464f243a074f6689afd4d51b6d38b85eee7b83f25a919b643b98ddef","observation_id":"29b64a58-902b-42e7-b8c8-7c39dbb83145","resolution":{"observed_at":"2026-08-06T23:01:06.164194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:05.379415Z","title":"Hence the right-hand side of the above inequality is a martingale difference sequence","venue":null,"work_id":"0c6bcab1-b5c5-4e53-a1f9-6ecf2b1a554e","year":2025},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:05.038586Z"},"links":{"citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:b1acd05a6d12ed9da2f6c759f133c37d0a7c219827fd8c622c4d8e1469866626","observation_id":"c2935928-7172-4033-b4de-e0536c1748d6","resolution":{"observed_at":"2026-08-06T23:01:05.385296Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.03207","last_updated":"2022-01-31T16:54:53Z","snapshot_observed_at":"2026-08-11T21:13:29.988091Z","submitted_at":"2021-06-06T18:31:08Z","title":"Mitigating Covariate Shift in Imitation Learning via Offline Data Without Great Coverage","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.03207","snapshot_observed_at":"2026-08-06T23:01:04.784230Z","title":"Mitigating covariate shift in imitation learning via offline data without great coverage.arXiv preprint arXiv:2106.03207,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:04.784230Z"},"links":{"cited_paper":"/paper/2106.03207","citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:c147296797aae70e3a9becda3406304a89ccab138047cb84649f0dd9ad0f9a8d","observation_id":"d1430f1a-554f-4981-8768-5fe5da62a566","resolution":{"observed_at":"2026-08-06T23:01:04.784230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:06.098322Z","title":"Deep reinforcement learning from human preferences","venue":null,"work_id":"323d8dca-c5fc-48ec-a7d3-fa4c9105cefc","year":2017},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:04.794263Z"},"links":{"citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:57a238557f6218a271ba32635747bccfb0590163f8ebaf716745523cf15a2b44","observation_id":"df7ddbfb-ad7c-403d-8beb-40225c342e4c","resolution":{"observed_at":"2026-08-06T23:01:06.103150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:06.067634Z","title":"Guided cost learning: Deep inverse optimal control via policy optimization","venue":null,"work_id":"b9163c9f-c628-4abe-b6af-b2aeb6b83034","year":2016},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:04.804541Z"},"links":{"citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:aea93b464163a84c76afc47da3e03e4d5bd19ce23ea7197ff42c89163308c032","observation_id":"71e633ff-c691-4c30-90cf-0455709637f0","resolution":{"observed_at":"2026-08-06T23:01:06.072586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:06.052327Z","title":"Efficient Bias-Span-Constrained Exploration-Exploitation in Reinforcement Learning","venue":null,"work_id":"c668c18a-3cf7-421d-8a83-406f8ed62d9b","year":2018},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:04.809354Z"},"links":{"citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:a8f998a27f4f520e31d30cd38c674dea40da063cac464680a39e64f99040b93a","observation_id":"7a4acd9a-846d-455d-91cc-1b8b51483044","resolution":{"observed_at":"2026-08-06T23:01:06.057428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:06.035916Z","title":"Ess- InfoGAIL: Semi-supervised Imitation Learning from Imbalanced Demonstrations","venue":null,"work_id":"5580d493-b191-4840-9d50-7b271ef87cb9","year":2025},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:04.813739Z"},"links":{"citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:dace2745ec31f70b232e1618d8e8d99574d3e746bdc85bffd3767b92add6dee0","observation_id":"45e1ea72-f27c-4164-9f2b-1e274f29568d","resolution":{"observed_at":"2026-08-06T23:01:06.041045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:06.004941Z","title":"Deep Q-learning from Demonstrations","venue":null,"work_id":"a0d6f5e2-515f-48fc-b967-05f7a96bfb15","year":2018},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:04.827906Z"},"links":{"citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:fd76410cb138f30ebe80ce5942facf45146258757d71291ed521b35beb622bcd","observation_id":"cd84756d-95f2-4c82-a4d3-743b27f40256","resolution":{"observed_at":"2026-08-06T23:01:06.010041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:05.987824Z","title":"Generative adversarial imitation learning","venue":null,"work_id":"1338cc95-9773-4e34-b333-7ee717492ea9","year":2016},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:04.832292Z"},"links":{"citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:1a5d0a3cebf34e3a625e2d742474de47db8c73543de899b99b9af5518c3a1ae5","observation_id":"b133a3c7-4d75-4bfa-9866-a868c4e96ac3","resolution":{"observed_at":"2026-08-06T23:01:05.993258Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:05.953961Z","title":"3D Perception based Imitation Learning under Limited Demonstration for Laparoscope Control in Robotic Surgery","venue":null,"work_id":"5db7a9bc-e8c4-49d7-b4b4-30ffcf82043e","year":2022},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:04.841127Z"},"links":{"citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:364e6ad7658e0a46e06a98ab771b64c79e795d7df8308ef40fdab39db3c94930","observation_id":"91b69499-6cc8-42b8-ac7c-3b9f59206ec2","resolution":{"observed_at":"2026-08-06T23:01:05.959186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:05.923419Z","title":"Visual imitation learning with patch rewards","venue":null,"work_id":"d024336b-1257-4f78-af72-a8b2128ad487","year":2023},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:04.849975Z"},"links":{"citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:daeb9e0c6a08db93f2274994846cd90d0d8c511c7805516c7764e8467b0b82cb","observation_id":"c8fc85d8-5ad0-41f3-ad6c-8e10520e6407","resolution":{"observed_at":"2026-08-06T23:01:05.928351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.13213","last_updated":"2026-06-21T08:13:27Z","snapshot_observed_at":"2026-07-06T08:47:45.187408Z","submitted_at":"2019-12-31T08:16:31Z","title":"Online Learning: A Modern Introduction Using Convex Optimization","version":10},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.13213","snapshot_observed_at":"2026-08-06T23:01:04.854645Z","title":"A modern introduction to online learning.arXiv preprint arXiv:1912.13213,","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:04.854645Z"},"links":{"cited_paper":"/paper/1912.13213","citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:f08a359205e87c826e19353594fcb283f07f3fb56154bb018e0252d352391b26","observation_id":"742c03b6-3d2f-41c0-bdf4-0f047d30e529","resolution":{"observed_at":"2026-08-06T23:01:04.854645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:05.907226Z","title":"Online Trajectory Planning in Dynamic Environments for Surgical Task Automation","venue":null,"work_id":"f1c427e8-315f-4834-8d48-65a1a3282743","year":2014},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:04.859792Z"},"links":{"citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:0d2daeca0da987e2b84d0969971a9100fb9a365a8bddf4c3769bca6301667a69","observation_id":"3ff3c01e-d0ab-4d8d-9825-ff9e557cf0af","resolution":{"observed_at":"2026-08-06T23:01:05.911845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:05.871515Z","title":"Variational discriminator bottleneck: Improving imitation learning, inverse RL, and GANs by constraining information flow","venue":null,"work_id":"913712eb-52bf-4bcb-ba73-24def76eeb58","year":2019},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:04.868617Z"},"links":{"citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:25423480dc689b2be869530cafea30a119584943e1edf7c5680ebe0632dc7fd7","observation_id":"da17bb64-0cca-4218-9a21-124f22abb2bf","resolution":{"observed_at":"2026-08-06T23:01:05.877453Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:05.855838Z","title":"Alvinn: An autonomous land vehicle in a neural network","venue":null,"work_id":"0ed27dd8-98e5-4f10-9f74-717337f537c5","year":1998},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:04.873024Z"},"links":{"citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:ec22ba25d4b198c83651d74a4bae9dee567f9fcf2a28753902309269d7654ef7","observation_id":"f879d5e7-62b6-4b22-ae25-c9e88a38667d","resolution":{"observed_at":"2026-08-06T23:01:05.860689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:05.823091Z","title":"Eluder dimension and the sample complexity of optimistic ex- ploration","venue":null,"work_id":"62dd6769-023b-407d-adfd-2f789f34f123","year":2013},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:04.887573Z"},"links":{"citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:55bd2b817a4e5ed76f94f1ac0d14db3e4ad327ed8c36e86cb60f2f3560a0f238","observation_id":"3c0ea454-4000-404a-bf68-3febb61d8b92","resolution":{"observed_at":"2026-08-06T23:01:05.829117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:05.807962Z","title":"State entropy maximization with random encoders for efficient exploration","venue":null,"work_id":"38b3d7d6-3ad8-4a9e-9794-9e0f960e0b82","year":2021},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:04.900895Z"},"links":{"citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:437fe61caf32f737711edc5b6299eb2633cd547bf95b5b9d80162547cdd1d1ad","observation_id":"41ed20c2-c928-4329-931b-d583343495c6","resolution":{"observed_at":"2026-08-06T23:01:05.812856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:05.792240Z","title":"Optimistic policy optimization with bandit feedback","venue":null,"work_id":"08ce8d72-7898-4ce7-9387-5d7e9e786ee0","year":2020},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:04.905816Z"},"links":{"citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:3f2edb49edfeae5f841cf4301eb85907765983799cc35f5ce062c2581a1d0d8a","observation_id":"8062e568-92f6-4ff9-93b5-cb188b226393","resolution":{"observed_at":"2026-08-06T23:01:05.797507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:05.776593Z","title":"Online apprenticeship learning","venue":null,"work_id":"757fe00a-833d-4871-9973-4dd30e6f7d79","year":2022},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:04.910538Z"},"links":{"citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:6cd1475ddfcdef4ca84c5f632f6898e42d3ea7e58df299e132d31e767c5e963c","observation_id":"1b72b1f6-3135-4fe2-9106-8d1b85e3984f","resolution":{"observed_at":"2026-08-06T23:01:05.781367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:05.710688Z","title":"Error bounds of imitating policies and environments","venue":null,"work_id":"0724b325-b1b9-49a0-ba6e-c36c2a76d528","year":2020},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:04.930935Z"},"links":{"citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:2fdd76e80442fbeed6d7adaef682b09644afdd6c8e11d229f8e62f30ef31ce31","observation_id":"5525c199-3a0c-463a-bfe5-386352dddaef","resolution":{"observed_at":"2026-08-06T23:01:05.715637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:05.694734Z","title":"Planning for sample efficient imitation learning","venue":null,"work_id":"45611fb3-6bcb-47a4-ad6a-10ecc8663562","year":2022},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:04.935986Z"},"links":{"citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:3533f7f1e35c2b831246737a9389197813bfbd52fe188be5881d968c78935ef4","observation_id":"f4a1949e-5356-4d75-8e55-016851457701","resolution":{"observed_at":"2026-08-06T23:01:05.700048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:05.679190Z","title":"Intrinsic reward driven imitation learning via generative model","venue":null,"work_id":"a438fd75-53b1-40ae-8da8-536ef4822505","year":2020},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:04.940955Z"},"links":{"citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:b718de35163e683888c5b67d6947a87f17a10b95cb8c492cc5cd172c2a39e12e","observation_id":"9301e7f9-9829-4f86-b4f6-69119740d485","resolution":{"observed_at":"2026-08-06T23:01:05.684029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:05.663604Z","title":"Confidence-Aware Imitation Learning from Demonstrations with Varying Optimality","venue":null,"work_id":"d86f27e3-5bb7-4756-a538-02cf6df8521d","year":2025},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:04.946103Z"},"links":{"citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:71378c81410dfdd685fb442d5fc55e7d519ffb22c472bd1ff737e95f051d3eb6","observation_id":"41454812-50d6-4cb2-ac40-31fe30f4c44a","resolution":{"observed_at":"2026-08-06T23:01:05.668551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:05.647534Z","title":"Deep imitation learning for complex manipulation tasks from virtual reality teleoperation","venue":null,"work_id":"6cfda36d-5b69-4f70-a3cb-6e20f1d29453","year":2018},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:04.952083Z"},"links":{"citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:4688930057258786d7b3e373e48b9331dc90c65392e89ea254359dc3b9554a31","observation_id":"2e8b9210-f32b-4cad-8c97-6cdc6ee02110","resolution":{"observed_at":"2026-08-06T23:01:05.652735Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:05.631637Z","title":"Generative adversarial imitation learning with neural network parameterization: Global optimality and convergence rate","venue":null,"work_id":"4d114578-3619-414c-94ed-141947f57ab2","year":2020},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:04.957872Z"},"links":{"citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:c788790caecc472b0401f3bf181d771a476646a9c6a0581f873514c2e00cb9d0","observation_id":"56e791c1-fa1b-4b82-9e48-a56c187039e8","resolution":{"observed_at":"2026-08-06T23:01:05.636759Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2311.15238","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:05.169792Z","title":"A Nearly Optimal and Low-Switching Algorithm for Reinforcement Learning with General Function Approximation.arXiv preprint arXiv:2311.15238,","venue":null,"work_id":"981cb624-232f-4958-a1b8-3d40e207cf9e","year":null},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:04.962898Z"},"links":{"citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:a37b4253339865f05948493f6d04d1f6f93c66f2aa1f2263cd5a842520ee862e","observation_id":"0a00e1f4-25c7-4b9f-9038-864e591e6e5e","resolution":{"observed_at":"2026-08-06T23:01:05.182636Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:05.615806Z","title":"Self-adaptive imitation learning: Learning tasks with delayed rewards from sub-optimal demonstrations","venue":null,"work_id":"b3162d59-f406-4253-b554-c306251e6c77","year":2022},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:04.968464Z"},"links":{"citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:c2c541fa90b9453de2e350c38b50d1deddc7ccbaad4b974757f25ea2b6715499","observation_id":"460a07f9-20da-4e1a-bd98-1d8dd9cbda12","resolution":{"observed_at":"2026-08-06T23:01:05.620954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:05.599511Z","title":"Maximum entropy inverse reinforcement learning","venue":null,"work_id":"3356fa40-b02f-46cb-9487-c6b53107dbbe","year":2008},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:04.973262Z"},"links":{"citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:0b45f634561f2c3a213ca51e1ee56d7a81c4c5b8a22647c302d5068004a1ecd5","observation_id":"29734fda-d086-4df7-8427-4b4a258fd90f","resolution":{"observed_at":"2026-08-06T23:01:05.604679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:05.562917Z","title":"Table 3: Comparison of three reward components with three attributes","venue":null,"work_id":"a1d556a8-6b99-4aed-939f-2f20642285a3","year":2020},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:04.983256Z"},"links":{"citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:eff92b1b16df2c64f9261a7ff0d19d3b66fc2b1dc65574c3c6068fbe86a3a433","observation_id":"048c802e-77c7-494e-9aee-26f4ad98270c","resolution":{"observed_at":"2026-08-06T23:01:05.569475Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:05.546426Z","title":"14 Published as a conference paper at ICLR 2025 Table 4: Demonstration lengths in the Atari environment","venue":null,"work_id":"d818607d-0e7b-463c-b091-de1fcb6dfc7a","year":2020},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:04.987773Z"},"links":{"citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:9bf4277763d15b80c735de01b0f3f8e8db2f70fe4c23a5c8292824d3442e1b07","observation_id":"6b90e6a3-99bb-4dcd-b744-7602181ce3b6","resolution":{"observed_at":"2026-08-06T23:01:05.551681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:05.530639Z","title":"VDB constrains the information flow in the discriminator using an information bottleneck","venue":null,"work_id":"66ca9bfe-1d8f-4b44-be80-e6fbc65180cf","year":2020},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:04.992820Z"},"links":{"citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:1595e7ae04e59d319bce5565496ddbe1bc0bf6ab7cd799c8ea8ee4dde9726a7c","observation_id":"24521a19-8289-447d-955c-3a17c41e9cac","resolution":{"observed_at":"2026-08-06T23:01:05.535824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:05.514849Z","title":"The module is composed of several neural networks, including recognition network qϕ(z|st, st+1), a generative network pθ(st+1|z, st), and prior network pθ(z|st)","venue":null,"work_id":"80459e2e-4130-4ecb-a178-4d1e171abc6d","year":2021},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:04.997706Z"},"links":{"citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:073740f524b7badc1f88e94b677e2810225b0970677cf51afe7947c444a2f480","observation_id":"e1069b43-fe6c-4bd7-93d9-ebe3814cbe2b","resolution":{"observed_at":"2026-08-06T23:01:05.519977Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:05.499517Z","title":"State entropy estimate as bonus.Following Seo et al","venue":null,"work_id":"1111219b-47e5-4a0d-8baf-634ea3c13eed","year":2021},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:05.002708Z"},"links":{"citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:3305329ddb7f57b4316f4052646e9e8ef018db8d56fb9bf87729250f5c29cb1b","observation_id":"8ce758f5-e18f-48de-b356-14e6c64c46bd","resolution":{"observed_at":"2026-08-06T23:01:05.504115Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:05.464643Z","title":"We use the same hyperparameter setting for the different experiments within a domain (Atari vs MuJoCo), apart from a multiplicative constant based on the range of the curiosity","venue":null,"work_id":"3803b776-0b62-48da-bed3-b98d65e10346","year":2025},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:05.012779Z"},"links":{"citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:e4a2583e55fb0e6ca0170a6c485cf94b431ef510dc4e1f25389fce82b7cc4e29","observation_id":"626a3192-7096-406e-b367-eccaccf50ef2","resolution":{"observed_at":"2026-08-06T23:01:05.470126Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:05.449228Z","title":"Improve vs Expert","venue":null,"work_id":"c1e44298-ec73-4ef3-979a-8549a70fa77c","year":2025},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:05.018130Z"},"links":{"citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:6336b0eaad6c3b5529aeadfe4e0c8f3d0321776d57136b1d509b99f2a1d70285","observation_id":"b5b7e079-11c4-4f60-8379-ce67da842a0c","resolution":{"observed_at":"2026-08-06T23:01:05.453937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:05.431673Z","title":"Improve vs GIRIL","venue":null,"work_id":"09b3fa1a-00dd-43be-8498-f3c8e19ac31d","year":2024},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:05.023291Z"},"links":{"citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:20d34ac86340ccee07edf02aed09dd01efe4eaaaf4ee0dd80889e74565c9d37a","observation_id":"de71d438-3aa6-43c2-953c-46ad03772d60","resolution":{"observed_at":"2026-08-06T23:01:05.437406Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:05.397972Z","title":"(2023), and (3) the analysis leads to a sublinear batch-regret, which is stronger than a sample complexity bound","venue":null,"work_id":"493660b7-3688-4b77-a257-17c2fbcbfe39","year":2023},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:05.033529Z"},"links":{"citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:978a0593dd76cd74a466580eb9212ddff5748ad6acffdedbf8976b45cd9b99a0","observation_id":"95168769-48c7-4292-8631-a800bebb5d95","resolution":{"observed_at":"2026-08-06T23:01:05.403114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:05.363268Z","title":"Then with probability at least1−2δ, KX k=1 J(π ∗,erk)−J(π,er k) ≤Hlog|A|/η+ηH 3K/2 + 2HK· p 8H 2 log(H· NF (ϵF )/δ) + 4ϵF N+γ·O s H N · H 2 +γ γ dimN (Fh) log(1/δ) !","venue":null,"work_id":"7e65ca7e-3a9c-4b34-b0a3-50a459675476","year":2025},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:05.043470Z"},"links":{"citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:4b5e247493bbf77dc4d8ce71db88be16b961b9eb471c3b18b81addd1f4bfddb0","observation_id":"b7b8e7e6-2f8c-446e-af65-50d250a2a372","resolution":{"observed_at":"2026-08-06T23:01:05.368525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:05.347074Z","title":"Lemma D.2(Self-normalized bound for scalar-valued martingales).Consider random variables (vn|n∈N) adapted to the filtration (Hn :n= 0,1, ...)","venue":null,"work_id":"c7f2d11c-2be5-44be-9aa5-fede055ee8ff","year":2019},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:05.049084Z"},"links":{"citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:a11ba38f1dfed3be186f529d8f59adc69dba911c37e074a81b3443ffbe1de0f9","observation_id":"c65daf9e-c0af-46ef-aa7d-b44bcf0bcbee","resolution":{"observed_at":"2026-08-06T23:01:05.352347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:05.414552Z","title":"Table 16 shows the MLP architectures, i.e., GIRIL’s encoder and decoder and V AIL’s discriminator","venue":null,"work_id":"bc0989ec-f688-4234-b480-6e5cbb5e60ed","year":2025},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:05.028464Z"},"links":{"citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:39066d3e613759c0a7aafedd2ce5cc32e34b52b7f27aacf8d04326d1852ea3b0","observation_id":"15ae85a1-92f2-4ddd-a953-0fecbb8f89a3","resolution":{"observed_at":"2026-08-06T23:01:05.419654Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:05.839935Z","title":"Toward the fundamental limits of imitation learning","venue":null,"work_id":"96070a0e-894a-4d13-a3f4-1d7ae011d0c0","year":2020},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":1988,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:04.877390Z"},"links":{"citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:7372ee21aa01fd66f937c76731d421ccec7bedc70cd69c8384830b560ed2f714","observation_id":"3dca2e0c-e864-40b9-ab17-07e8e35015c4","resolution":{"observed_at":"2026-08-06T23:01:05.844783Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:06.143740Z","title":"Relative entropy inverse reinforcement learning","venue":null,"work_id":"e411e3da-f948-44ea-b70e-bd90ca955783","year":2011},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":2002,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:04.757294Z"},"links":{"citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:f06534b3f835725b4eaa61c93f4c670245fb8449e24e628111b95697d620d2f4","observation_id":"ed4f5999-4c14-45f7-a129-809e339dc0d1","resolution":{"observed_at":"2026-08-06T23:01:06.149046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:05.759536Z","title":"Learning structured output representation using deep conditional generative models","venue":null,"work_id":"5cc4eeac-10a4-4b16-8315-e1b0f00dab7d","year":2015},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":2003,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:04.915792Z"},"links":{"citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:800df2203864cece0f87b53f11bc3e42f2d07808f1a0b1dc2c574dd096bd1c0f","observation_id":"5d5afa12-317f-4884-ad1f-fee39e977ae9","resolution":{"observed_at":"2026-08-06T23:01:05.765510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:05.580717Z","title":"and Bagnell, J","venue":null,"work_id":"6c039dd7-1ad6-42c2-b4fb-666342352953","year":2010},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":2008,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:04.978061Z"},"links":{"citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:7dfe18da82d9a282dc5f662487a26aa8bf1d267304b164090f4c0ddf45ba1501","observation_id":"b5aefac0-2d17-4260-a7a9-046d7ec9f654","resolution":{"observed_at":"2026-08-06T23:01:05.586670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:05.970214Z","title":"Provably efficient reinforcement learning with linear function approximation","venue":null,"work_id":"9fc1de37-2474-4d77-9c97-ccca400fedf3","year":2020},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":2010,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:04.836637Z"},"links":{"citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:f43290bf4eb1c22fc0d26bef4cbecf504e04271f3a7c3e7bb5080ab2eb91fdc7","observation_id":"49dc83bb-418a-48f0-a380-a4f038286589","resolution":{"observed_at":"2026-08-06T23:01:05.975912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.01540","last_updated":"2016-06-05T17:54:48Z","snapshot_observed_at":"2026-08-12T05:40:07.199512Z","submitted_at":"2016-06-05T17:54:48Z","title":"OpenAI Gym","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.01540","snapshot_observed_at":"2026-08-06T23:01:04.762311Z","title":"OpenAI Gym.arXiv preprint arXiv:1606.01540,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":2011,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:04.762311Z"},"links":{"cited_paper":"/paper/1606.01540","citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:fce526e56977023876f9515f91f05548142fdabbd6e92eaf680d1c134d7d21bc","observation_id":"d20c8eb2-84bc-45df-a5cb-92e43fa43df2","resolution":{"observed_at":"2026-08-06T23:01:04.762311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:05.726184Z","title":"Proximal point imitation learning","venue":null,"work_id":"f9ca5231-4ca3-470e-a81b-3de79015f5b1","year":2022},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":2012,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:04.925993Z"},"links":{"citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:a69967f8601e40a9aacb570382ddd763fc1ecad5c81d9bbe7ec68e4eb4a37ed3","observation_id":"ffb10c27-9f1e-4529-a1b7-1c24fc875d59","resolution":{"observed_at":"2026-08-06T23:01:05.731530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-06T23:01:04.893867Z","title":"Proximal policy optimization algorithms.arXiv preprint arXiv:1707.06347,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":2013,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:04.893867Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:ad1e8a098637dfb458af65f9fd353a345386bc6dfa9251753f0c54f342a6eb40","observation_id":"35da6538-f151-47cf-8194-bc640d1ed319","resolution":{"observed_at":"2026-08-06T23:01:04.893867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:05.888649Z","title":"Curiosity-driven exploration by self-supervised prediction","venue":null,"work_id":"04e588e2-4d59-4418-b014-64a196d14dff","year":2025},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:04.864194Z"},"links":{"citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:237e161cc65f6763e779bbf87fa551571dacdaa16e2520957a3119412c7463d1","observation_id":"9b272b49-a52a-4f0a-9472-499bc4ac3db2","resolution":{"observed_at":"2026-08-06T23:01:05.895423Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:05.743012Z","title":"Mujoco: A physics engine for model-based control","venue":null,"work_id":"85150a7b-c357-42ca-826e-8a08c2955c42","year":2012},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:04.921365Z"},"links":{"citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:510ff058938844e07a160eaf5b2909106b5a4100be2c1b06f01a9416289df52f","observation_id":"e4ddb88d-b381-4354-b3c4-c767fd83b6c0","resolution":{"observed_at":"2026-08-06T23:01:05.748282Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:06.128513Z","title":"Extrapolating beyond sub- optimal demonstrations via inverse reinforcement learning from observations","venue":null,"work_id":"ed352f9c-a43b-4657-8c23-6853bef6981a","year":2019},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:04.768492Z"},"links":{"citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:98874704017204f3c731cb0207c61b1663f36d3850249e2b33e54fa7d654c491","observation_id":"22552bf1-f381-4fa2-b776-3e639ded67e3","resolution":{"observed_at":"2026-08-06T23:01:06.133533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:06.082977Z","title":"End-to- end driving via conditional imitation learning","venue":null,"work_id":"8d187e2b-21a3-4e1c-9ec7-36702b6aace0","year":2018},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:04.800160Z"},"links":{"citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:87e779da8afdfe7baa94260b726612f4cc5dbe34b060984920661f0272c9ba6d","observation_id":"43d0ada8-eb40-4889-bc2d-e2d7d8a241d2","resolution":{"observed_at":"2026-08-06T23:01:06.088173Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1901.03674","last_updated":"2019-01-11T17:54:47Z","snapshot_observed_at":"2026-07-06T07:26:13.408937Z","submitted_at":"2019-01-11T17:54:47Z","title":"On the Global Convergence of Imitation Learning: A Case for Linear Quadratic Regulator","version":1},"cited_work":{"arxiv_id":"1901.03674","doi":null,"metadata_source":"pith","pith_arxiv_id":"1901.03674","snapshot_observed_at":"2026-08-06T23:01:05.294850Z","title":"On the Global Convergence of Imitation Learning: A Case for Linear Quadratic Regulator","venue":"cs.LG","work_id":"16b199ac-d16c-42d5-a019-77bd39b970d0","year":2019},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:04.778839Z"},"links":{"cited_paper":"/paper/1901.03674","citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:a19addff0a660556bce085faaffdc1483ec09622e921c5ef6330a46835ba03eb","observation_id":"8fc4b90e-23d8-42d3-8a74-998af7883bec","resolution":{"observed_at":"2026-08-06T23:01:05.300489Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1808.04355","last_updated":"2018-08-13T17:58:01Z","snapshot_observed_at":"2026-08-02T13:41:53.507553Z","submitted_at":"2018-08-13T17:58:01Z","title":"Large-Scale Study of Curiosity-Driven Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.04355","snapshot_observed_at":"2026-08-06T23:01:04.773534Z","title":"Large-scale study of curiosity-driven learning.arXiv preprint arXiv:1808.04355,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:04.773534Z"},"links":{"cited_paper":"/paper/1808.04355","citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:3b0aa6f858aa03e4a5c588fa36280f6ac3586f79a5fc013fe284220ab0b54bfb","observation_id":"d5d1a19d-f8db-45e8-8aa7-21be4d6cd5cb","resolution":{"observed_at":"2026-08-06T23:01:04.773534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08848","last_updated":"2024-06-05T00:17:20Z","snapshot_observed_at":"2026-08-10T22:23:02.282353Z","submitted_at":"2024-02-13T23:29:09Z","title":"Hybrid Inverse Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2402.08848","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.08848","snapshot_observed_at":"2026-08-06T23:01:05.220360Z","title":"Hybrid Inverse Reinforcement Learning","venue":"cs.LG","work_id":"72ebfe1f-cb6d-4169-a9f1-a3a1be7f1663","year":2024},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:04.882451Z"},"links":{"cited_paper":"/paper/2402.08848","citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:3470d1e5fc53741ff0ea88372849fac2e0508a289cba3c5fac92e0254e266e3f","observation_id":"e83f2d93-b30d-44a7-afce-4c234c4597cf","resolution":{"observed_at":"2026-08-06T23:01:05.226854Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:06.113334Z","title":"On Computation and Generalization of Generative Adversarial Imitation Learning","venue":null,"work_id":"9b9d4fd8-cd49-4f63-a682-3a2fd771bbf1","year":2019},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:04.789475Z"},"links":{"citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:13746d2f42405437995d005eab3a9e03906a6cfbe26c2458e2454888a108d561","observation_id":"82a4e234-d90e-4be9-9f52-028324fb64e7","resolution":{"observed_at":"2026-08-06T23:01:06.117953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:05.938998Z","title":"Imitation Learning from Imperfection: Theoretical Justifications and Algorithms","venue":null,"work_id":"3367452d-15f2-4a75-a315-1aa21a76dd4c","year":2023},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:04.845606Z"},"links":{"citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:710cc0e82ff416994d03998ed82104f2d02f179dd74ff61dad4316a970a66446","observation_id":"f1698227-9077-41f4-b4ab-59ce9bea3dab","resolution":{"observed_at":"2026-08-06T23:01:05.943710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:06.019962Z","title":"IQ-Learn: Inverse soft-Q Learning for Imitation","venue":null,"work_id":"8e1a6eb4-20da-4b36-977f-d771e6762736","year":2021},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:04.818299Z"},"links":{"citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:c954dceddf822d1e7cc5f81ad2935179cc4c13dd0ba0465228ff9f3b1eea9ea1","observation_id":"47b4d814-94b0-4d36-972e-c16de17b9058","resolution":{"observed_at":"2026-08-06T23:01:06.025396Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.05805","last_updated":"2023-01-04T23:02:57Z","snapshot_observed_at":"2026-08-02T11:25:34.134615Z","submitted_at":"2022-10-11T22:10:23Z","title":"Exploration via Elliptical Episodic Bonuses","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.05805","snapshot_observed_at":"2026-08-06T23:01:04.822802Z","title":"Exploration via Elliptical Episodic Bonuses.arXiv preprint arXiv:2210.05805,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:04.822802Z"},"links":{"cited_paper":"/paper/2210.05805","citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:7db331b60dcb593815f2e591ed0de1639d3796249c0da37174c534743d9ac987","observation_id":"8276749f-f8d1-469e-8c3e-e8d28e216c89","resolution":{"observed_at":"2026-08-06T23:01:04.822802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:05.483450Z","title":"For a fair comparison, we used an identical policy network for all methods","venue":null,"work_id":"6427c264-e646-48e0-92e0-68cdf932ebd1","year":2018},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":5184,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:05.007817Z"},"links":{"citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:c4146fe3d616d40c128cccece5d78c15c753dc5fce74da3168e426056d5aa900","observation_id":"009e47ab-f081-4445-8d6d-f6bf83f30407","resolution":{"observed_at":"2026-08-06T23:01:05.488424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration"},"reference_resolution":{"displayed":60,"state_counts":{"malformed_identifier":2,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":6,"verified_exact":3,"verified_fuzzy":49},"total_outbound_references":60},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 60 of 60 outbound references and 0 inbound Pith citation observations for arXiv:2506.20307."}