{"as_of":"2026-08-17T22:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5ba2f09afdb15b008f1c0ef207eeaab0106fba0d357567b5494303cbc58aa478","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T10:14:54.453290Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2504.18766/citation-record","integrity":"/paper/2504.18766/integrity","json":"/paper/2504.18766/citation-record.json","paper":"/paper/2504.18766"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:14:55.261524Z","title":"Behavior priors for efficient reinforcement learning","venue":null,"work_id":"1981e352-a60e-4bad-b9f9-8d0da25249e1","year":2022},"citing_paper":{"arxiv_id":"2504.18766","last_updated":"2025-04-26T02:12:02Z","snapshot_observed_at":"2026-08-17T14:40:59.739803Z","submitted_at":"2025-04-26T02:12:02Z","title":"Dynamic Action Interpolation: A Universal Approach for Accelerating Reinforcement Learning with Expert Guidance","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:54.270338Z"},"links":{"citing_paper":"/paper/2504.18766"},"observation_digest":"sha256:9c4201d1d1efb8ac57f6034a87afdeddbfca7a9e80734114b4e956900605520a","observation_id":"f4617197-167f-4087-a297-6580c6f3e361","resolution":{"observed_at":"2026-08-16T10:14:55.266723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:14:54.276294Z","title":"Deep q-learning from demonstrations","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.18766","last_updated":"2025-04-26T02:12:02Z","snapshot_observed_at":"2026-08-17T14:40:59.739803Z","submitted_at":"2025-04-26T02:12:02Z","title":"Dynamic Action Interpolation: A Universal Approach for Accelerating Reinforcement Learning with Expert Guidance","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:54.276294Z"},"links":{"citing_paper":"/paper/2504.18766"},"observation_digest":"sha256:6d6902a2b7d9861dd6eca9a6c9c69abe3856d09323851277f18747f9b96287bc","observation_id":"34cd9837-379f-4b9c-89f0-61985a43107d","resolution":{"observed_at":"2026-08-16T10:14:54.276294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:14:55.238734Z","title":"Policy optimization with demonstrations","venue":null,"work_id":"9bf1c2f2-768c-4ad1-addd-67bc5c3e7d56","year":2018},"citing_paper":{"arxiv_id":"2504.18766","last_updated":"2025-04-26T02:12:02Z","snapshot_observed_at":"2026-08-17T14:40:59.739803Z","submitted_at":"2025-04-26T02:12:02Z","title":"Dynamic Action Interpolation: A Universal Approach for Accelerating Reinforcement Learning with Expert Guidance","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:54.281680Z"},"links":{"citing_paper":"/paper/2504.18766"},"observation_digest":"sha256:6682c396255bc432556a085b55eb52e5b84331d2e42d7b3e94193342b28b742b","observation_id":"5b6da731-1ffe-47b6-9e27-5b82021330b9","resolution":{"observed_at":"2026-08-16T10:14:55.242951Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1709.10089","last_updated":"2018-02-25T07:48:19Z","snapshot_observed_at":"2026-08-14T20:28:40.030071Z","submitted_at":"2017-09-28T17:51:48Z","title":"Overcoming Exploration in Reinforcement Learning with Demonstrations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1709.10089","snapshot_observed_at":"2026-08-16T10:14:54.287163Z","title":"Overcoming exploration in reinforcement learning with demonstrations, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.18766","last_updated":"2025-04-26T02:12:02Z","snapshot_observed_at":"2026-08-17T14:40:59.739803Z","submitted_at":"2025-04-26T02:12:02Z","title":"Dynamic Action Interpolation: A Universal Approach for Accelerating Reinforcement Learning with Expert Guidance","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:54.287163Z"},"links":{"cited_paper":"/paper/1709.10089","citing_paper":"/paper/2504.18766"},"observation_digest":"sha256:47184a88bffa4dd55bd3b134b8b79dc2f30d9e8707b4655b5b882656dc98df09","observation_id":"4ef7c341-1120-4948-ac00-da056b930675","resolution":{"observed_at":"2026-08-16T10:14:54.287163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.01387","last_updated":"2019-09-03T18:20:48Z","snapshot_observed_at":"2026-08-14T19:05:41.234386Z","submitted_at":"2019-09-03T18:20:48Z","title":"Making Efficient Use of Demonstrations to Solve Hard Exploration Problems","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.01387","snapshot_observed_at":"2026-08-16T10:14:54.293113Z","title":"Making efficient use of demonstrations to solve hard exploration problems","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2504.18766","last_updated":"2025-04-26T02:12:02Z","snapshot_observed_at":"2026-08-17T14:40:59.739803Z","submitted_at":"2025-04-26T02:12:02Z","title":"Dynamic Action Interpolation: A Universal Approach for Accelerating Reinforcement Learning with Expert Guidance","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:54.293113Z"},"links":{"cited_paper":"/paper/1909.01387","citing_paper":"/paper/2504.18766"},"observation_digest":"sha256:1135a2d52d43ded5587f60c1c08428b55c7842c6bc4052e051897fe7e828ac0d","observation_id":"36574b8c-082d-43e2-8c70-50bfa9d31dff","resolution":{"observed_at":"2026-08-16T10:14:54.293113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:14:54.298605Z","title":"Shaping rewards for reinforcement learn- ing with imperfect demonstrations using generative models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.18766","last_updated":"2025-04-26T02:12:02Z","snapshot_observed_at":"2026-08-17T14:40:59.739803Z","submitted_at":"2025-04-26T02:12:02Z","title":"Dynamic Action Interpolation: A Universal Approach for Accelerating Reinforcement Learning with Expert Guidance","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:54.298605Z"},"links":{"citing_paper":"/paper/2504.18766"},"observation_digest":"sha256:e1fb1491eb32a61352d0116bef25ad49e8ab97f63a05271b170f373290734d38","observation_id":"40fa7fe9-2f8d-41fe-bcb6-ab4b0843947a","resolution":{"observed_at":"2026-08-16T10:14:54.298605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.09359","last_updated":"2021-04-24T22:39:30Z","snapshot_observed_at":"2026-08-15T03:52:49.245753Z","submitted_at":"2020-06-16T17:54:41Z","title":"AWAC: Accelerating Online Reinforcement Learning with Offline Datasets","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.09359","snapshot_observed_at":"2026-08-16T10:14:54.303847Z","title":"Awac: Accelerating online reinforcement learning with offline datasets","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2504.18766","last_updated":"2025-04-26T02:12:02Z","snapshot_observed_at":"2026-08-17T14:40:59.739803Z","submitted_at":"2025-04-26T02:12:02Z","title":"Dynamic Action Interpolation: A Universal Approach for Accelerating Reinforcement Learning with Expert Guidance","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:54.303847Z"},"links":{"cited_paper":"/paper/2006.09359","citing_paper":"/paper/2504.18766"},"observation_digest":"sha256:d2b94899b2db548c6c386c37622e226fac6b43e72f1922e45ab0ca432188fd05","observation_id":"863b70f7-1509-4a93-a694-073bc01ba358","resolution":{"observed_at":"2026-08-16T10:14:54.303847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:14:55.224905Z","title":"Cal-ql: Calibrated offline rl pre-training for efficient online fine-tuning","venue":null,"work_id":"89afc718-7141-4a4e-a289-76398ba7c89e","year":2023},"citing_paper":{"arxiv_id":"2504.18766","last_updated":"2025-04-26T02:12:02Z","snapshot_observed_at":"2026-08-17T14:40:59.739803Z","submitted_at":"2025-04-26T02:12:02Z","title":"Dynamic Action Interpolation: A Universal Approach for Accelerating Reinforcement Learning with Expert Guidance","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:54.308476Z"},"links":{"citing_paper":"/paper/2504.18766"},"observation_digest":"sha256:c685a0549ae0f2491a4882010a34752e89615861eb9152dbd36e1753fb792229","observation_id":"6905ef46-0e3e-47ce-ba22-409ba4d27985","resolution":{"observed_at":"2026-08-16T10:14:55.229083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.03201","last_updated":"2018-12-18T23:40:20Z","snapshot_observed_at":"2026-08-14T17:46:47.370624Z","submitted_at":"2018-12-07T20:10:23Z","title":"Residual Reinforcement Learning for Robot Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.03201","snapshot_observed_at":"2026-08-16T10:14:54.312313Z","title":"Residual reinforcement learning for robot control, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.18766","last_updated":"2025-04-26T02:12:02Z","snapshot_observed_at":"2026-08-17T14:40:59.739803Z","submitted_at":"2025-04-26T02:12:02Z","title":"Dynamic Action Interpolation: A Universal Approach for Accelerating Reinforcement Learning with Expert Guidance","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:54.312313Z"},"links":{"cited_paper":"/paper/1812.03201","citing_paper":"/paper/2504.18766"},"observation_digest":"sha256:07fec1e80c40378e3792396de32829dfcc698bd979d2789aed4c53fb302afce6","observation_id":"7119433e-63c7-4298-b95b-6aefad78ae80","resolution":{"observed_at":"2026-08-16T10:14:54.312313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01737","last_updated":"2025-08-11T01:00:11Z","snapshot_observed_at":"2026-08-16T14:55:38.606027Z","submitted_at":"2023-10-03T01:55:54Z","title":"Blending Imitation and Reinforcement Learning for Robust Policy Improvement","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01737","snapshot_observed_at":"2026-08-16T10:14:54.316566Z","title":"Stevens, Matthew R","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18766","last_updated":"2025-04-26T02:12:02Z","snapshot_observed_at":"2026-08-17T14:40:59.739803Z","submitted_at":"2025-04-26T02:12:02Z","title":"Dynamic Action Interpolation: A Universal Approach for Accelerating Reinforcement Learning with Expert Guidance","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:54.316566Z"},"links":{"cited_paper":"/paper/2310.01737","citing_paper":"/paper/2504.18766"},"observation_digest":"sha256:db3d10ae5c672ee47b13ed0b8b5b18b2354a4d1be20152b40a4e8af9d946c2f9","observation_id":"da529b81-927c-4923-bf64-33a7f839ca3f","resolution":{"observed_at":"2026-08-16T10:14:54.316566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13846","last_updated":"2022-10-25T09:08:26Z","snapshot_observed_at":"2026-08-16T16:21:22.709254Z","submitted_at":"2022-10-25T09:08:26Z","title":"Adaptive Behavior Cloning Regularization for Stable Offline-to-Online Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.13846","snapshot_observed_at":"2026-08-16T10:14:54.320971Z","title":"Adaptive behav- ior cloning regularization for stable offline-to-online reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.18766","last_updated":"2025-04-26T02:12:02Z","snapshot_observed_at":"2026-08-17T14:40:59.739803Z","submitted_at":"2025-04-26T02:12:02Z","title":"Dynamic Action Interpolation: A Universal Approach for Accelerating Reinforcement Learning with Expert Guidance","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:54.320971Z"},"links":{"cited_paper":"/paper/2210.13846","citing_paper":"/paper/2504.18766"},"observation_digest":"sha256:2ad6a8cc8acdbf4a1d7a61ce2622b5599dd98a8ee54fda0782fb9d589b0b7c5f","observation_id":"aafdd562-9db4-4a11-9b1f-a998429c3d3d","resolution":{"observed_at":"2026-08-16T10:14:54.320971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1709.10087","last_updated":"2018-06-26T13:31:37Z","snapshot_observed_at":"2026-08-15T17:49:11.636243Z","submitted_at":"2017-09-28T17:51:13Z","title":"Learning Complex Dexterous Manipulation with Deep Reinforcement Learning and Demonstrations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1709.10087","snapshot_observed_at":"2026-08-16T10:14:54.325230Z","title":"Learning complex dexterous manipulation with deep reinforcement learning and demonstrations, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.18766","last_updated":"2025-04-26T02:12:02Z","snapshot_observed_at":"2026-08-17T14:40:59.739803Z","submitted_at":"2025-04-26T02:12:02Z","title":"Dynamic Action Interpolation: A Universal Approach for Accelerating Reinforcement Learning with Expert Guidance","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:54.325230Z"},"links":{"cited_paper":"/paper/1709.10087","citing_paper":"/paper/2504.18766"},"observation_digest":"sha256:d0d63ce6d1b1f09b83deb93c13bbd1da9004aab82c6441a0abcc18e1e9a9ca21","observation_id":"6fd32781-7de5-41c1-8e7a-a9218de8a13b","resolution":{"observed_at":"2026-08-16T10:14:54.325230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.08817","last_updated":"2018-10-08T13:38:52Z","snapshot_observed_at":"2026-08-14T20:44:55.096659Z","submitted_at":"2017-07-27T11:16:53Z","title":"Leveraging Demonstrations for Deep Reinforcement Learning on Robotics Problems with Sparse Rewards","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.08817","snapshot_observed_at":"2026-08-16T10:14:54.329302Z","title":"Leveraging demonstrations for deep reinforcement learning on robotics problems with sparse rewards, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.18766","last_updated":"2025-04-26T02:12:02Z","snapshot_observed_at":"2026-08-17T14:40:59.739803Z","submitted_at":"2025-04-26T02:12:02Z","title":"Dynamic Action Interpolation: A Universal Approach for Accelerating Reinforcement Learning with Expert Guidance","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:54.329302Z"},"links":{"cited_paper":"/paper/1707.08817","citing_paper":"/paper/2504.18766"},"observation_digest":"sha256:149b9f3fe96eb3bb9bd05a113bb6cb886e7f559f75afe00e3425cc88eed23a16","observation_id":"67b536a4-7de8-4665-a745-256f207762e4","resolution":{"observed_at":"2026-08-16T10:14:54.329302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.00591","last_updated":"2021-10-30T04:21:12Z","snapshot_observed_at":"2026-08-16T18:12:57.258883Z","submitted_at":"2021-07-01T16:26:54Z","title":"Offline-to-Online Reinforcement Learning via Balanced Replay and Pessimistic Q-Ensemble","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.00591","snapshot_observed_at":"2026-08-16T10:14:54.333775Z","title":"Offline-to- online reinforcement learning via balanced replay and pessimistic q-ensemble, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.18766","last_updated":"2025-04-26T02:12:02Z","snapshot_observed_at":"2026-08-17T14:40:59.739803Z","submitted_at":"2025-04-26T02:12:02Z","title":"Dynamic Action Interpolation: A Universal Approach for Accelerating Reinforcement Learning with Expert Guidance","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:54.333775Z"},"links":{"cited_paper":"/paper/2107.00591","citing_paper":"/paper/2504.18766"},"observation_digest":"sha256:1aa07456d8a56d6fef026ec4bd955ad6cf95298d8d458ebd3cde72030ceea492","observation_id":"6025f4a1-3a8e-473c-82c0-c882325869c0","resolution":{"observed_at":"2026-08-16T10:14:54.333775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.11802","last_updated":"2022-11-21T19:10:27Z","snapshot_observed_at":"2026-08-16T16:14:24.609732Z","submitted_at":"2022-11-21T19:10:27Z","title":"Improving TD3-BC: Relaxed Policy Constraint for Offline Learning and Stable Online Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.11802","snapshot_observed_at":"2026-08-16T10:14:54.338344Z","title":"Improving td3-bc: Relaxed policy constraint for offline learning and stable online fine-tuning, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.18766","last_updated":"2025-04-26T02:12:02Z","snapshot_observed_at":"2026-08-17T14:40:59.739803Z","submitted_at":"2025-04-26T02:12:02Z","title":"Dynamic Action Interpolation: A Universal Approach for Accelerating Reinforcement Learning with Expert Guidance","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:54.338344Z"},"links":{"cited_paper":"/paper/2211.11802","citing_paper":"/paper/2504.18766"},"observation_digest":"sha256:cbbb428c9ead483cfcc96491a2d7da8593a9a7c3765cd8a4b4a770ef9d8f0e93","observation_id":"53c99f43-2e76-4a79-b6f1-d858f2e8c086","resolution":{"observed_at":"2026-08-16T10:14:54.338344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:14:54.343326Z","title":"Online decision transformer","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.18766","last_updated":"2025-04-26T02:12:02Z","snapshot_observed_at":"2026-08-17T14:40:59.739803Z","submitted_at":"2025-04-26T02:12:02Z","title":"Dynamic Action Interpolation: A Universal Approach for Accelerating Reinforcement Learning with Expert Guidance","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:54.343326Z"},"links":{"citing_paper":"/paper/2504.18766"},"observation_digest":"sha256:8c6860b0288aa785fd04203f3a4cb3fa5486d54ff99091cd400b231a30a0d7e4","observation_id":"5e332916-4a8d-44bd-94fd-303d6541c71e","resolution":{"observed_at":"2026-08-16T10:14:54.343326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.14500","last_updated":"2020-10-27T17:57:29Z","snapshot_observed_at":"2026-08-16T19:10:10.051564Z","submitted_at":"2020-10-27T17:57:29Z","title":"COG: Connecting New Skills to Past Experience with Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.14500","snapshot_observed_at":"2026-08-16T10:14:54.347894Z","title":"Cog: Connecting new skills to past experience with offline reinforcement learning","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2504.18766","last_updated":"2025-04-26T02:12:02Z","snapshot_observed_at":"2026-08-17T14:40:59.739803Z","submitted_at":"2025-04-26T02:12:02Z","title":"Dynamic Action Interpolation: A Universal Approach for Accelerating Reinforcement Learning with Expert Guidance","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:54.347894Z"},"links":{"cited_paper":"/paper/2010.14500","citing_paper":"/paper/2504.18766"},"observation_digest":"sha256:82e3002d681b2eedafbf31f54b6c44165ad681b27eb2ed45d79437c5f0dc12de","observation_id":"b8297af3-273c-4e96-a3a0-ff321d74c71b","resolution":{"observed_at":"2026-08-16T10:14:54.347894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.09816","last_updated":"2023-01-24T05:01:23Z","snapshot_observed_at":"2026-08-16T16:00:34.740049Z","submitted_at":"2023-01-24T05:01:23Z","title":"SMART: Self-supervised Multi-task pretrAining with contRol Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.09816","snapshot_observed_at":"2026-08-16T10:14:54.352681Z","title":"Smart: Self-supervised multi-task pretraining with control transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18766","last_updated":"2025-04-26T02:12:02Z","snapshot_observed_at":"2026-08-17T14:40:59.739803Z","submitted_at":"2025-04-26T02:12:02Z","title":"Dynamic Action Interpolation: A Universal Approach for Accelerating Reinforcement Learning with Expert Guidance","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:54.352681Z"},"links":{"cited_paper":"/paper/2301.09816","citing_paper":"/paper/2504.18766"},"observation_digest":"sha256:adb6f7848143b8196b7a64ce0162b7b75a522403f5145a90f01828d5d1152d6d","observation_id":"8e0c9724-8e88-4e2c-9768-67d9b35ed723","resolution":{"observed_at":"2026-08-16T10:14:54.352681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.06718","last_updated":"2023-03-11T11:47:54Z","snapshot_observed_at":"2026-08-16T16:24:37.265288Z","submitted_at":"2022-10-13T04:19:05Z","title":"Hybrid RL: Using Both Offline and Online Data Can Make RL Efficient","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.06718","snapshot_observed_at":"2026-08-16T10:14:54.357538Z","title":"Andrew Bagnell, Akshay Krishnamurthy, and Wen Sun","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18766","last_updated":"2025-04-26T02:12:02Z","snapshot_observed_at":"2026-08-17T14:40:59.739803Z","submitted_at":"2025-04-26T02:12:02Z","title":"Dynamic Action Interpolation: A Universal Approach for Accelerating Reinforcement Learning with Expert Guidance","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:54.357538Z"},"links":{"cited_paper":"/paper/2210.06718","citing_paper":"/paper/2504.18766"},"observation_digest":"sha256:b09fad92c102fecfdb89c77938437d0ad00c99d525f6dd5ddda5008762647d28","observation_id":"3bb942ba-3794-4427-87e2-f55fcd3e96c4","resolution":{"observed_at":"2026-08-16T10:14:54.357538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.08050","last_updated":"2021-06-15T11:16:49Z","snapshot_observed_at":"2026-08-16T18:17:03.007041Z","submitted_at":"2021-06-15T11:16:49Z","title":"Residual Reinforcement Learning from Demonstrations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.08050","snapshot_observed_at":"2026-08-16T10:14:54.361758Z","title":"Residual reinforcement learning from demonstrations, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.18766","last_updated":"2025-04-26T02:12:02Z","snapshot_observed_at":"2026-08-17T14:40:59.739803Z","submitted_at":"2025-04-26T02:12:02Z","title":"Dynamic Action Interpolation: A Universal Approach for Accelerating Reinforcement Learning with Expert Guidance","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:54.361758Z"},"links":{"cited_paper":"/paper/2106.08050","citing_paper":"/paper/2504.18766"},"observation_digest":"sha256:202d6dd02402a92b83e9130f9069a2c4fc1c58df20dc0f6f09c1c2ecb96a6d23","observation_id":"3c10010b-509a-4753-8cf0-9a5a861f0bad","resolution":{"observed_at":"2026-08-16T10:14:54.361758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:14:54.365995Z","title":"Residual learning from demonstration: Adapting dmps for contact- rich manipulation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.18766","last_updated":"2025-04-26T02:12:02Z","snapshot_observed_at":"2026-08-17T14:40:59.739803Z","submitted_at":"2025-04-26T02:12:02Z","title":"Dynamic Action Interpolation: A Universal Approach for Accelerating Reinforcement Learning with Expert Guidance","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:54.365995Z"},"links":{"citing_paper":"/paper/2504.18766"},"observation_digest":"sha256:6e07e8ac786071559df786812e631dfe79cff2de67fbc036459c9628df8303ac","observation_id":"68f16692-46d8-4506-88cc-bd8c834709aa","resolution":{"observed_at":"2026-08-16T10:14:54.365995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.02073","last_updated":"2023-03-03T16:44:33Z","snapshot_observed_at":"2026-08-16T15:50:58.967146Z","submitted_at":"2023-03-03T16:44:33Z","title":"How To Guide Your Learner: Imitation Learning with Active Adaptive Expert Involvement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.02073","snapshot_observed_at":"2026-08-16T10:14:54.369813Z","title":"How to guide your learner: Imitation learning with active adaptive expert involvement, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18766","last_updated":"2025-04-26T02:12:02Z","snapshot_observed_at":"2026-08-17T14:40:59.739803Z","submitted_at":"2025-04-26T02:12:02Z","title":"Dynamic Action Interpolation: A Universal Approach for Accelerating Reinforcement Learning with Expert Guidance","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:54.369813Z"},"links":{"cited_paper":"/paper/2303.02073","citing_paper":"/paper/2504.18766"},"observation_digest":"sha256:9018c377f3ee406a2c6c6dd32096613a6f2d6c894eda28928791db90a4f949f9","observation_id":"223a9ce2-b5a4-4816-8446-28cee70bb27f","resolution":{"observed_at":"2026-08-16T10:14:54.369813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.09446","last_updated":"2022-09-20T03:46:04Z","snapshot_observed_at":"2026-08-16T16:31:19.852880Z","submitted_at":"2022-09-20T03:46:04Z","title":"A Joint Imitation-Reinforcement Learning Framework for Reduced Baseline Regret","version":1},"cited_work":{"arxiv_id":"2209.09446","doi":null,"metadata_source":"pith","pith_arxiv_id":"2209.09446","snapshot_observed_at":"2026-08-16T10:14:54.631357Z","title":"A Joint Imitation-Reinforcement Learning Framework for Reduced Baseline Regret","venue":"cs.LG","work_id":"d88aa878-c159-4c9a-be1f-1dc0e21cae05","year":2022},"citing_paper":{"arxiv_id":"2504.18766","last_updated":"2025-04-26T02:12:02Z","snapshot_observed_at":"2026-08-17T14:40:59.739803Z","submitted_at":"2025-04-26T02:12:02Z","title":"Dynamic Action Interpolation: A Universal Approach for Accelerating Reinforcement Learning with Expert Guidance","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:54.374521Z"},"links":{"cited_paper":"/paper/2209.09446","citing_paper":"/paper/2504.18766"},"observation_digest":"sha256:f9f65c5ec1a146c8d38142b0e50631bf84784c49f315c270a94cac6968940b1c","observation_id":"908a6351-5a98-46d4-8104-5e1650dbb90e","resolution":{"observed_at":"2026-08-16T10:14:54.636203Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1806.01780","last_updated":"2018-06-05T16:21:25Z","snapshot_observed_at":"2026-08-16T01:36:11.279248Z","submitted_at":"2018-06-05T16:21:25Z","title":"Mix&Match - Agent Curricula for Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.01780","snapshot_observed_at":"2026-08-16T10:14:54.379501Z","title":"Jayakumar, Max Jaderberg, Leonard Hasenclever, Yee Whye Teh, Simon Osindero, Nicolas Heess, and Razvan Pascanu","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.18766","last_updated":"2025-04-26T02:12:02Z","snapshot_observed_at":"2026-08-17T14:40:59.739803Z","submitted_at":"2025-04-26T02:12:02Z","title":"Dynamic Action Interpolation: A Universal Approach for Accelerating Reinforcement Learning with Expert Guidance","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:54.379501Z"},"links":{"cited_paper":"/paper/1806.01780","citing_paper":"/paper/2504.18766"},"observation_digest":"sha256:7c87da347c07c63f85afd307df88af68121694bddd96edb113932b2d80eae592","observation_id":"6daf6545-cc68-4948-8d54-388426735fff","resolution":{"observed_at":"2026-08-16T10:14:54.379501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:14:55.201647Z","title":"Curriculum offline imitating learning","venue":null,"work_id":"f7e9922c-13ee-4b26-bef2-c5c837870756","year":2021},"citing_paper":{"arxiv_id":"2504.18766","last_updated":"2025-04-26T02:12:02Z","snapshot_observed_at":"2026-08-17T14:40:59.739803Z","submitted_at":"2025-04-26T02:12:02Z","title":"Dynamic Action Interpolation: A Universal Approach for Accelerating Reinforcement Learning with Expert Guidance","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:54.384253Z"},"links":{"citing_paper":"/paper/2504.18766"},"observation_digest":"sha256:6bc6067a2a9d84728964c49f9a0d1d48e9a40842c59eff50bc5d8d659e62cf68","observation_id":"9e30ddfa-ad8f-4ac9-afc2-59595473dcbe","resolution":{"observed_at":"2026-08-16T10:14:55.206324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:14:55.186892Z","title":"Efficient reductions for imitation learning","venue":null,"work_id":"168f013b-48fd-475d-993d-436c7807b229","year":2010},"citing_paper":{"arxiv_id":"2504.18766","last_updated":"2025-04-26T02:12:02Z","snapshot_observed_at":"2026-08-17T14:40:59.739803Z","submitted_at":"2025-04-26T02:12:02Z","title":"Dynamic Action Interpolation: A Universal Approach for Accelerating Reinforcement Learning with Expert Guidance","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:54.388596Z"},"links":{"citing_paper":"/paper/2504.18766"},"observation_digest":"sha256:8bae061c7efe7430baf6c4c8a34c837969d18e357e3308a1c88434ffafad2c8a","observation_id":"803151ae-a3d8-48ea-9ce0-f5ae9698cb6e","resolution":{"observed_at":"2026-08-16T10:14:55.191561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:14:55.171529Z","title":"Andrew Bagnell, and Byron Boots","venue":null,"work_id":"197057c4-9a50-4968-a633-28ddbd659860","year":2018},"citing_paper":{"arxiv_id":"2504.18766","last_updated":"2025-04-26T02:12:02Z","snapshot_observed_at":"2026-08-17T14:40:59.739803Z","submitted_at":"2025-04-26T02:12:02Z","title":"Dynamic Action Interpolation: A Universal Approach for Accelerating Reinforcement Learning with Expert Guidance","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:54.393261Z"},"links":{"citing_paper":"/paper/2504.18766"},"observation_digest":"sha256:113e1500a7ca75c33a975bbb98e32f1a15e64f26f0494c940395918810b50484","observation_id":"f51beeca-4455-420f-bf38-cc652693a954","resolution":{"observed_at":"2026-08-16T10:14:55.176684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.15397","last_updated":"2023-01-14T21:15:15Z","snapshot_observed_at":"2026-08-16T16:56:31.550688Z","submitted_at":"2022-05-30T19:29:56Z","title":"Minimax Optimal Online Imitation Learning via Replay Estimation","version":5},"cited_work":{"arxiv_id":"2205.15397","doi":null,"metadata_source":"pith","pith_arxiv_id":"2205.15397","snapshot_observed_at":"2026-08-16T10:14:54.593621Z","title":"Minimax Optimal Online Imitation Learning via Replay Estimation","venue":"cs.LG","work_id":"4a331edf-ac17-43d0-85c4-d369310c17db","year":2022},"citing_paper":{"arxiv_id":"2504.18766","last_updated":"2025-04-26T02:12:02Z","snapshot_observed_at":"2026-08-17T14:40:59.739803Z","submitted_at":"2025-04-26T02:12:02Z","title":"Dynamic Action Interpolation: A Universal Approach for Accelerating Reinforcement Learning with Expert Guidance","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:54.397739Z"},"links":{"cited_paper":"/paper/2205.15397","citing_paper":"/paper/2504.18766"},"observation_digest":"sha256:2a6b52e7a34694958f284d94514c93bb48c828e86387cfa3411e0aa364fd17be","observation_id":"511b9796-2809-4fce-ad72-ab38789993b7","resolution":{"observed_at":"2026-08-16T10:14:54.599638Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08848","last_updated":"2024-06-05T00:17:20Z","snapshot_observed_at":"2026-08-16T14:18:48.596694Z","submitted_at":"2024-02-13T23:29:09Z","title":"Hybrid Inverse Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08848","snapshot_observed_at":"2026-08-16T10:14:54.402435Z","title":"Andrew Bagnell, and Sanjiban Choudhury","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18766","last_updated":"2025-04-26T02:12:02Z","snapshot_observed_at":"2026-08-17T14:40:59.739803Z","submitted_at":"2025-04-26T02:12:02Z","title":"Dynamic Action Interpolation: A Universal Approach for Accelerating Reinforcement Learning with Expert Guidance","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:54.402435Z"},"links":{"cited_paper":"/paper/2402.08848","citing_paper":"/paper/2504.18766"},"observation_digest":"sha256:a1a1b74fc7501cdf2bb5a950a1f89eca153a1c474960d5f41522d4c37783bb6f","observation_id":"d6510b98-d9d2-47d7-86e3-6da80d8cf57e","resolution":{"observed_at":"2026-08-16T10:14:54.402435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:14:55.156727Z","title":"Deep reinforcement learning that matters","venue":null,"work_id":"c60c891e-886d-4475-b611-3011f62023b6","year":2018},"citing_paper":{"arxiv_id":"2504.18766","last_updated":"2025-04-26T02:12:02Z","snapshot_observed_at":"2026-08-17T14:40:59.739803Z","submitted_at":"2025-04-26T02:12:02Z","title":"Dynamic Action Interpolation: A Universal Approach for Accelerating Reinforcement Learning with Expert Guidance","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:54.406486Z"},"links":{"citing_paper":"/paper/2504.18766"},"observation_digest":"sha256:9c75a9aab8afba143a64f780fae669ab86d5cbc941ff22aa4b2a014a110c4d25","observation_id":"72738d34-8191-4add-8172-64b87ca13f58","resolution":{"observed_at":"2026-08-16T10:14:55.161626Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1802.10031","last_updated":"2018-11-19T18:57:02Z","snapshot_observed_at":"2026-08-14T19:41:32.684847Z","submitted_at":"2018-02-27T17:16:48Z","title":"The Mirage of Action-Dependent Baselines in Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.10031","snapshot_observed_at":"2026-08-16T10:14:54.410262Z","title":"Turner, Zoubin Ghahramani, and Sergey Levine","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.18766","last_updated":"2025-04-26T02:12:02Z","snapshot_observed_at":"2026-08-17T14:40:59.739803Z","submitted_at":"2025-04-26T02:12:02Z","title":"Dynamic Action Interpolation: A Universal Approach for Accelerating Reinforcement Learning with Expert Guidance","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:54.410262Z"},"links":{"cited_paper":"/paper/1802.10031","citing_paper":"/paper/2504.18766"},"observation_digest":"sha256:6faa2416c222b2e3c33a37c015af3568d0128ecb52411a041595f4ff8f6f97a0","observation_id":"55e0e295-bb48-4232-9e43-45519dd61148","resolution":{"observed_at":"2026-08-16T10:14:54.410262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.12729","last_updated":"2020-05-25T16:24:59Z","snapshot_observed_at":"2026-08-17T14:39:44.168275Z","submitted_at":"2020-05-25T16:24:59Z","title":"Implementation Matters in Deep Policy Gradients: A Case Study on PPO and TRPO","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.12729","snapshot_observed_at":"2026-08-16T10:14:54.414297Z","title":"Implementation matters in deep policy gradients: A case study on ppo and trpo, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.18766","last_updated":"2025-04-26T02:12:02Z","snapshot_observed_at":"2026-08-17T14:40:59.739803Z","submitted_at":"2025-04-26T02:12:02Z","title":"Dynamic Action Interpolation: A Universal Approach for Accelerating Reinforcement Learning with Expert Guidance","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:54.414297Z"},"links":{"cited_paper":"/paper/2005.12729","citing_paper":"/paper/2504.18766"},"observation_digest":"sha256:cd5e825b131b497ec2ce376f1220076d0ca38430e0d04099d1b43cf28be66c61","observation_id":"76df687c-b747-47bb-a911-6ea3f7a8c79d","resolution":{"observed_at":"2026-08-16T10:14:54.414297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.05990","last_updated":"2020-06-10T17:59:03Z","snapshot_observed_at":"2026-08-14T07:14:28.634639Z","submitted_at":"2020-06-10T17:59:03Z","title":"What Matters In On-Policy Reinforcement Learning? A Large-Scale Empirical Study","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.05990","snapshot_observed_at":"2026-08-16T10:14:54.418091Z","title":"What matters in on-policy reinforcement learning? a large-scale empirical study, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.18766","last_updated":"2025-04-26T02:12:02Z","snapshot_observed_at":"2026-08-17T14:40:59.739803Z","submitted_at":"2025-04-26T02:12:02Z","title":"Dynamic Action Interpolation: A Universal Approach for Accelerating Reinforcement Learning with Expert Guidance","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:54.418091Z"},"links":{"cited_paper":"/paper/2006.05990","citing_paper":"/paper/2504.18766"},"observation_digest":"sha256:8b16c8f0643785ec7a4288446be5df5265452da25fab6a09ac38e5a29d15bd7e","observation_id":"1a0f3ae6-d2d7-4194-9f6d-698e1499cec5","resolution":{"observed_at":"2026-08-16T10:14:54.418091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-08-12T13:17:36.653110Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.11361","snapshot_observed_at":"2026-08-16T10:14:54.422093Z","title":"Behavior regularized offline reinforcement learning","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2504.18766","last_updated":"2025-04-26T02:12:02Z","snapshot_observed_at":"2026-08-17T14:40:59.739803Z","submitted_at":"2025-04-26T02:12:02Z","title":"Dynamic Action Interpolation: A Universal Approach for Accelerating Reinforcement Learning with Expert Guidance","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:54.422093Z"},"links":{"cited_paper":"/paper/1911.11361","citing_paper":"/paper/2504.18766"},"observation_digest":"sha256:de0bb3207384156448d72c32626d288d20dfcbfe565173755123bb26a76905fa","observation_id":"313d14f8-bc2a-48f7-81d4-a4a9c375226a","resolution":{"observed_at":"2026-08-16T10:14:54.422093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:14:54.427068Z","title":"A minimalist approach to offline reinforcement learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.18766","last_updated":"2025-04-26T02:12:02Z","snapshot_observed_at":"2026-08-17T14:40:59.739803Z","submitted_at":"2025-04-26T02:12:02Z","title":"Dynamic Action Interpolation: A Universal Approach for Accelerating Reinforcement Learning with Expert Guidance","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:54.427068Z"},"links":{"citing_paper":"/paper/2504.18766"},"observation_digest":"sha256:5bab334a986aefc8d94b23752028cb0baf01d82ac478bab65f9fb0980639466c","observation_id":"2068defa-6aff-4fa9-8d44-9889a73797d1","resolution":{"observed_at":"2026-08-16T10:14:54.427068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.00177","last_updated":"2019-10-07T20:23:21Z","snapshot_observed_at":"2026-08-13T13:59:34.315271Z","submitted_at":"2019-10-01T02:23:38Z","title":"Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.00177","snapshot_observed_at":"2026-08-16T10:14:54.431342Z","title":"Advantage-weighted regression: Simple and scalable off-policy reinforcement learning","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2504.18766","last_updated":"2025-04-26T02:12:02Z","snapshot_observed_at":"2026-08-17T14:40:59.739803Z","submitted_at":"2025-04-26T02:12:02Z","title":"Dynamic Action Interpolation: A Universal Approach for Accelerating Reinforcement Learning with Expert Guidance","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:54.431342Z"},"links":{"cited_paper":"/paper/1910.00177","citing_paper":"/paper/2504.18766"},"observation_digest":"sha256:fb1798098658cf6ca264e587b66aea0b1860e9616aad24f672c5981de2d620cc","observation_id":"35372177-d14e-4d48-9819-247143aa85b5","resolution":{"observed_at":"2026-08-16T10:14:54.431342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:14:54.435874Z","title":"Conservative q-learning for offline reinforcement learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.18766","last_updated":"2025-04-26T02:12:02Z","snapshot_observed_at":"2026-08-17T14:40:59.739803Z","submitted_at":"2025-04-26T02:12:02Z","title":"Dynamic Action Interpolation: A Universal Approach for Accelerating Reinforcement Learning with Expert Guidance","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:54.435874Z"},"links":{"citing_paper":"/paper/2504.18766"},"observation_digest":"sha256:24f0d6e187d5ad6ded81822c366363f36a9029e4e8d3c9d1139aa2c2a56fc814","observation_id":"b539be7f-340c-4618-b4d3-da8997ab1df9","resolution":{"observed_at":"2026-08-16T10:14:54.435874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:14:55.123990Z","title":"Addressing function approximation error in actor-critic methods","venue":null,"work_id":"a41cf73b-c339-4a97-9604-61af10294e3c","year":2018},"citing_paper":{"arxiv_id":"2504.18766","last_updated":"2025-04-26T02:12:02Z","snapshot_observed_at":"2026-08-17T14:40:59.739803Z","submitted_at":"2025-04-26T02:12:02Z","title":"Dynamic Action Interpolation: A Universal Approach for Accelerating Reinforcement Learning with Expert Guidance","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:54.440225Z"},"links":{"citing_paper":"/paper/2504.18766"},"observation_digest":"sha256:a9bd387d9a53ecb34672908b6b02a4d1c1400ca55f62e3092d410a2cf0ff748c","observation_id":"ed82b5ed-059e-480a-8e01-42ea275b414c","resolution":{"observed_at":"2026-08-16T10:14:55.128328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:14:55.110622Z","title":"A framework for behavioural cloning","venue":null,"work_id":"97b766a9-4929-4cb1-91cc-be0a07309555","year":1995},"citing_paper":{"arxiv_id":"2504.18766","last_updated":"2025-04-26T02:12:02Z","snapshot_observed_at":"2026-08-17T14:40:59.739803Z","submitted_at":"2025-04-26T02:12:02Z","title":"Dynamic Action Interpolation: A Universal Approach for Accelerating Reinforcement Learning with Expert Guidance","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:54.444432Z"},"links":{"citing_paper":"/paper/2504.18766"},"observation_digest":"sha256:b9dbc3554e8ae9e7bd9ff885a10d7def092b94b77d272bfe15de3d96668f28c7","observation_id":"d3925d08-ee9d-48e7-a5cf-c9b2d67e674e","resolution":{"observed_at":"2026-08-16T10:14:55.114686Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1801.01290","last_updated":"2018-08-08T21:27:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-01-04T09:50:50Z","title":"Soft Actor-Critic: Off-Policy Maximum Entropy Deep Reinforcement Learning with a Stochastic Actor","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.01290","snapshot_observed_at":"2026-08-16T10:14:54.453290Z","title":"Soft actor-critic: Off- policy maximum entropy deep reinforcement learning with a stochastic actor, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.18766","last_updated":"2025-04-26T02:12:02Z","snapshot_observed_at":"2026-08-17T14:40:59.739803Z","submitted_at":"2025-04-26T02:12:02Z","title":"Dynamic Action Interpolation: A Universal Approach for Accelerating Reinforcement Learning with Expert Guidance","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:54.453290Z"},"links":{"cited_paper":"/paper/1801.01290","citing_paper":"/paper/2504.18766"},"observation_digest":"sha256:f86fa2b414ce28fad9605d12622dae3baeedaf1a11e8f9f955dea26a666b05a8","observation_id":"32ae6160-3b58-4e9c-a8cb-73b250fc5e73","resolution":{"observed_at":"2026-08-16T10:14:54.453290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:14:55.097151Z","title":"ISBN 0198538677","venue":null,"work_id":"471f5aee-8074-4797-a0b9-a3b1161d06f8","year":null},"citing_paper":{"arxiv_id":"2504.18766","last_updated":"2025-04-26T02:12:02Z","snapshot_observed_at":"2026-08-17T14:40:59.739803Z","submitted_at":"2025-04-26T02:12:02Z","title":"Dynamic Action Interpolation: A Universal Approach for Accelerating Reinforcement Learning with Expert Guidance","version":1},"reference_index":1999,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:54.448900Z"},"links":{"citing_paper":"/paper/2504.18766"},"observation_digest":"sha256:10f94acc67a4888db72ec2583752f87f235be1afafde91abf185535f970385e0","observation_id":"ecf8ff24-7d47-4cba-8096-cf371fa7992f","resolution":{"observed_at":"2026-08-16T10:14:55.101298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2504.18766","last_updated":"2025-04-26T02:12:02Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-17T14:40:59.739803Z","submitted_at":"2025-04-26T02:12:02Z","title":"Dynamic Action Interpolation: A Universal Approach for Accelerating Reinforcement Learning with Expert Guidance"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":29,"verified_exact":1,"verified_fuzzy":10},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 0 inbound Pith citation observations for arXiv:2504.18766."}