{"as_of":"2026-08-21T07:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b8d7ef231376a3c4f7a51452c4c80d293ab6f9be04ad4f77e12678b12877677c","coverage":[{"denominator":53,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T20:17:36.456856Z","state":"measured"},{"denominator":53,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":53,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.09891/citation-record","integrity":"/paper/2411.09891/integrity","json":"/paper/2411.09891/citation-record.json","paper":"/paper/2411.09891"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:17:37.239478Z","title":"Deep rein- forcement learning for dynamic treatment regimes on medical registry data","venue":null,"work_id":"9123ddf5-7237-4087-87da-b715a73ef053","year":2017},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-16T22:28:27.216802Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.247911Z"},"links":{"citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:e79d44348b7a7ce5b72440ad492b3fddb47bc747cd095949ef1c5e10e344b45b","observation_id":"5613138e-a2b7-4f09-b075-fa23f26b74ca","resolution":{"observed_at":"2026-08-12T20:17:37.243880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:17:36.252742Z","title":"Deep reinforcement learning for autonomous driving: A survey","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-16T22:28:27.216802Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.252742Z"},"links":{"citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:dd55daff21a9cc6f0e0693db595e95cfcaf833e648fd4ec8512ab235e75a276e","observation_id":"3ff031b4-4c2d-4c0a-9c54-4fa6922eb086","resolution":{"observed_at":"2026-08-12T20:17:36.252742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.13916","last_updated":"2021-04-14T23:38:31Z","snapshot_observed_at":"2026-08-21T01:09:36.912453Z","submitted_at":"2020-06-24T17:47:37Z","title":"Off-Dynamics Reinforcement Learning: Training for Transfer with Domain Classifiers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.13916","snapshot_observed_at":"2026-08-12T20:17:36.257541Z","title":"Off-dynamics reinforcement learning: Training for transfer with domain classifiers","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-16T22:28:27.216802Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.257541Z"},"links":{"cited_paper":"/paper/2006.13916","citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:ab7c6b7d5e2ae727a179414116e8ead986eebd52fa88fecaf9098cd498b619a6","observation_id":"4baa2b41-6a6a-4dce-8b3a-f3a1fef53fbd","resolution":{"observed_at":"2026-08-12T20:17:36.257541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:17:37.218624Z","title":"Sim-to-real interactive recommendation via off-dynamics reinforcement learning","venue":null,"work_id":"90f64f35-5ba9-4b11-a420-8be2a7eb46b8","year":2021},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-16T22:28:27.216802Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.261957Z"},"links":{"citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:a2468668d63eb4406a3e7038b8e72c7fbe94d8b51ad49811529d0a7525f2c49c","observation_id":"fa5f8d35-7bd6-4766-924c-660ddfb74b70","resolution":{"observed_at":"2026-08-12T20:17:37.222949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.06662","last_updated":"2022-03-13T14:30:55Z","snapshot_observed_at":"2026-08-16T17:15:00.378115Z","submitted_at":"2022-03-13T14:30:55Z","title":"DARA: Dynamics-Aware Reward Augmentation in Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.06662","snapshot_observed_at":"2026-08-12T20:17:36.266052Z","title":"Dara: Dynamics-aware reward augmentation in offline reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-16T22:28:27.216802Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.266052Z"},"links":{"cited_paper":"/paper/2203.06662","citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:68f7da17e2940f31e9d4c7182ebd6404e5932172faa696340a87fe9f62fc67df","observation_id":"dd32523b-2d57-48a7-a4f0-b2c20d772568","resolution":{"observed_at":"2026-08-12T20:17:36.266052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:17:37.207489Z","title":"Unsupervised domain adaptation with dynamics-aware rewards in reinforcement learning","venue":null,"work_id":"59b2ea04-2649-48cd-abf8-f2cd2a263b6b","year":2021},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-16T22:28:27.216802Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.269733Z"},"links":{"citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:b16c02b2f9e07521a45c8ef1f9e14d8ebd258e5356eaa2a01250ea2e1f4324a1","observation_id":"3a913f97-f674-4ba4-9dce-f911e3608368","resolution":{"observed_at":"2026-08-12T20:17:37.211161Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:17:36.273364Z","title":"Generative adversarial imitation learning","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-16T22:28:27.216802Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.273364Z"},"links":{"citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:fcd52f2d3a14d0e1055d852abc201261c9d5d5eb355beab3762704e38e5e4aa8","observation_id":"7499ddd5-1a1b-4f04-9a6f-ce7f3de53280","resolution":{"observed_at":"2026-08-12T20:17:36.273364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1807.06158","last_updated":"2019-06-18T04:56:56Z","snapshot_observed_at":"2026-08-18T08:58:09.128606Z","submitted_at":"2018-07-17T00:25:15Z","title":"Generative Adversarial Imitation from Observation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.06158","snapshot_observed_at":"2026-08-12T20:17:36.277182Z","title":"Generative adversarial imitation from observa- tion","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-16T22:28:27.216802Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.277182Z"},"links":{"cited_paper":"/paper/1807.06158","citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:95df490b58aeb54d55a367feb3e873905f7157664dfe118e36b030832ffec657","observation_id":"fd30c84c-8a34-4fd0-8d82-19e9a3177f5a","resolution":{"observed_at":"2026-08-12T20:17:36.277182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:17:37.188113Z","title":"Offline imitation learning with a misspecified simulator","venue":null,"work_id":"a6c605e5-5b35-4ee1-a930-87e394c423b7","year":2020},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-16T22:28:27.216802Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.280800Z"},"links":{"citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:ab6ac767d1adb2aa4ff43bb692451416d1d17d9d761e8a53b9b0a01861abbd6f","observation_id":"67525ab4-c36a-43f7-ba45-e7263eda8d37","resolution":{"observed_at":"2026-08-12T20:17:37.192290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:17:37.174564Z","title":"An imitation from observation approach to transfer learning with dynamics mismatch","venue":null,"work_id":"f998a96d-dcb8-416d-9796-2c356d7f2ed0","year":2020},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-16T22:28:27.216802Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.284153Z"},"links":{"citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:124986a177dc481a9ff89f2e726faed36c293edde7021e54d686cfd24795e23a","observation_id":"5fb528e4-6cfa-4290-a0b0-cef63400ccd0","resolution":{"observed_at":"2026-08-12T20:17:37.179110Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.11879","last_updated":"2020-02-27T02:27:46Z","snapshot_observed_at":"2026-08-12T23:18:00.134760Z","submitted_at":"2020-02-27T02:27:46Z","title":"State-only Imitation with Transition Dynamics Mismatch","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.11879","snapshot_observed_at":"2026-08-12T20:17:36.288161Z","title":"State-only imitation with transition dynamics mismatch","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-16T22:28:27.216802Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.288161Z"},"links":{"cited_paper":"/paper/2002.11879","citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:373d32097678c8cc50d8ccaf57bc394a9d7ae94f8b32e0bfdeed084abb18e2d8","observation_id":"2673544c-0942-4e83-b05d-3a617f6e9d54","resolution":{"observed_at":"2026-08-12T20:17:36.288161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1103.4601","last_updated":"2011-05-06T02:38:18Z","snapshot_observed_at":"2026-08-15T04:51:29.366364Z","submitted_at":"2011-03-23T19:37:45Z","title":"Doubly Robust Policy Evaluation and Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1103.4601","snapshot_observed_at":"2026-08-12T20:17:36.292286Z","title":"Doubly robust policy evaluation and learning","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-16T22:28:27.216802Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.292286Z"},"links":{"cited_paper":"/paper/1103.4601","citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:18cf124a633b04c2bd8c203ba7b9e7418c953aa86bbf5d1e14f3f076a2f0a21c","observation_id":"81241666-5130-4ff8-9e30-5624202aeeea","resolution":{"observed_at":"2026-08-12T20:17:36.292286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:17:37.160956Z","title":"Doubly robust off-policy value evaluation for reinforcement learning","venue":null,"work_id":"d8491043-c309-4b8f-bafd-9969b0d30a56","year":2016},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-16T22:28:27.216802Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.296742Z"},"links":{"citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:11eb29ca18781c85598b0fc8f9146641cfd13fd71d14924e99a0636bfe78b031","observation_id":"5ff84bb0-e52e-42df-8718-052153b1fb00","resolution":{"observed_at":"2026-08-12T20:17:37.164640Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:17:37.147988Z","title":"Doubly robust off-policy evaluation with shrinkage","venue":null,"work_id":"9a85c50d-d5d8-4c68-aa82-086188f1d352","year":2020},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-16T22:28:27.216802Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.301670Z"},"links":{"citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:cbe7772aa529820af9c608f2d01150c284a8dc1fae11ddbcdc86d4b944851adf","observation_id":"3fa4eb3f-6143-4c6c-b60b-5c3ca1ec149c","resolution":{"observed_at":"2026-08-12T20:17:37.153092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:17:37.135169Z","title":"Doubly robust off-policy actor-critic: Convergence and optimality","venue":null,"work_id":"e48b2e8b-5024-4067-bc8b-84147db7446b","year":2021},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-16T22:28:27.216802Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.305848Z"},"links":{"citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:fe8f65a3833d9fa95cb1fefd43eec4d555f21df707ef7130c1b31994fce4aa02","observation_id":"93013354-fb64-4f17-a28a-0693ab6bfc36","resolution":{"observed_at":"2026-08-12T20:17:37.139372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:17:37.122727Z","title":"Doubly robust distribu- tionally robust off-policy evaluation and learning","venue":null,"work_id":"292278ef-45ed-48f7-9bce-1a21112e42f0","year":2022},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-16T22:28:27.216802Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.309412Z"},"links":{"citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:759b3009eac9667bdf720e8ac5785e752dc7e18e1b02fa189974dc4377e14197","observation_id":"a67cd4fa-e58b-40a3-a2ee-0b12438c2009","resolution":{"observed_at":"2026-08-12T20:17:37.127030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:17:36.313407Z","title":"Soft actor-critic: Off- policy maximum entropy deep reinforcement learning with a stochastic actor","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-16T22:28:27.216802Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.313407Z"},"links":{"citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:aff64c99673064b8f5705d163d77ff266e504793be2324c58b51d4cdf0ce9296","observation_id":"838e9822-b528-4ded-88ef-3632000b9f7e","resolution":{"observed_at":"2026-08-12T20:17:36.313407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:17:37.102189Z","title":"On the off-dynamics approach to reinforcement learning","venue":null,"work_id":"882c7619-edaa-4cbd-8b5c-5baa0dabb647","year":2021},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-16T22:28:27.216802Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.316877Z"},"links":{"citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:4aa5aea945c651bf1cdbd779749a1a8b02e1283f777b2cb3aefa2bb209a577eb","observation_id":"b521f84e-07f0-4a70-bd00-a9afb35559db","resolution":{"observed_at":"2026-08-12T20:17:37.106346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:17:37.088582Z","title":"When to trust your model: Model-based policy optimization","venue":null,"work_id":"901d381a-3184-4720-8056-5b8b2dc59bae","year":2019},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-16T22:28:27.216802Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.320568Z"},"links":{"citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:58f148abeee6305e4075fa9fe972e26fc2f103905f2af3454151a2c086e4a339","observation_id":"983a1df7-5f2d-4b03-b13b-48f96b33386d","resolution":{"observed_at":"2026-08-12T20:17:37.093026Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:17:37.075806Z","title":"Mutual alignment transfer learning","venue":null,"work_id":"c28aaec1-027c-453a-9580-db56230c72ba","year":2017},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-16T22:28:27.216802Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.323875Z"},"links":{"citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:3425d2d1a0f54a72a7b1a3aeb0ca4284da56df6d969198e42b7319da3a1cbe3c","observation_id":"2322f4d4-362a-4411-b663-48c7abd51685","resolution":{"observed_at":"2026-08-12T20:17:37.080478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.07452","last_updated":"2018-12-18T16:08:57Z","snapshot_observed_at":"2026-08-14T17:41:48.712304Z","submitted_at":"2018-12-18T16:08:57Z","title":"Domain Adaptation for Reinforcement Learning on the Atari","version":1},"cited_work":{"arxiv_id":"1812.07452","doi":null,"metadata_source":"pith","pith_arxiv_id":"1812.07452","snapshot_observed_at":"2026-08-12T20:17:36.573526Z","title":"Domain Adaptation for Reinforcement Learning on the Atari","venue":"cs.LG","work_id":"4be8544f-5642-45f1-901d-6215c1a9a12d","year":2018},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-16T22:28:27.216802Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.327207Z"},"links":{"cited_paper":"/paper/1812.07452","citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:8ee55e8a8a536198721e9ba74d94b5bca87404c62a0b431f4e5edaee7cb81f72","observation_id":"859041a9-8267-4a5a-b3cc-e5099afa6451","resolution":{"observed_at":"2026-08-12T20:17:36.578965Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:17:37.063143Z","title":"Domain adaptation in reinforcement learning via latent unified state representation","venue":null,"work_id":"78df07de-f7ca-431b-a713-0dc2b8ca8358","year":2021},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-16T22:28:27.216802Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.331292Z"},"links":{"citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:603d22c9d66298f5a4fed2906bfc95f8d6a774eff0248124fb73b24ffafc6932","observation_id":"c9e7c01a-2133-406d-a598-39bc065876a7","resolution":{"observed_at":"2026-08-12T20:17:37.066843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:17:37.051298Z","title":"Transfer learning in deep reinforce- ment learning: A survey","venue":null,"work_id":"b38ee26c-db00-43ff-aa64-59a823efb769","year":2023},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-16T22:28:27.216802Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.335280Z"},"links":{"citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:a6fb6caae20b454ca37b2a0c86816602bdc647bb9099d2cf401b12eb6be89108","observation_id":"8df7979f-e2dd-4bd4-bc39-b81e5579f731","resolution":{"observed_at":"2026-08-12T20:17:37.055530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-12T20:17:36.339277Z","title":"Offline reinforcement learning: Tutorial, review, and perspectives on open problems","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-16T22:28:27.216802Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.339277Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:e82574e0d5763b34c1ed3ed0cf17852ec798755c100a5749eee2013cd1162fbe","observation_id":"40b228c3-039a-44d7-b42e-dd51a0522d74","resolution":{"observed_at":"2026-08-12T20:17:36.339277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:17:37.039471Z","title":"State regularized policy optimization on data with dynamics shift","venue":null,"work_id":"4020fca7-4ad7-4843-9ec1-ceb7754719b5","year":2024},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-16T22:28:27.216802Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.343376Z"},"links":{"citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:6f924abbaf13928160e7443f535ce28acbfe6133ef665c83685cb8051140f54e","observation_id":"1a0e4323-7e16-45d5-a78e-8ab3d648c68b","resolution":{"observed_at":"2026-08-12T20:17:37.043346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:17:36.347569Z","title":"Generative adversarial nets","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-16T22:28:27.216802Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.347569Z"},"links":{"citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:a129a46a2e9827888d2b74a0b66513f1079c4567a9184d86978b10fbf5e4110f","observation_id":"3cc6b026-d4f9-4812-b364-efe5a0e14d5b","resolution":{"observed_at":"2026-08-12T20:17:36.347569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:17:37.016622Z","title":"Distributionally robust off-dynamics reinforcement learning: Prov- able efficiency with linear function approximation","venue":null,"work_id":"83fe3bed-c5a3-4525-a09b-21beaaab0792","year":2024},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-16T22:28:27.216802Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.351975Z"},"links":{"citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:dacc4cf815b621ea1400bd8c80b7117bfee74f5ead26e9237e4d124e6e647adf","observation_id":"68384332-9525-40be-9946-9bd08d26d87c","resolution":{"observed_at":"2026-08-12T20:17:37.021172Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.11248","last_updated":"2018-08-13T18:33:24Z","snapshot_observed_at":"2026-08-14T20:18:41.596978Z","submitted_at":"2017-10-30T21:22:28Z","title":"Learning Robust Rewards with Adversarial Inverse Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.11248","snapshot_observed_at":"2026-08-12T20:17:36.355560Z","title":"Learning robust rewards with adversarial inverse reinforcement learning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-16T22:28:27.216802Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.355560Z"},"links":{"cited_paper":"/paper/1710.11248","citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:ca33f5755d23258d573a9d46bdcf4e60bcc15ee6c17a03ab49d8f2262d0349c0","observation_id":"41eaee32-c7f3-45e9-b0c1-aaa0782819e2","resolution":{"observed_at":"2026-08-12T20:17:36.355560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:17:37.002683Z","title":"Imitation learning via kernel mean embedding","venue":null,"work_id":"f74b43fc-c11c-4ea8-ba5c-83d05e339640","year":2018},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-16T22:28:27.216802Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.360166Z"},"links":{"citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:adbeffbf1d344b1d94be7e3b1183a71f1db3d5ddccf9b0ada93f20e016fbb350","observation_id":"a118e89a-86dd-401d-bf96-580d44b86363","resolution":{"observed_at":"2026-08-12T20:17:37.007973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.00821","last_updated":"2020-08-25T02:41:11Z","snapshot_observed_at":"2026-08-19T18:06:35.148030Z","submitted_at":"2018-10-01T17:02:24Z","title":"Variational Discriminator Bottleneck: Improving Imitation Learning, Inverse RL, and GANs by Constraining Information Flow","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.00821","snapshot_observed_at":"2026-08-12T20:17:36.364226Z","title":"Variational discriminator bottleneck: Improving imitation learning, inverse rl, and gans by constraining information flow","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-16T22:28:27.216802Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.364226Z"},"links":{"cited_paper":"/paper/1810.00821","citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:9aae2a57179816f180347d36319a27d3cbec76d9d61fbf0d13c0dba39fcecda4","observation_id":"8eb1bf54-3c9e-42ae-a0e2-dbb200a85835","resolution":{"observed_at":"2026-08-12T20:17:36.364226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:17:36.989300Z","title":"Task transfer by preference-based cost learning","venue":null,"work_id":"4334ca57-1711-4032-91fd-99b68ab6d372","year":2019},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-16T22:28:27.216802Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.368737Z"},"links":{"citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:7ea7380ef0b3e883b2e4fc1d17a3dc1df148a64a8f28b17feaa31380ca3c58b8","observation_id":"6f4a63f3-1e08-4d69-9b0b-6e5b06b5f65b","resolution":{"observed_at":"2026-08-12T20:17:36.994200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.09335","last_updated":"2019-06-19T03:59:10Z","snapshot_observed_at":"2026-08-17T08:52:59.816804Z","submitted_at":"2019-05-22T19:21:05Z","title":"Imitation Learning from Video by Leveraging Proprioception","version":2},"cited_work":{"arxiv_id":"1905.09335","doi":null,"metadata_source":"pith","pith_arxiv_id":"1905.09335","snapshot_observed_at":"2026-08-12T20:17:36.517563Z","title":"Imitation Learning from Video by Leveraging Proprioception","venue":"cs.LG","work_id":"15027eae-051a-4c18-b890-c3b76506e584","year":2019},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-16T22:28:27.216802Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.372938Z"},"links":{"cited_paper":"/paper/1905.09335","citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:5673859be3399bc7ad89d71ccd4f8282838aaeeff5f4475b1bc0515351646cf9","observation_id":"c26186d0-e667-49f6-8204-4dc139411b68","resolution":{"observed_at":"2026-08-12T20:17:36.524377Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:17:36.977266Z","title":"Imitation from observation: Learning to imitate behaviors from raw video via context translation","venue":null,"work_id":"b5df0ff4-ca90-4841-b46a-3f43ee576f8f","year":2018},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-16T22:28:27.216802Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.376193Z"},"links":{"citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:9c2671d4af22996bf486e5428979f6a9f96e4e2185003bfb53f3f5d9a8e7919b","observation_id":"16e2bad1-a861-4f73-a727-725b0cec41eb","resolution":{"observed_at":"2026-08-12T20:17:36.981041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1805.01954","last_updated":"2018-05-11T21:48:52Z","snapshot_observed_at":"2026-08-14T19:18:37.366856Z","submitted_at":"2018-05-04T22:36:58Z","title":"Behavioral Cloning from Observation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.01954","snapshot_observed_at":"2026-08-12T20:17:36.379282Z","title":"Behavioral cloning from observation","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-16T22:28:27.216802Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.379282Z"},"links":{"cited_paper":"/paper/1805.01954","citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:12dfc2df4646f315e9e70be53bec8bb7fda78d6946109aa0b58f4747891591b6","observation_id":"e3e99ab7-cf1f-401e-ade8-3e44214fb1a7","resolution":{"observed_at":"2026-08-12T20:17:36.379282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.13566","last_updated":"2019-06-19T03:55:09Z","snapshot_observed_at":"2026-08-20T01:05:58.859364Z","submitted_at":"2019-05-30T05:54:30Z","title":"Recent Advances in Imitation Learning from Observation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.13566","snapshot_observed_at":"2026-08-12T20:17:36.383384Z","title":"Recent advances in imitation learning from observation","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-16T22:28:27.216802Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.383384Z"},"links":{"cited_paper":"/paper/1905.13566","citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:f690ceaf593c7d93ae9f704ca9e4d7d836e45be828327c77f8be3fee08d5aaa1","observation_id":"cd31525b-a218-4e47-b5c5-196c1eb8eb77","resolution":{"observed_at":"2026-08-12T20:17:36.383384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:17:36.387268Z","title":"Domain adaptive imitation learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-16T22:28:27.216802Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.387268Z"},"links":{"citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:d4fc06f76aa208a3dc1a57174c205cb1370f942a9525b6ea199598f746d51831","observation_id":"b555e714-d3e7-4ea0-92ec-8fa8f3e60266","resolution":{"observed_at":"2026-08-12T20:17:36.387268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:17:36.390932Z","title":"Generalization and equilibrium in generative adversarial nets (gans)","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-16T22:28:27.216802Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.390932Z"},"links":{"citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:27be5fe447c40c29451d9b1b452df95102752c109b7508c6fa2b0103685da86e","observation_id":"99553806-6256-4bc9-89a8-cd82d7a4e646","resolution":{"observed_at":"2026-08-12T20:17:36.390932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:17:36.949791Z","title":"vf+MOWCXlXkD7CB/Zj9tqm3hyT0=","venue":null,"work_id":"7856eaf8-97af-4e4a-b7c0-2434434a72a9","year":2020},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-16T22:28:27.216802Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.394593Z"},"links":{"citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:1b8607590d6872f4dad590be46339a52c1cda52f306333fd95ddf9375b613279","observation_id":"961c3012-d6c7-4f41-ab91-36a32d94b33b","resolution":{"observed_at":"2026-08-12T20:17:36.954194Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:17:36.937416Z","title":"And in the introduc- tion section, we have a contribution list","venue":null,"work_id":"4f773e20-30f7-4815-a6b2-d6bde4a11305","year":null},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-16T22:28:27.216802Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.399572Z"},"links":{"citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:3f9a4f6285cdd5fa489416fe5593c3f123c447622dda3c1eecce76fce383a6ce","observation_id":"d54b067f-39d8-4ab1-bdba-831510ef0bcf","resolution":{"observed_at":"2026-08-12T20:17:36.941654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:17:36.926502Z","title":"Limitations","venue":null,"work_id":"3fe11164-5c30-410f-9690-7d2de5bd5715","year":null},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-16T22:28:27.216802Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.403904Z"},"links":{"citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:d29e5c4175f65b00c9c26bf4f642628360870782fce02bc9e0018ec124f6f44e","observation_id":"a1a4d7ba-c253-4094-ab40-5eb181ccc063","resolution":{"observed_at":"2026-08-12T20:17:36.930341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:17:36.915302Z","title":"We present our theoretical result in Section 4 and the proof is in Appendix B","venue":null,"work_id":"4b3231f9-e613-403e-aa71-629e6538b335","year":null},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-16T22:28:27.216802Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.407613Z"},"links":{"citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:3ec851ac0f0e638c40a5f3ff77ae889ed5406e980221bfa86db6f594e229935a","observation_id":"0155ba99-1d8a-4638-aa00-a973529a342e","resolution":{"observed_at":"2026-08-12T20:17:36.919164Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:17:36.903610Z","title":"Guidelines: • The answer NA means that the paper does not include experiments","venue":null,"work_id":"bb6150a0-fe16-4c27-a8f9-6da7bea2c336","year":null},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-16T22:28:27.216802Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.412052Z"},"links":{"citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:9dda5f54a629d0b0b01c41b7646e15b29088e25ff463cfb69549b1730e2a377c","observation_id":"b0cdfb74-91ad-4fcd-9254-ad5b9abc7f1f","resolution":{"observed_at":"2026-08-12T20:17:36.907775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:17:36.891623Z","title":"Guidelines: • The answer NA means that paper does not include experiments requiring code","venue":null,"work_id":"78d576d8-f456-4747-ab39-b45b7de25f82","year":null},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-16T22:28:27.216802Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.416059Z"},"links":{"citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:28c2b90674df7bf357040852c840efbc49282e94e5a64bf87a799d2418c7ec8b","observation_id":"33486d2d-81cc-46f8-985c-89e0480a87b9","resolution":{"observed_at":"2026-08-12T20:17:36.895880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:17:36.880642Z","title":"We also describe the hyperparameter tuning in the Appendix D.4","venue":null,"work_id":"32f3c1cd-7945-4f8e-96f5-5526517161fc","year":null},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-16T22:28:27.216802Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.420974Z"},"links":{"citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:6ae624d23fbbb84cd8e5386430387beb7713caabd40a9cbf6e7baabe4462c0dd","observation_id":"7601504f-19b7-48d6-abc1-8400b07369ed","resolution":{"observed_at":"2026-08-12T20:17:36.884247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:17:36.869345Z","title":"Guidelines: • The answer NA means that the paper does not include experiments","venue":null,"work_id":"0ba8ea0c-1f83-4a9a-a12a-ab3862ad8169","year":null},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-16T22:28:27.216802Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.425518Z"},"links":{"citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:489d6c0b30e675aefc5d0de21da2b0dd46e4b1d7bdc483524bf78f147cf2403d","observation_id":"e3f0739b-d912-422c-815e-64f036c38ccd","resolution":{"observed_at":"2026-08-12T20:17:36.872996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:17:36.856739Z","title":"Guidelines: • The answer NA means that the paper does not include experiments","venue":null,"work_id":"82fec0d7-0d91-46f3-8c11-70fa3bc5c736","year":null},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-16T22:28:27.216802Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.429220Z"},"links":{"citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:fc391d7a548ff5bb1122965537f515e011a95cc275ae36275d4face12469cd71","observation_id":"6c8fae34-bc3a-4d87-8a50-d06a4c9b1a9b","resolution":{"observed_at":"2026-08-12T20:17:36.861005Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:17:36.844457Z","title":"Guidelines: • The answer NA means that the authors have not reviewed the NeurIPS Code of Ethics","venue":null,"work_id":"571fbd10-3423-4fba-9e0c-9c194aee080b","year":null},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-16T22:28:27.216802Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.433498Z"},"links":{"citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:92fc15f8d89e32c5efcc178fd79e23ad867d87c1f79b2ce049e6584f9f65c381","observation_id":"03c7ca5f-168a-4789-8b6d-8373cf47c48e","resolution":{"observed_at":"2026-08-12T20:17:36.848492Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:17:36.831338Z","title":"Guidelines: • The answer NA means that there is no societal impact of the work performed","venue":null,"work_id":"93e47756-1c0e-4197-a6d6-e111f4cd2317","year":null},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-16T22:28:27.216802Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.437415Z"},"links":{"citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:3ca253feef9133d59668806ac88b6634f48051e50f805f1536d1d2724fb853c1","observation_id":"9398912b-84f5-473b-8888-9b4764310394","resolution":{"observed_at":"2026-08-12T20:17:36.836178Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:17:36.818822Z","title":"Guidelines: • The answer NA means that the paper poses no such risks","venue":null,"work_id":"437eb07a-b9a7-4d91-91bf-563d98300921","year":null},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-16T22:28:27.216802Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.441482Z"},"links":{"citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:7ff905359a12ef0e67dad29864f25f37fbe714ba2fc048cbc02cc6cbc45bd671","observation_id":"9b412b4b-d424-486a-b262-bf11491823fe","resolution":{"observed_at":"2026-08-12T20:17:36.822673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:17:36.806661Z","title":"Guidelines: • The answer NA means that the paper does not use existing assets","venue":null,"work_id":"35855dae-db36-4e21-930c-4b454d23fde8","year":null},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-16T22:28:27.216802Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.445554Z"},"links":{"citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:ff0f44cb11d68f6776e39218b99ae518ed9509010b2ca2cd444aebe675b1f996","observation_id":"eccf6cce-6e09-4549-8514-24227f4aff22","resolution":{"observed_at":"2026-08-12T20:17:36.810650Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:17:36.794851Z","title":"Also, details about the implementation are included in the paper","venue":null,"work_id":"fdc2f4e0-1ed2-43a5-bc81-5821a33f7b57","year":null},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-16T22:28:27.216802Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.449898Z"},"links":{"citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:c355d849fd6784cace5453f2642d7c7012fa7cbd2b345b7a17d3b1f266869882","observation_id":"aadab1a8-e210-4843-bc9d-b1dcb1ae1500","resolution":{"observed_at":"2026-08-12T20:17:36.798768Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:17:36.782207Z","title":"Guidelines: • The answer NA means that the paper does not involve crowdsourcing nor research with human subjects","venue":null,"work_id":"79bb6589-fb78-4af3-abdf-541a24ce17e9","year":null},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-16T22:28:27.216802Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.453463Z"},"links":{"citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:62ab4b045035f77b894a153094ab257b0a773fa1c118611d1f77c10c0fff0578","observation_id":"44774b8e-2c5d-4bd7-b370-8cea819e8347","resolution":{"observed_at":"2026-08-12T20:17:36.786580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:17:36.646475Z","title":"Guidelines: • The answer NA means that the paper does not involve crowdsourcing nor research with human subjects","venue":null,"work_id":"5a7eb5c5-55e7-4e3c-bbe9-cd2e325ca2bf","year":null},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-16T22:28:27.216802Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.456856Z"},"links":{"citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:158943f75b8fd29ea730e0d37f08f5c66a50b36b3030b141969a89ac09bfe3a3","observation_id":"c3afa81f-16bb-4e33-b2b4-90db56f1ed3d","resolution":{"observed_at":"2026-08-12T20:17:36.773313Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-16T22:28:27.216802Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation"},"reference_resolution":{"displayed":53,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":2,"verified_fuzzy":34},"total_outbound_references":53},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 0 inbound Pith citation observations for arXiv:2411.09891."}