{"as_of":"2026-08-13T17:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bd477ecde87ba270886463e322691f57b10340414db0724bdb64f0618a41b628","coverage":[{"denominator":63,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":63,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:03:56.760781Z","state":"measured"},{"denominator":63,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":63,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.23003/citation-record","integrity":"/paper/2505.23003/integrity","json":"/paper/2505.23003/citation-record.json","paper":"/paper/2505.23003"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:04:06.835095Z","title":"Human-level control through deep reinforcement learning,","venue":null,"work_id":"6ad794ad-536a-4de3-afb3-a8db41b49a7e","year":2015},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:51.710833Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:358f902167bcafae4b720eef5ea88eea7ad329bb0ed6ddc58d29cb4002c68538","observation_id":"87394822-1158-4e2a-87a6-348b9e263bd9","resolution":{"observed_at":"2026-08-07T13:04:06.986317Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:04:06.525444Z","title":"Mastering atari, go, chess and shogi by planning with a learned model,","venue":null,"work_id":"744d8215-fef0-4add-8392-e0b38701f7c9","year":2020},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:51.743162Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:ce2d4e85ccc1235d4d2ea9b7db2ad24ecafcee5f2ecf7722fdfd07bf1174251d","observation_id":"8a273763-11b3-472c-952a-ba77d63aa8ee","resolution":{"observed_at":"2026-08-07T13:04:06.678932Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:04:06.195518Z","title":"The limits and potentials of deep learning for robotics,","venue":null,"work_id":"43cae2ad-5a6b-4910-8fc4-a5355e7cbe98","year":2018},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:51.816316Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:8bc16ab0d2b6e4c0a7721644ae0088b9fe0bbc0bab3c73bc03a6376b2b38e1d2","observation_id":"2fd1546c-ea6e-4d82-8626-dde48f253588","resolution":{"observed_at":"2026-08-07T13:04:06.349343Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-07T13:03:51.926044Z","title":"Offline reinforcement learning: Tutorial, review, and perspectives on open problems,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:51.926044Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:fb5784e65ea5658393b58f875fc48852b0574149e1b3c9afae108bbf18225190","observation_id":"002a37b1-83d8-4b53-81ad-d11512796553","resolution":{"observed_at":"2026-08-07T13:03:51.926044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:04:05.999879Z","title":"Mildly conservative q-learning for offline reinforcement learning,","venue":null,"work_id":"2680eed3-b8c5-4518-b585-1e5707ae5c3d","year":2022},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:51.980942Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:46c8d9f4aecffbdc4fbeb0cb33886f1505d5e13c75418a85f99d62c5c3519e37","observation_id":"48e32230-1d57-44db-b425-10a9c96f24d9","resolution":{"observed_at":"2026-08-07T13:04:06.072621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:04:05.911984Z","title":"Morel: Model-based offline reinforcement learning,","venue":null,"work_id":"0ee791b0-008b-40b8-b1df-a89bf30795fb","year":2020},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:52.046563Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:77b187ed4a388b67ff11425935667acc9cf38f143ea2cec840f44c6a1dd21ad5","observation_id":"367462c2-33ff-4703-b988-82980a9bc3ba","resolution":{"observed_at":"2026-08-07T13:04:05.968363Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:04:05.746615Z","title":"A Conservative Approach for Few-Shot Transfer in Off- Dynamics Reinforcement Learning,","venue":null,"work_id":"43964c5e-f566-4e60-b065-146971bf4d16","year":2024},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:52.133369Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:d3d00e455a1eb2cbea13acdb0b023bf2b86851be871082f876095aada186ce5e","observation_id":"affdc510-2133-4651-982d-fd29ce0e93f1","resolution":{"observed_at":"2026-08-07T13:04:05.834644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:04:05.550744Z","title":"A Comprehensive Survey of Cross-Domain Policy Transfer for Embodied Agents,","venue":null,"work_id":"c20cfccc-82d4-4711-8e7f-bbe404da4464","year":2024},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:52.254160Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:def90b45066fdb8556dbebd296e21ce6f972ac563469522a3bb3b97ad33bdb0d","observation_id":"09fd12e4-4552-42df-8036-c29b447f1380","resolution":{"observed_at":"2026-08-07T13:04:05.656151Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:04:05.373399Z","title":"OCEAN-MBRL: Offline Conservative Exploration for Model-Based Offline Reinforcement Learning,","venue":null,"work_id":"7c501c24-107c-456e-b625-3dca639e2948","year":2024},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:52.315486Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:67bd8a4c0e1eb5c4aa59a4334fa99edc6efce774bb07f98d0054eb59d6dde9cc","observation_id":"e7d05e23-4de3-44f3-900e-bc388edabed5","resolution":{"observed_at":"2026-08-07T13:04:05.463189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:04:05.215743Z","title":"When to trust your simulator: Dynamics-aware hybrid offline-and-online reinforcement learning,","venue":null,"work_id":"15f0947a-ca42-4b58-8ca5-9e96c0cbca2e","year":2022},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:52.439479Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:5475e4e587424d1b5b5ec6bc4ea9ebc5694ec9b85685542802fdcc1eb2707597","observation_id":"c4838456-3f8f-40b5-8859-c6eb7ffa252a","resolution":{"observed_at":"2026-08-07T13:04:05.277973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.12716","last_updated":"2025-04-16T06:03:43Z","snapshot_observed_at":"2026-08-13T10:07:44.245947Z","submitted_at":"2023-09-22T08:58:22Z","title":"H2O+: An Improved Framework for Hybrid Offline-and-Online RL with Dynamics Gaps","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.12716","snapshot_observed_at":"2026-08-07T13:03:52.498739Z","title":"H2O+: An Improved Framework for Hybrid Offline-and-Online RL with Dynamics Gaps,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:52.498739Z"},"links":{"cited_paper":"/paper/2309.12716","citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:8f3644ab1528c911eaacff8656eb004d76aff7236a4ea1427e8543414835a3b5","observation_id":"5fde591e-9809-4b8e-ad12-2313ea00fd07","resolution":{"observed_at":"2026-08-07T13:03:52.498739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:04:05.057106Z","title":"DARA: Dynamics-Aware Reward Augmentation in Offline Reinforcement Learning,","venue":null,"work_id":"c9579982-0328-4cfe-830d-74c86ee4302e","year":2022},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:52.536485Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:fd3abf848c91203070f9bfb2a94ba8b1ce20f9f3d8c3d5c4e51d2d8c787fdb56","observation_id":"30a34d6f-bd9f-48d5-9f3d-c40f5d21773b","resolution":{"observed_at":"2026-08-07T13:04:05.143507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:04:04.938288Z","title":"Beyond ood state actions: Supported cross-domain offline reinforcement learning,","venue":null,"work_id":"4a83fd54-2859-4eb7-ab51-09bf3275fcdd","year":2024},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:52.636075Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:e9add1a107209b432d5fc33e74f704fa0e6e58809e564d3e041fbf77d91a45cc","observation_id":"9863a988-28be-49ba-85bb-7bd9587d266e","resolution":{"observed_at":"2026-08-07T13:04:04.992162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:04:04.783445Z","title":"Contrastive Rep- resentation for Data Filtering in Cross-Domain Offline Reinforcement Learning,","venue":null,"work_id":"3a311f34-f205-4167-8688-7d2ab4b29136","year":2024},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:52.683004Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:20ce0a0dd2dfccf3082d3ddd6275b126a13431eac72feaf34611fec87f1d4c88","observation_id":"148637c7-3901-48ea-a4e7-b42781ba9324","resolution":{"observed_at":"2026-08-07T13:04:04.872205Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:04:04.632830Z","title":"Off- Dynamics Reinforcement Learning: Training for Transfer with Domain Classifiers,","venue":null,"work_id":"333badb8-1547-4a8c-a324-4430cc58ebe5","year":2021},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:52.755958Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:0f418519d651da93e4eabd369168c9c681cf035b96456a7058710f57628955d0","observation_id":"dd89e5db-4dc4-4870-8fa0-e7c3a389cd44","resolution":{"observed_at":"2026-08-07T13:04:04.684468Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:04:04.435888Z","title":"Policy Learning for Off-Dynamics RL with Deficient Support,","venue":null,"work_id":"d45afcf6-a6aa-4f40-8aac-8ff3f0ebef8e","year":2024},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:52.822622Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:8a1309c6d7ef6729b6a4c159089704b6b8874696c693f25503c739bd8af65a29","observation_id":"a76b4118-69e9-4131-85c0-7b2e7cad8f5f","resolution":{"observed_at":"2026-08-07T13:04:04.555221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:04:04.160031Z","title":"Cross- domain policy adaptation via value-guided data filtering,","venue":null,"work_id":"b7178ec5-70e9-497f-a961-2189f08b4a86","year":2024},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:52.875747Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:892abfaefe2d029ecda45a6d6eaa779e6e06fa68d3b02a3fd63cb2c2b7b0ed14","observation_id":"3ad239e2-1cd4-45ff-9689-fa26d57387e1","resolution":{"observed_at":"2026-08-07T13:04:04.311896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:04:03.981002Z","title":"Cross-Domain Policy Adaptation by Capturing Representation Mismatch,","venue":null,"work_id":"085248d4-3705-4617-a051-74777ee63923","year":2024},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:52.993127Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:aa21145b3f7591288347c754762b2a4d6365f58670c781f045be58a86168019c","observation_id":"02d113a7-65a0-41ba-ae77-7c7499ad273f","resolution":{"observed_at":"2026-08-07T13:04:04.044759Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:04:03.827104Z","title":"Sim-to-real transfer of robotic control with dynamics randomization,","venue":null,"work_id":"a4c344f0-0702-4713-9963-f9e332f2b62c","year":2018},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:53.042357Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:fdd5dcbc2f546043e497af077cad7e8b75ed022816927c3c41630435bb7b152d","observation_id":"7da39e0c-304f-4272-994f-29a4ef906acb","resolution":{"observed_at":"2026-08-07T13:04:03.882049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:04:03.585628Z","title":"Domain randomization for transferring deep neural networks from simulation to the real world,","venue":null,"work_id":"ab6f2d8a-b717-4248-9399-0454ddebf100","year":2017},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:53.111229Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:9defd32e37e030fed487c2463d506b24fb3df044864dc7415afbea79a1dbf429","observation_id":"145cbc1a-6d94-4d4b-b850-8b08b5f3167e","resolution":{"observed_at":"2026-08-07T13:04:03.661930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:04:03.285183Z","title":"CAD2RL: Real Single-Image Flight Without a Single Real Image,","venue":null,"work_id":"bed43791-bdd3-45ba-a8a4-5378679a9eee","year":2017},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:53.189497Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:eda3eaabaca0c595ca86a3aa77feb9ebae170e8878efbf967adbeee9a37a4e86","observation_id":"32e376c8-f2e8-44c5-b9de-45dcffe9276f","resolution":{"observed_at":"2026-08-07T13:04:03.454026Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:04:03.037592Z","title":"Neural networks for control and system identification,","venue":null,"work_id":"397bfe3b-1f47-4f97-a1cd-e9516c638e8e","year":1989},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:53.285895Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:2b5f074d40ccbc5124cf2f42876de1c45d382cb29c429b7f20de08e3e6291c5a","observation_id":"c9fb2cf2-adc1-4e99-9760-fa4483dbd27a","resolution":{"observed_at":"2026-08-07T13:04:03.193874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:04:02.844915Z","title":"Fast model identification via physics engines for data-efficient policy search,","venue":null,"work_id":"dfbf3cd8-160c-47b2-b01c-112d192dd144","year":2018},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:53.372933Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:adeb3d19850f4d503f678931de7124d356abf2c091df3fff328d114df182176d","observation_id":"9c911f14-a743-456c-a728-989bd090d3d9","resolution":{"observed_at":"2026-08-07T13:04:02.922280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:04:02.557221Z","title":"Closing the sim-to-real loop: Adapting simulation randomization with real world experience,","venue":null,"work_id":"17ddd398-bced-45f6-b23c-aa9488a9def3","year":2019},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:53.422518Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:ac630cfdc2112a3441a4d4bfd12c531ee008a72bb0a0e8e3022be9640bc1038c","observation_id":"1a20c7f0-0000-405a-9f1a-227ddeb4d42f","resolution":{"observed_at":"2026-08-07T13:04:02.690470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:04:02.325714Z","title":"Model-agnostic meta-learning for fast adaptation of deep networks,","venue":null,"work_id":"e963f337-9333-4228-b18a-14198576243a","year":2017},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:53.516978Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:3f5e9a72bd99be4c94bc97f6eb817439d31f6b6a2c23c12ae646204a9715f717","observation_id":"6eea4444-5e06-4c27-92c9-c004d784e2b6","resolution":{"observed_at":"2026-08-07T13:04:02.419331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:04:02.169100Z","title":"Learning to Adapt in Dynamic, Real-World Environments through Meta- Reinforcement Learning,","venue":null,"work_id":"5ed5f73a-0e8d-467a-9965-e5e21a897192","year":2018},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:53.596714Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:3eff10ac587ada99d82d37f041b58f8e2ad3290b91fbf097af7308261809dd81","observation_id":"580266bb-4c62-4cdf-846c-8794ae4b81a2","resolution":{"observed_at":"2026-08-07T13:04:02.249818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:04:01.945718Z","title":"Zero-shot policy transfer with disentangled task representation of meta- reinforcement learning,","venue":null,"work_id":"d9cd7463-b605-4eed-97f8-cddc7fced962","year":2023},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:53.634400Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:f7473ea16fc71516fcbf512cda5ddf6349e5bac9da18fb3b687e280e065dd8b7","observation_id":"5ce9a842-9c91-4969-b833-f743813ed8bd","resolution":{"observed_at":"2026-08-07T13:04:02.040841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:04:01.732571Z","title":"Provably good batch off- policy reinforcement learning without great exploration,","venue":null,"work_id":"561b72dd-d493-4d5b-bdf7-910d7470fd1c","year":2020},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:53.694525Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:2c64463878563477005b55d77478298ac7ebcf87ff6dfc764eaa349aec4b0c30","observation_id":"c68b46a9-de9d-43a5-ac8d-94f6ba9bd43d","resolution":{"observed_at":"2026-08-07T13:04:01.814857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:04:01.476895Z","title":"Conservative q-learning for offline re- inforcement learning,","venue":null,"work_id":"651aebc0-b54f-4b14-9aa2-ff8b7192467e","year":2020},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:53.799782Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:cb75c33f3da3a60cf3be0a20896a14e6f3d385172ec2bf80dd68c35ea055e994","observation_id":"59de49a2-ba08-4b3b-9e75-fa038ee6f5aa","resolution":{"observed_at":"2026-08-07T13:04:01.591693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:04:01.239298Z","title":"Rambo-rl: Robust adversarial model-based offline reinforcement learning,","venue":null,"work_id":"c6649f0b-4d21-4a33-96b6-4010220cc19b","year":2022},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:53.855773Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:788f8b83d50dd363c077b4473db826f7cee3626af8effed511890f8dbbda0c00","observation_id":"3c564a64-660a-468b-84fb-8d5875d12b02","resolution":{"observed_at":"2026-08-07T13:04:01.376539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:04:01.025003Z","title":"Robust dynamic programming,","venue":null,"work_id":"252620e0-8297-4111-9df2-56ececd70ba3","year":2005},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:53.936953Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:07b11b04df1eab4ba7e4affcad70fedf2d75e0b91bc138dc7437e850214ea325","observation_id":"b13760c2-771e-4d62-a5a2-2f8a37e9708c","resolution":{"observed_at":"2026-08-07T13:04:01.119170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:04:00.811696Z","title":"Robust control of Markov decision processes with uncer- tain transition matrices,","venue":null,"work_id":"5ffced36-5f9d-4039-acf7-1feb91a7d480","year":2005},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:54.010480Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:4bf9745a5710b55ea72140a4543cc1db66ec9487cd5499cfc6d2d5467ca6ef76","observation_id":"26094e38-8cbf-4fdd-b247-a7c846d25e51","resolution":{"observed_at":"2026-08-07T13:04:00.898945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:04:00.585977Z","title":"Distributionally robust Markov decision processes,","venue":null,"work_id":"b20c4496-034b-458c-b148-36244eeaf3e0","year":2010},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:54.110255Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:1b1db0e7e07ae03095d8b09fb7cac47f8fa87824557dec5abf4401d9d277f5ce","observation_id":"e86b3880-c6eb-41b1-95b6-9a4b3ac32919","resolution":{"observed_at":"2026-08-07T13:04:00.673085Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:04:00.393500Z","title":"Policy gradient method for robust reinforcement learning,","venue":null,"work_id":"8aea64f9-14fe-4b8c-96b3-0aa87e1d71f6","year":2022},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:54.242757Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:0b060c0f43372460931f94391fc49949a8272eb47c78732c6b67d22774a16300","observation_id":"873468c7-91db-4ae5-9636-29fed1e512db","resolution":{"observed_at":"2026-08-07T13:04:00.460610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10439","last_updated":"2023-06-07T12:20:17Z","snapshot_observed_at":"2026-08-13T13:17:57.783029Z","submitted_at":"2022-12-20T17:14:14Z","title":"Policy Gradient in Robust MDPs with Global Convergence Guarantee","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10439","snapshot_observed_at":"2026-08-07T13:03:54.312568Z","title":"On the convergence of policy gradient in robust mdps,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:54.312568Z"},"links":{"cited_paper":"/paper/2212.10439","citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:4d135bc5969f0cd67eff6b05721b2d267d79f1d910e3aae131155613edd9b4a0","observation_id":"6f1da6b5-b889-49a8-8390-6e3e00541838","resolution":{"observed_at":"2026-08-07T13:03:54.312568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:04:00.216400Z","title":"Toward theoretical understandings of robust markov decision processes: Sample complexity and asymptotics,","venue":null,"work_id":"742c2353-db84-44a6-b48e-0dc83c4bca15","year":2022},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:54.394415Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:85df01781951d6f9c5ff4c783f145e576efb4b7687bce50d0153b8ed4c4caa79","observation_id":"3495fd71-931c-4174-9809-1c43c14856cf","resolution":{"observed_at":"2026-08-07T13:04:00.292564Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:04:00.041102Z","title":"Improved sample complexity bounds for distri- butionally robust reinforcement learning,","venue":null,"work_id":"0577e686-e77c-4db5-b540-64afc8706206","year":2023},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:54.478229Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:2238f4809014ee138e142faeb59b70c4d92df063e098f2425710a6a0eb7d1331","observation_id":"a645f45b-6780-4488-b6bc-314e8be9efa1","resolution":{"observed_at":"2026-08-07T13:04:00.108759Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:03:59.861373Z","title":"Online robust reinforcement learning with model uncertainty,","venue":null,"work_id":"30e1fcef-905b-4e42-ba13-8e1ec8fe31ce","year":2021},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:54.549558Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:1ef65ad1509ab819081b08aba1598b554e6855e545ce1b2345aa329e255a2275","observation_id":"369eb0e5-810c-41d8-9b61-7a9e48e8c098","resolution":{"observed_at":"2026-08-07T13:03:59.946253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.13841","last_updated":"2022-09-28T05:18:20Z","snapshot_observed_at":"2026-08-13T14:18:00.030417Z","submitted_at":"2022-09-28T05:18:20Z","title":"Online Policy Optimization for Robust MDP","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.13841","snapshot_observed_at":"2026-08-07T13:03:54.632287Z","title":"Online policy optimization for robust mdp,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:54.632287Z"},"links":{"cited_paper":"/paper/2209.13841","citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:18b1883c7dd32016ac51035c02c837ab16d7d2dc8b8b9ee3be54f6f1b1846f88","observation_id":"49f95e52-ae19-4839-b84e-00120c6e8c93","resolution":{"observed_at":"2026-08-07T13:03:54.632287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:03:59.657871Z","title":"Finite-sample re- gret bound for distributionally robust offline tabular reinforcement learning,","venue":null,"work_id":"707ec533-dfc1-4657-9949-141e2d3ddd95","year":2021},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:54.736585Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:547e8eeadec26c370874d453ef2b512fb9b71793b3777065d0854272a9b11043","observation_id":"1d4a5a95-50c4-4cc0-9296-6ae259515ffb","resolution":{"observed_at":"2026-08-07T13:03:59.744758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:03:59.540289Z","title":"Robust reinforcement learning using offline data,","venue":null,"work_id":"a31574c2-99d6-4507-ba4c-f55c1c8fab97","year":2022},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:54.815160Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:f8f0a7c619be546a9c63bb08345853c52f82f61778045b5e31c6632dd1712bbf","observation_id":"03022763-18cb-4a4d-9113-1f771d41a8e7","resolution":{"observed_at":"2026-08-07T13:03:59.635353Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:03:59.396118Z","title":"Learning models with uniform performance via distri- butionally robust optimization,","venue":null,"work_id":"5d6a62d7-6d82-4c84-8b6d-7a1e6377f1e9","year":2021},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:54.881160Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:f6cfb68ff57ff3cbceae1a54feb2a4ddf49db52e3c40053cc4da35d7b1d5a3bb","observation_id":"56dad26c-385e-40dd-802d-5074168bff4a","resolution":{"observed_at":"2026-08-07T13:03:59.465546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.05767","last_updated":"2023-12-28T20:16:50Z","snapshot_observed_at":"2026-08-13T14:47:13.992226Z","submitted_at":"2022-08-11T11:55:31Z","title":"Distributionally Robust Model-Based Offline Reinforcement Learning with Near-Optimal Sample Complexity","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.05767","snapshot_observed_at":"2026-08-07T13:03:54.976956Z","title":"Distributionally robust model-based offline reinforcement learning with near-optimal sample complexity,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:54.976956Z"},"links":{"cited_paper":"/paper/2208.05767","citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:a0f37118f94817812d603277137c2c5d21be352a23f0a00878637b5883ec9c25","observation_id":"c8cd894a-0807-4521-b6a3-3d3e495534f1","resolution":{"observed_at":"2026-08-07T13:03:54.976956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.06620","last_updated":"2023-01-27T14:08:06Z","snapshot_observed_at":"2026-08-13T14:27:08.148173Z","submitted_at":"2022-09-14T13:17:59Z","title":"Distributionally Robust Offline Reinforcement Learning with Linear Function Approximation","version":3},"cited_work":{"arxiv_id":"2209.06620","doi":null,"metadata_source":"pith","pith_arxiv_id":"2209.06620","snapshot_observed_at":"2026-08-07T13:03:56.941227Z","title":"Distributionally Robust Offline Reinforcement Learning with Linear Function Approximation","venue":"cs.LG","work_id":"28e6b3af-8e05-481b-a522-7738a30421e0","year":2022},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:55.069175Z"},"links":{"cited_paper":"/paper/2209.06620","citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:291f42314c5824b6cabdbfc336f9f4ff3421867df296d7bff0baa69807154b59","observation_id":"b34cba95-4416-4216-b7b1-bb5a0b928fc9","resolution":{"observed_at":"2026-08-07T13:03:57.022169Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:03:59.285479Z","title":"Double pessimism is provably effi- cient for distributionally robust offline reinforcement learning: Generic algorithm and robust partial coverage,","venue":null,"work_id":"874bf8d2-c3e8-4821-a4e6-3ef535187de6","year":2024},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:55.166807Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:daf090939c0545c5bcda2460eda516da721f33edadbcc63479333ed0884105d0","observation_id":"41e46250-17b2-4f09-b02c-d4b8c80b38e7","resolution":{"observed_at":"2026-08-07T13:03:59.332299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:03:59.131917Z","title":"Using simulation and domain adaptation to improve efficiency of deep robotic grasping,","venue":null,"work_id":"fdcea957-fdb5-46eb-abf1-b97cf86e85ed","year":2018},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:55.260086Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:d66a3fb737002e99c3751ca5d918db4bc25d0dc6cf99c1500b291208631d5a55","observation_id":"48ea1df1-0783-4823-a819-bd7e56b38e09","resolution":{"observed_at":"2026-08-07T13:03:59.209500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:03:59.028135Z","title":"Darla: Improving zero-shot transfer in reinforcement learning,","venue":null,"work_id":"ab44a340-15e5-4035-a6d3-3d39c62488a9","year":2017},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:55.384899Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:9769fe8033dca203a7d5150e3391760b7f5a0a4cf2cfea6a79455f47fdcff946","observation_id":"a4b886d6-de1f-4d63-bf24-368515875f3c","resolution":{"observed_at":"2026-08-07T13:03:59.063394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-07T13:03:55.466436Z","title":"D4rl: Datasets for deep data-driven reinforcement learning,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:55.466436Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:adfcd065a1144d5bb1e55bd652d64dd6510508397bfd9b6a43e32f2415fac31e","observation_id":"8e15cec3-3307-469b-9806-3a2877d65008","resolution":{"observed_at":"2026-08-07T13:03:55.466436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:03:58.929243Z","title":"Mopo: Model-based offline policy optimization,","venue":null,"work_id":"6c1536f2-c7be-451e-9df5-99c03f9a9d59","year":2020},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:55.540687Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:2c07d4b789ab209d3af4766899201e8921c353c4fb2342636a622c58aa817a52","observation_id":"c59f9d8e-47e3-4e64-afad-b54722738100","resolution":{"observed_at":"2026-08-07T13:03:58.973425Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:03:58.786993Z","title":"Robust adversarial reinforce- ment learning,","venue":null,"work_id":"712d5bd0-d7fd-4045-a0c0-cd0ef9251eb5","year":2017},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:55.636939Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:298095ebcbd3b235bcc08041d5f6af1efdfaa4d292553cc57322e6d60ae7ec28","observation_id":"afe29559-3ad9-4b6b-a139-6719ce0d4608","resolution":{"observed_at":"2026-08-07T13:03:58.835115Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:03:58.655016Z","title":"Exponential bellman equation and im- proved regret bounds for risk-sensitive reinforcement learning,","venue":null,"work_id":"0bb17389-66ec-4983-9027-7b61724dcecd","year":2021},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:55.672126Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:1c10ddf57a8676dc55bf54a7b851f5ae4ed7f283fef48f805dc96f32dd1f5882","observation_id":"81d67441-b454-4d96-a0e1-162ab450fdb3","resolution":{"observed_at":"2026-08-07T13:03:58.699419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:03:58.544497Z","title":"One risk to rule them all: A risk-sensitive perspective on model-based offline reinforcement learning,","venue":null,"work_id":"6f984d19-9c21-4324-a682-e84ba89a120b","year":2024},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:55.758678Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:937612ad7427fdf7113da36b61b1ff320c1f12679234456afc62b7387660b7a7","observation_id":"50448d80-034c-4d4f-b16c-face20210058","resolution":{"observed_at":"2026-08-07T13:03:58.610582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:03:58.413993Z","title":"Corruption-robust offline reinforcement learning,","venue":null,"work_id":"70b16d62-e446-455c-8303-5cb6f49dafa4","year":2022},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:55.913745Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:eddf4d727fee75f403d19186798d83410aa70fd03f7f324cc5fa6a8291e1fe53","observation_id":"435bff98-ffe5-417d-90ea-eb3073ccf41d","resolution":{"observed_at":"2026-08-07T13:03:58.451377Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:03:58.273380Z","title":"Corruption-robust offline reinforcement learning with general function approximation,","venue":null,"work_id":"b5db8aaa-30e3-4eb5-ba08-35044d9d7a43","year":2024},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:55.982637Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:53630d79f8e79a71548ff8d9cd74c053fffb85280cea20ed0727e3128bc9b3ec","observation_id":"c21a02b3-c07a-4a0d-9b38-4d1252472888","resolution":{"observed_at":"2026-08-07T13:03:58.317081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:03:58.168787Z","title":"Distributionally robust stochastic programming,","venue":null,"work_id":"c09c1808-1afa-4890-8463-22feec40ac06","year":2017},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:56.038538Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:c1b65b1b2c7b8143c819cc7c0df2833d6a71f3841c7485f762fc2aae38358ae4","observation_id":"a2d6c9af-417d-42bc-b9ff-29439b77f3f2","resolution":{"observed_at":"2026-08-07T13:03:58.215785Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:03:58.063657Z","title":"Algorithmic Framework for Model-based Deep Reinforcement Learning with Theoretical Guarantees,","venue":null,"work_id":"5d47959b-e7fb-431c-b20a-bb8623369de9","year":2018},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:56.144266Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:f841bc69c39baebdce1dd270599efb5618b70ea9f2907d51893c7603fb6dd096","observation_id":"0af4f2ac-0178-4c0c-ba3b-b66a8bc1d4f7","resolution":{"observed_at":"2026-08-07T13:03:58.100122Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:03:57.847717Z","title":"Deep reinforcement learning in a handful of trials using probabilistic dynamics models,","venue":null,"work_id":"57e965a6-3be4-43a6-abed-306150de9427","year":2018},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:56.272869Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:29de2cb9417902ed8692cc83bea613b6945d9282c2816bab2b0a6f37484f791d","observation_id":"f8fd7989-8a91-4d0f-8422-8aeaca0fd5e8","resolution":{"observed_at":"2026-08-07T13:03:57.940029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:03:57.670500Z","title":"Model-Bellman inconsistency for model-based offline reinforcement learning,","venue":null,"work_id":"33011060-d31c-49b6-b8ff-d5b75f3aa737","year":2023},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:56.341894Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:f352ffa286a53ee4b4761c0bdf215083f5df63a8193d93faedb998fabd400263","observation_id":"71c50236-d4b2-4e64-9896-da802303d253","resolution":{"observed_at":"2026-08-07T13:03:57.745498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:03:57.510448Z","title":"Uncertainty-driven trajectory truncation for data augmentation in offline reinforcement learning,","venue":null,"work_id":"7b22f59e-dbf9-4575-81aa-38816d180776","year":2023},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:56.426774Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:9da68e64870a86e845ad5359daa1e975300939462fa249513c26dd61420d4eda","observation_id":"698b2d49-2b42-478f-a274-f2f6dd91adf3","resolution":{"observed_at":"2026-08-07T13:03:57.606895Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1511.05952","last_updated":"2016-02-25T17:55:31Z","snapshot_observed_at":"2026-08-12T23:53:55.764215Z","submitted_at":"2015-11-18T20:54:44Z","title":"Prioritized Experience Replay","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.05952","snapshot_observed_at":"2026-08-07T13:03:56.555963Z","title":"Prioritized experience replay,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:56.555963Z"},"links":{"cited_paper":"/paper/1511.05952","citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:c31c2d05d137585b459e348953a400a1c52c605051528044b94f66419d5d1e80","observation_id":"ac45104f-9f24-472f-b7e2-db601b000a2b","resolution":{"observed_at":"2026-08-07T13:03:56.555963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:03:57.343821Z","title":"labml.ai Annotated Paper Implementations,","venue":null,"work_id":"e8c66e09-9f8b-4e91-ae2e-ebba93cf46c7","year":2020},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:56.620245Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:45a089e4186ca90fa3387b7fc0e9db2dc76639dfda3659e76f6f6c50feb68260","observation_id":"e63780ca-5c5c-49d7-966c-9d136d33e92a","resolution":{"observed_at":"2026-08-07T13:03:57.446148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.05244","last_updated":"2022-06-21T13:52:30Z","snapshot_observed_at":"2026-08-13T16:43:25.738862Z","submitted_at":"2022-02-10T18:50:25Z","title":"REvolveR: Continuous Evolutionary Models for Robot-to-robot Policy Transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.05244","snapshot_observed_at":"2026-08-07T13:03:56.703511Z","title":"Revolver: Continuous evolutionary models for robot-to-robot policy transfer,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:56.703511Z"},"links":{"cited_paper":"/paper/2202.05244","citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:2f9c1adb04bcad446ba5815cc7d0f04271ef7409b4ca9eefb37a7f4f41e33940","observation_id":"37130817-48e1-4fa4-8085-b305024b6914","resolution":{"observed_at":"2026-08-07T13:03:56.703511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:03:57.171160Z","title":"-m\": multi comp, “-s","venue":null,"work_id":"1f3a3880-eec2-4e11-8410-8b6faf01c625","year":2000},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:56.760781Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:b69c877a44db67bc2af147eac1b3f1623e244a59a60121dbe3ec116e85ed927e","observation_id":"0a77678a-1738-4910-8d0f-efec2c3f7d5a","resolution":{"observed_at":"2026-08-07T13:03:57.237850Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning"},"reference_resolution":{"displayed":63,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":8,"verified_exact":1,"verified_fuzzy":54},"total_outbound_references":63},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 63 of 63 outbound references and 0 inbound Pith citation observations for arXiv:2505.23003."}