{"as_of":"2026-08-09T21:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f0117748bc759dc1d25601100b7389190352143f370336966128218b3027efcd","coverage":[{"denominator":94,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":94,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:19:29.466784Z","state":"measured"},{"denominator":96,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":96,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T22:51:20.005562Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-28T22:52:44.957699Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-09T13:36:58.088832Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"cited_work":{"arxiv_id":"2507.06111","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.06111","snapshot_observed_at":"2026-06-28T22:52:44.957699Z","title":"Safe domain randomization via uncertainty-aware out-of-distribution detection and policy adaptation","venue":null,"work_id":"2a13e45b-f5b4-40ca-99d0-da23ab69497c","year":2025},"citing_paper":{"arxiv_id":"2604.08780","last_updated":"2026-04-09T21:31:24Z","snapshot_observed_at":"2026-07-06T22:57:50.266735Z","submitted_at":"2026-04-09T21:31:24Z","title":"Toward Hardware-Agnostic Quadrupedal World Models via Morphology Conditioning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T16:53:48.187942Z"},"links":{"cited_paper":"/paper/2507.06111","citing_paper":"/paper/2604.08780"},"observation_digest":"sha256:7b6155ecf8518ef029984687d3ac7f08a52320d6db1a4ccabcfd5e3ba3e6375a","observation_id":"574d3609-1717-4005-9922-f229e73f6ee2","resolution":{"observed_at":"2026-05-11T07:56:00.604939Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-09T13:36:58.088832Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"cited_work":{"arxiv_id":"2507.06111","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.06111","snapshot_observed_at":"2026-06-28T22:52:44.957699Z","title":"Safe domain randomization via uncertainty-aware out-of-distribution detection and policy adaptation","venue":null,"work_id":"2a13e45b-f5b4-40ca-99d0-da23ab69497c","year":2025},"citing_paper":{"arxiv_id":"2606.00350","last_updated":"2026-05-29T20:42:30Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T20:42:30Z","title":"Drift Q-Learning","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-06-28T22:51:20.005562Z"},"links":{"cited_paper":"/paper/2507.06111","citing_paper":"/paper/2606.00350"},"observation_digest":"sha256:fc751042c768448b9531e3ac3f16122fdda21c908f1e9f2d371f96d8a4f6fcfe","observation_id":"3d2a5ce3-47b7-41ea-91ad-ee34b05327d8","resolution":{"observed_at":"2026-06-28T22:52:44.959420Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.06111/citation-record","integrity":"/paper/2507.06111/integrity","json":"/paper/2507.06111/citation-record.json","paper":"/paper/2507.06111"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.268005Z","title":"MIT press, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-09T13:36:58.088832Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.268005Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:572c56cc13436e3e6174c2af5851bbbdc54d4a0a83f37803df820899f0eae73f","observation_id":"1526371c-a675-4c97-814b-746330775ae9","resolution":{"observed_at":"2026-08-06T19:19:29.268005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-06T19:19:29.270830Z","title":"Offline reinforcement learning: Tutorial, review, and perspectives on open problems.arXiv preprint arXiv:2005.01643, 2020","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-09T13:36:58.088832Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.270830Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:01f5b620f218c8eaf7c6398a53a99f39f49e26356e09757e5f78226fbb0e8bcc","observation_id":"4bf1724f-2714-4f22-86e8-f3e3a134e07f","resolution":{"observed_at":"2026-08-06T19:19:29.270830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.273775Z","title":"Reinforcement learning in robotics: A survey","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-09T13:36:58.088832Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.273775Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:93ecc92af309ce3b503ceb7599449d4d040ba62f43a2fe6bef7e617947e57000","observation_id":"ba244a59-48ea-448b-a35c-4ea07b740dff","resolution":{"observed_at":"2026-08-06T19:19:29.273775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.276094Z","title":"Toward self-driving processes: A deep reinforcement learning approach to control.AIChE journal, 65(10):e16689, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-09T13:36:58.088832Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.276094Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:cc157281c131d9ba8bb5464e7969c13ba6191fea28f3dbbe68398ef5b8fed185","observation_id":"56859d3c-2cd0-4236-95af-df70614d7519","resolution":{"observed_at":"2026-08-06T19:19:29.276094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.278337Z","title":"Sim-to-real transfer in deep reinforcement learning for robotics: a survey","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-09T13:36:58.088832Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.278337Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:6ce41f5103466967d178bfc670c577a7af06b684a6fa7b731e5917891ac13c8b","observation_id":"5073135a-bf34-45ec-9085-8493b5d7d39f","resolution":{"observed_at":"2026-08-06T19:19:29.278337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.04982","last_updated":"2022-05-24T06:22:12Z","snapshot_observed_at":"2026-08-05T16:48:46.665556Z","submitted_at":"2021-07-11T06:40:02Z","title":"Out-of-Distribution Dynamics Detection: RL-Relevant Benchmarks and Results","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.04982","snapshot_observed_at":"2026-08-06T19:19:29.280573Z","title":"Out-of-distribution dynamics detection: Rl-relevant benchmarks and results.arXiv preprint arXiv:2107.04982, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-09T13:36:58.088832Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.280573Z"},"links":{"cited_paper":"/paper/2107.04982","citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:d83e942c8fb52c5bfd7f724cce60599a7a925186809f15125c67a896464c9eef","observation_id":"15a92a1b-465b-48e0-bb1d-e67a041c145d","resolution":{"observed_at":"2026-08-06T19:19:29.280573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.283011Z","title":"Off-dynamics reinforcement learning: Training for transfer with domain classifiers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-09T13:36:58.088832Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.283011Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:fb07de159e569d59fa1091ad462d0fd895b7238f230de1fa4a61938cff2500e1","observation_id":"21553616-b72f-42f5-9ff6-d9b1a9d7554f","resolution":{"observed_at":"2026-08-06T19:19:29.283011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.285338Z","title":"Robust dynamic programming.Mathematics of Operations Research, 30(2):257–280, 2005","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-09T13:36:58.088832Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.285338Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:7624988fc1cdce4eeb595043d1eb1ee4366b7aded3ed846bef3cfa2c89855132","observation_id":"dbbeceac-cdb8-4aa8-9620-a67d693c4e8a","resolution":{"observed_at":"2026-08-06T19:19:29.285338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.287354Z","title":"Offline-to-online reinforcement learning via balanced replay and pessimistic q-ensemble","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-09T13:36:58.088832Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.287354Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:e300d27dc64539858ad81e6db2a5a3689b858e42e62b802647e2440248000371","observation_id":"028831bd-968d-4d86-babd-2a5893be2385","resolution":{"observed_at":"2026-08-06T19:19:29.287354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.289344Z","title":"Adaptive policy learning for offline-to-online reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-09T13:36:58.088832Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.289344Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:56300caef8a7b3dc31c6e37fb21b1d8bd442cd5e780a962a02434c21a847dba0","observation_id":"2da0939b-9d49-4471-b2dc-9fccee67e3ac","resolution":{"observed_at":"2026-08-06T19:19:29.289344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.291520Z","title":"Domain randomization for transferring deep neural networks from simulation to the real world","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-09T13:36:58.088832Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.291520Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:988ae22be5b169f921f304dd18ce7fb3c0af381316eabe7bb9c938e3f55e0adf","observation_id":"22ed0b8b-7e03-4621-a290-1cf07f5008e1","resolution":{"observed_at":"2026-08-06T19:19:29.291520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.293612Z","title":"Pal, and Liam Paull","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-09T13:36:58.088832Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.293612Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:ccd9b6e25a10228a08c66bfca6e8dd5b5aef8432dc583530f4be5620a5d45036","observation_id":"0b98c3b2-914a-4c4f-a18a-98557b79b8e0","resolution":{"observed_at":"2026-08-06T19:19:29.293612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.296109Z","title":"Mujoco: A physics engine for model-based control","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-09T13:36:58.088832Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.296109Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:c240a7dbafb7443d328303723620b4c3a96a722ba4374d89bb2b19cad92f783c","observation_id":"52067f97-ed3b-4a8f-9b0a-32e2eed5252f","resolution":{"observed_at":"2026-08-06T19:19:29.296109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.298094Z","title":"Towards a generic solution for inspection of industrial sites","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-09T13:36:58.088832Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.298094Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:a75bbe4119167bf249f41515ba2fa1ecc6103a178c84e6d6eb60fad7feb6b25b","observation_id":"2db63577-4955-4e25-b994-5b2c2564a860","resolution":{"observed_at":"2026-08-06T19:19:29.298094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.300018Z","title":"Offline reinforcement learning with implicit q-learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-09T13:36:58.088832Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.300018Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:b20cc1b14fdaa78137b2795c246f52fcb9d26bfe2cdc94913006bed6921beecb","observation_id":"bc1b65b0-5a98-4c53-8587-fff94163a914","resolution":{"observed_at":"2026-08-06T19:19:29.300018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.00456","last_updated":"2019-07-08T17:21:46Z","snapshot_observed_at":"2026-07-06T08:03:53.351060Z","submitted_at":"2019-06-30T20:53:19Z","title":"Way Off-Policy Batch Deep Reinforcement Learning of Implicit Human Preferences in Dialog","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.00456","snapshot_observed_at":"2026-08-06T19:19:29.301981Z","title":"Way off-policy batch deep reinforcement learning of implicit human preferences in dialog.arXiv preprint arXiv:1907.00456, 2019","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-09T13:36:58.088832Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.301981Z"},"links":{"cited_paper":"/paper/1907.00456","citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:fc3742f1050a896ae60e09e6592e68e51c5f13e5aee44329afeebb4b6784b327","observation_id":"5bb02de6-6422-450c-8a4b-b8bf88b0c20b","resolution":{"observed_at":"2026-08-06T19:19:29.301981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.304679Z","title":"A minimalist approach to offline reinforcement learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-09T13:36:58.088832Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.304679Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:d49fd14145081468ed13842fa939942352f3eebe01ab9b18a62fddff320aeb34","observation_id":"ee08bffa-b9a0-4338-8422-6d1c195222ae","resolution":{"observed_at":"2026-08-06T19:19:29.304679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:30.017396Z","title":"Conservative q-learning for offline reinforcement learning","venue":null,"work_id":"dbe16f52-cff6-46f6-93ef-025e3035a1cd","year":2020},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-09T13:36:58.088832Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.306599Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:ab6837ac3e50155b5810684c80ed34041aa34d2b963fb763bd23ad81aad54620","observation_id":"bee2bd30-27bc-4279-ae5d-b52113dc3e41","resolution":{"observed_at":"2026-08-06T19:19:30.019955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:30.010943Z","title":"Uncertainty-based of- fline reinforcement learning with diversified q-ensemble","venue":null,"work_id":"b7707d72-4366-423b-be13-bd2a208bc21c","year":2021},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-09T13:36:58.088832Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.308508Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:1ed7bccf8c39387020002e361bf8e4efe05d923ff490adf36f6c4d25e8155560","observation_id":"20eb6e39-95f7-43eb-a934-3d10f6fbe10b","resolution":{"observed_at":"2026-08-06T19:19:30.013214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:30.004499Z","title":"Iteratively refined behavior regularization for offline reinforcement learning","venue":null,"work_id":"d2d3e2ac-7cb0-4180-a757-eb02444c19f0","year":2023},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-09T13:36:58.088832Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.310529Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:74f80f4bd83c1abb2327adec8cae43369e2f9cda6e1cbfd5c0a2b91ad834ebb8","observation_id":"c53f3ea2-6348-499e-a952-2eb398ca4f21","resolution":{"observed_at":"2026-08-06T19:19:30.006861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.998215Z","title":"Offline reinforcement learning with OOD state correction and OOD action suppression","venue":null,"work_id":"cdf8c950-f6f1-410b-bd27-bacd94a4c96b","year":2024},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-09T13:36:58.088832Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.312460Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:0230ec8e8d091c5e7b807f2a4bfe156aab1a89e110d94846f08de26f3fe727d8","observation_id":"ee8242d5-9d9d-4fff-a90a-9e4cc5f1d450","resolution":{"observed_at":"2026-08-06T19:19:30.000520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.314345Z","title":"Model-Bellman inconsistency for model-based offline reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-09T13:36:58.088832Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.314345Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:3327a279709a7071c8a4216daa7b3efcccfe4fe83580a5996eaa9f991d5d54d7","observation_id":"0a9c719c-02dd-45dd-879a-57eafe701b56","resolution":{"observed_at":"2026-08-06T19:19:29.314345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.986677Z","title":"Pessimistic bootstrapping for uncertainty-driven offline reinforcement learning","venue":null,"work_id":"21ab6044-6e0f-4efd-b82a-3750c7ac9d72","year":2022},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-09T13:36:58.088832Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.316417Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:62b2241b9c1b5c67cdecdeeb7f8955a86050569548449ece31dff1fc82b38226","observation_id":"8048c12b-3fb2-4016-9c99-9a59bc06f200","resolution":{"observed_at":"2026-08-06T19:19:29.988956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.979157Z","title":"Rorl: Ro- bust offline reinforcement learning via conservative smoothing.Advances in neural information processing systems, 35:23851–23866, 2022","venue":null,"work_id":"0f6011af-d119-407f-bf60-a5e918dec4e7","year":2022},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-09T13:36:58.088832Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.318638Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:6dc3c741991b9bb19503223cf658ee55d0b15e3a1b4bdee31fee4da1dab718f2","observation_id":"6d05255c-a63e-4185-8418-3899e31904ee","resolution":{"observed_at":"2026-08-06T19:19:29.982313Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.972037Z","title":"When to trust your simulator: Dynamics-aware hybrid offline-and-online reinforcement learning","venue":null,"work_id":"7318f941-aa49-4c3b-aa8b-0673ed9c87b5","year":2022},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-09T13:36:58.088832Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.320703Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:6d8ed01d9e7f1c111619b14a223ddf86957fdcff97fe3ac5119a435ec3c99053","observation_id":"0021822e-187f-4dc2-aa2a-15414400336e","resolution":{"observed_at":"2026-08-06T19:19:29.974736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.965238Z","title":"Cross-domain policy adaptation via value-guided data filtering","venue":null,"work_id":"23c5bb8e-7c71-447e-ad62-79b3d269b695","year":2023},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-09T13:36:58.088832Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.322700Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:47776948b5f674f62c8631172d137b3f4fef1d934dd599b184d26342095f90b2","observation_id":"1648d827-69cd-4abd-866e-707f3e859cda","resolution":{"observed_at":"2026-08-06T19:19:29.967484Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.957155Z","title":"Cross-domain policy adaptation by capturing representation mismatch","venue":null,"work_id":"6e2a147f-0441-48d6-8de9-bcbc9175a76e","year":2024},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-09T13:36:58.088832Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.324779Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:fb4fbb2d5b2d691ce2186ea4c0f3248ebd0f8286dd8e11c71b79c436c9f4e0ef","observation_id":"5cad286d-7c02-4cb0-a929-756ec34e37be","resolution":{"observed_at":"2026-08-06T19:19:29.959892Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.13916","last_updated":"2022-06-16T21:12:42Z","snapshot_observed_at":"2026-07-06T11:52:19.105210Z","submitted_at":"2021-09-28T17:59:36Z","title":"Unsolved Problems in ML Safety","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.13916","snapshot_observed_at":"2026-08-06T19:19:29.326782Z","title":"Unsolved problems in ml safety.arXiv preprint arXiv:2109.13916, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-09T13:36:58.088832Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.326782Z"},"links":{"cited_paper":"/paper/2109.13916","citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:de2d2686b7f9a0b06b003dee60189d4dcf52146c3f83a6719f40643c4395e88e","observation_id":"b8338a00-9f6c-41d4-b8ef-7e2fa00fc332","resolution":{"observed_at":"2026-08-06T19:19:29.326782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.329102Z","title":"Learning dexterous in-hand manipulation.The International Journal of Robotics Research, 39(1):3–20, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-09T13:36:58.088832Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.329102Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:3c1f85f1111ef7b1670d26f2707edfd9367761a5060b9422185069536bacbebf","observation_id":"20628592-55e8-4951-a6f7-9e72589de342","resolution":{"observed_at":"2026-08-06T19:19:29.329102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.944871Z","title":"Network randomization: A simple technique for generalization in deep reinforcement learning","venue":null,"work_id":"a83723f0-3ad2-4ceb-955b-3236356ad36d","year":2020},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-09T13:36:58.088832Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.331474Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:58518066a9abeb93eea13c6fb9883979fc05a9df080889c5d36bd366f55f4b3d","observation_id":"ff54dac0-ddf8-4970-a069-6a11f9a2fc24","resolution":{"observed_at":"2026-08-06T19:19:29.947243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.936821Z","title":"Learning domain randomization distributions for training robust locomotion policies","venue":null,"work_id":"7e5ea26c-551c-45a0-a7e3-8c29f863acfa","year":2020},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-09T13:36:58.088832Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.333446Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:71ba87c427f6dec3112d728762ddf2e9915354defffcea2915b7866bf4754b16","observation_id":"135a6683-631b-424c-98a9-34fcc6649337","resolution":{"observed_at":"2026-08-06T19:19:29.939417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.928474Z","title":"A Markovian Decision Process.Indiana University Mathematics Journal, 6(4):679–684, 1957","venue":null,"work_id":"44ab1d30-3243-4bf2-8f0b-eb770f872723","year":1957},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-09T13:36:58.088832Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.335350Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:0cb24b3a23e1dd0ff09925043541ce8671e35814c0583303bab7a42f53f956e4","observation_id":"a7568781-4dda-4914-a03b-96015ec8da77","resolution":{"observed_at":"2026-08-06T19:19:29.931379Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.921276Z","title":"Handling black swan events in deep learning with diversely extrapolated neural networks","venue":null,"work_id":"e3171e11-acbd-4aa9-aae8-3cafe84faa6f","year":2020},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-09T13:36:58.088832Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.337048Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:6a5280b7f6d1dc8178ed629cf0342a98fedde7c8b845779c6374402afcb753cf","observation_id":"6ea5ee09-e2c6-453c-abae-4c239af013f0","resolution":{"observed_at":"2026-08-06T19:19:29.924225Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.914956Z","title":"Cal-QL: Calibrated offline RL pre-training for efficient online fine-tuning","venue":null,"work_id":"cbe327be-71a2-436e-ae98-09147517afef","year":2023},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-09T13:36:58.088832Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.338908Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:480dd549265740953adbc60b207f76cee6b335801a4ac51ffc9f84a1eb107386","observation_id":"3d72acdb-e36d-42a2-ab81-a9edbd72c976","resolution":{"observed_at":"2026-08-06T19:19:29.917160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.09359","last_updated":"2021-04-24T22:39:30Z","snapshot_observed_at":"2026-07-06T09:29:45.475911Z","submitted_at":"2020-06-16T17:54:41Z","title":"AWAC: Accelerating Online Reinforcement Learning with Offline Datasets","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.09359","snapshot_observed_at":"2026-08-06T19:19:29.341183Z","title":"Awac: Accelerating online reinforcement learning with offline datasets.arXiv preprint arXiv:2006.09359, 2020","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-09T13:36:58.088832Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.341183Z"},"links":{"cited_paper":"/paper/2006.09359","citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:df209b81671f009765846624ec408417997ec9f957d3a98b4e5053e1a4650c68","observation_id":"89de8493-1f4e-4a75-a416-b3beae587f0d","resolution":{"observed_at":"2026-08-06T19:19:29.341183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-06T19:19:29.343626Z","title":"D4rl: Datasets for deep data-driven reinforcement learning.arXiv preprint arXiv:2004.07219, 2020","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-09T13:36:58.088832Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.343626Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:d31f4edf0124084e64a374f95aad1d866e92fcaa4cf223b4ce35e137b26a0f8b","observation_id":"465d13c9-be27-4ae0-88e8-a76087b78458","resolution":{"observed_at":"2026-08-06T19:19:29.343626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.907857Z","title":"Terry, Ariel Kwiatkowski, John U","venue":null,"work_id":"3eaef437-6c76-48ea-b2f6-28c6d99e3103","year":2023},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-09T13:36:58.088832Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.346020Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:3902d3c7d4a4ce80136de4b9be9d91c929945c5d6147ebe785009d0584662626","observation_id":"9b219c75-4ffa-4510-a637-a87ed8da06a3","resolution":{"observed_at":"2026-08-06T19:19:29.910184Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.900401Z","title":"Soft actor-critic: Off- policy maximum entropy deep reinforcement learning with a stochastic actor","venue":null,"work_id":"84f6b29f-ea37-4dc4-bf21-356e9670d978","year":2018},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-09T13:36:58.088832Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.347835Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:89fc0bab90171d2db46f900f805fe6ab9d062999f2903a77cd1a8c9b04497847","observation_id":"e0d11664-5751-476a-9d5d-27ba11d0f71b","resolution":{"observed_at":"2026-08-06T19:19:29.903281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.349772Z","title":"Addressing function approximation error in actor-critic methods","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-09T13:36:58.088832Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.349772Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:a6971616a26aca201a8e0bfac6a0de7334a39b6797b12b6be7e30ba6e863730e","observation_id":"d9b9f682-7946-44a3-9028-18bc64fda4c4","resolution":{"observed_at":"2026-08-06T19:19:29.349772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.887893Z","title":"Corl: Research-oriented deep offline reinforcement learning library","venue":null,"work_id":"6f7d38d3-2d48-4f51-9720-b1d01f711878","year":2022},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-09T13:36:58.088832Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.352078Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:1ee548cdf02f9a7f1b9ff7a5fe301acc11815a7d57f0499a597aad06d50702d5","observation_id":"b1d777a0-3c31-41ae-9faa-2890d9c51f4f","resolution":{"observed_at":"2026-08-06T19:19:29.890616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.354009Z","title":"Efficient online reinforcement learning with offline data","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-09T13:36:58.088832Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.354009Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:25658b0568d6081d744bd833bf105db3feb7bafc2d0e46febcb580ec973a8214","observation_id":"752d14ce-4484-46ae-bca1-90b40391f100","resolution":{"observed_at":"2026-08-06T19:19:29.354009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.875142Z","title":"Odrl: A benchmark for off-dynamics reinforcement learning","venue":null,"work_id":"1f378fe7-7444-4e90-9d6f-1e2e9949373b","year":2024},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-09T13:36:58.088832Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.356302Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:782260536e0f58f69e474e0459e17ea017abed37221d79fb79e767c5019531ec","observation_id":"7a3f1e80-44d1-4aec-bad1-b6334b7b664a","resolution":{"observed_at":"2026-08-06T19:19:29.877656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.867371Z","title":"Darl: distance-aware uncertainty estimation for offline reinforcement learning","venue":null,"work_id":"f3635d08-bbb1-4dba-b91b-6dae70f1e864","year":2023},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-09T13:36:58.088832Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.358703Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:a8fe33f36b7b438d4a5d177fe23bac4b0f7f9891e735ba77bae9305de4582978","observation_id":"cb7d1f36-c7fa-42cf-87d0-45e79e5fbf57","resolution":{"observed_at":"2026-08-06T19:19:29.870256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03046","last_updated":"2024-02-05T14:32:00Z","snapshot_observed_at":"2026-07-06T17:25:31.223077Z","submitted_at":"2024-02-05T14:32:00Z","title":"Open RL Benchmark: Comprehensive Tracked Experiments for Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03046","snapshot_observed_at":"2026-08-06T19:19:29.360678Z","title":"Open rl benchmark: Comprehensive tracked experiments for reinforcement learning.arXiv preprint arXiv:2402.03046, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-09T13:36:58.088832Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.360678Z"},"links":{"cited_paper":"/paper/2402.03046","citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:7abf04649b9187a8b2de3f528150e78de1b649d142ede3ca525a4f88fbc7f6e6","observation_id":"f625135f-81d6-4579-9c72-d976d15e5d46","resolution":{"observed_at":"2026-08-06T19:19:29.360678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.859853Z","title":"Dario Bellicoso, Vassilios Tsounis, Jemin Hwangbo, Karen Bodie, Peter Fankhauser, Michael Bloesch, Remo Diethelm, Samuel Bachmann, Amir Melzer, and Mark Hoepflinger","venue":null,"work_id":"98c8803c-a438-47bd-af57-680b3b8c9db0","year":2016},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-09T13:36:58.088832Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.362912Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:e99789708cbe93a6b81d981f2f91ce588cc951652a34fe9b6bf9166365366065","observation_id":"c4ce109d-cc73-4469-8485-8f5f7a86c5a1","resolution":{"observed_at":"2026-08-06T19:19:29.862493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.851684Z","title":"Learning to walk in minutes using massively parallel deep reinforcement learning","venue":null,"work_id":"2787674f-6cda-445e-8d4a-1cee30c834ef","year":2022},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-09T13:36:58.088832Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.364973Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:90449ae97f023a95cb1b32fef6d3197cf297d6278c4939cd7c4127a25f3176e4","observation_id":"50084dd9-436a-4881-bbcc-a0a01590d0ff","resolution":{"observed_at":"2026-08-06T19:19:29.854150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.366871Z","title":"Learning agile and dynamic motor skills for legged robots.Science Robotics, 4(26):eaau5872, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-09T13:36:58.088832Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.366871Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:f15ffce495943e37953c5fc4ecf7acaa5868f7df2c5e0f77ec15039938bb2a86","observation_id":"d4297451-6beb-4138-ba31-b904e8cbec12","resolution":{"observed_at":"2026-08-06T19:19:29.366871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.839358Z","title":"REvolveR: Continuous evolutionary models for robot-to-robot policy transfer","venue":null,"work_id":"c2450f0c-b5fc-4ce8-b759-a19a7fa207d0","year":2022},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-09T13:36:58.088832Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.368958Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:14f33d6ef102dae60561908882e1afbf65beaaca64d2529388c8e61bb5e9f5db","observation_id":"9aaf98a9-3769-4d8f-abf7-4fa1ce272a68","resolution":{"observed_at":"2026-08-06T19:19:29.841571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15669","last_updated":"2023-05-25T02:40:32Z","snapshot_observed_at":"2026-08-06T02:09:22.567502Z","submitted_at":"2023-05-25T02:40:32Z","title":"PROTO: Iterative Policy Regularized Offline-to-Online Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15669","snapshot_observed_at":"2026-08-06T19:19:29.370866Z","title":"Proto: Iterative policy regularized offline-to-online reinforcement learning.arXiv preprint arXiv:2305.15669, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-09T13:36:58.088832Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.370866Z"},"links":{"cited_paper":"/paper/2305.15669","citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:24602cf7955961d550c2e1997cf9d8e9c139d5b0dad89d27344260ba48535f26","observation_id":"a8f851a0-5087-40e1-879a-1118306b0361","resolution":{"observed_at":"2026-08-06T19:19:29.370866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.832369Z","title":"Off-policy deep reinforcement learning without exploration","venue":null,"work_id":"ecec27ef-1c90-40f8-b45a-d84e3af31ed7","year":2019},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-09T13:36:58.088832Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.373327Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:181fb78b3f22a506cd4c330e6af66704a0e85f6ec8c04eb5d8e9e3183663d5a1","observation_id":"819b9590-101f-4542-b17c-1bcf0a29a9bd","resolution":{"observed_at":"2026-08-06T19:19:29.835110Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.824865Z","title":"An optimistic perspective on offline reinforcement learning","venue":null,"work_id":"90357662-9c43-4a15-9494-64a978141db4","year":2020},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-09T13:36:58.088832Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.375266Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:7f0e00f54793f42a5b6acc0b98e653ec98e5334ad0aff7fa8f1edba6ff1179e6","observation_id":"f0f42879-8418-4202-aa5e-d81b0f110029","resolution":{"observed_at":"2026-08-06T19:19:29.827539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.817870Z","title":"Tree-based batch mode reinforcement learning.Journal of Machine Learning Research, 6, 2005","venue":null,"work_id":"bc0a59f4-2055-4156-bcd3-84a2e30e716d","year":2005},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-09T13:36:58.088832Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.377557Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:dfeeb5561c0a5d5045c240d14030edccfee0af16e280b69ef0d3b170d1986b3b","observation_id":"29ac67b7-ce28-40b4-8b7b-21d4cd3a7124","resolution":{"observed_at":"2026-08-06T19:19:29.820340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.810681Z","title":"Stabilizing off-policy q-learning via bootstrapping error reduction","venue":null,"work_id":"8ca7a341-60a3-46e7-8bff-96dea7087487","year":2019},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-09T13:36:58.088832Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.379882Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:98926b36381d0f055fe4d6d75595ae12ae8f83af34eb33fd26478bd019a83de9","observation_id":"8dfcd02c-6f0d-40ba-add7-c9cfdb0124d1","resolution":{"observed_at":"2026-08-06T19:19:29.813522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.804002Z","title":"Batch reinforcement learning","venue":null,"work_id":"d125a5c2-e668-411f-a878-b0d8e0b09b7e","year":2012},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-09T13:36:58.088832Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.382002Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:4afd6ccfdd00d13bfb7451fae9894592d066fbf2f8ce30b931bc97895d6d89db","observation_id":"55874838-495d-4e38-bb63-cfb272151dc6","resolution":{"observed_at":"2026-08-06T19:19:29.806240Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.796276Z","title":"Critic regularized regression.Advances in Neural Information Processing Systems, 33:7768–7778, 2020","venue":null,"work_id":"df1c5b3a-9778-416b-9ac3-42c768971abc","year":2020},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-09T13:36:58.088832Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.384096Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:4fb23b263e8cd4bfa6134ada31c0518570273a25c6769d9dc0aea6a99ea7663d","observation_id":"e0640f26-8c90-42d9-bbf1-2ffbe8ff7bd0","resolution":{"observed_at":"2026-08-06T19:19:29.799074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.788868Z","title":"Revisiting the minimalist approach to offline reinforcement learning.Advances in Neural Information Processing Systems, 36, 2024","venue":null,"work_id":"2d63df69-0012-418e-b8c2-e7a36ba1e05f","year":2024},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-09T13:36:58.088832Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.386007Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:acbd78d98dd94c998b00eda52a4922b22d28c4e1396d6918f1ddbd0926998d37","observation_id":"f78f2176-cf11-4722-8aea-42ac0e26f1ad","resolution":{"observed_at":"2026-08-06T19:19:29.791474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-07-06T08:39:58.361914Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.11361","snapshot_observed_at":"2026-08-06T19:19:29.387854Z","title":"Behavior regularized offline reinforcement learning.arXiv preprint arXiv:1911.11361, 2019","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-09T13:36:58.088832Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.387854Z"},"links":{"cited_paper":"/paper/1911.11361","citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:041eda6e255779e643d3c6937de3e49d2d296783c548a6aa68d3fd14e4bf8211","observation_id":"f2b04cf0-7311-4c3e-92b0-5e76903e2726","resolution":{"observed_at":"2026-08-06T19:19:29.387854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.781563Z","title":"Keep doing what worked: Behavior modelling priors for offline reinforcement learning","venue":null,"work_id":"9b992940-fd33-4d5d-aaa5-7de8258e86d3","year":2020},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-09T13:36:58.088832Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.390019Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:c0cbe4d659968db8428b065c44ab52e97f95aa5414e1bb28e653dd778ee95a91","observation_id":"1b2f9574-4016-42a6-bb3e-120b67be6ac6","resolution":{"observed_at":"2026-08-06T19:19:29.783948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.773948Z","title":"Offline reinforcement learning with fisher divergence critic regularization","venue":null,"work_id":"e0eeec28-3cb8-4088-95f4-3454352c9a18","year":2021},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-09T13:36:58.088832Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.392283Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:bf2843695ac4187ec35c9561884eef8e4679a248c72fe1b01d98a29b418dfa32","observation_id":"bd2927dd-016b-4e78-aed0-376aab5293fa","resolution":{"observed_at":"2026-08-06T19:19:29.776341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.765839Z","title":"Uncertainty weighted actor-critic for offline reinforcement learning","venue":null,"work_id":"7a36f84f-2062-4ef2-a0a3-42c218e85173","year":2021},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-09T13:36:58.088832Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.394549Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:37e9b04387dab0bf502920680caeaa222644072cb75fc51c498ddf0d9f0798d5","observation_id":"ccdaffb5-16a9-467c-9476-671ed0365b51","resolution":{"observed_at":"2026-08-06T19:19:29.768826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.758027Z","title":"Uni-o4: Unifying online and offline deep reinforcement learning with multi-step on-policy optimization","venue":null,"work_id":"89ba8657-879f-4ced-8eb4-12868dc09333","year":2024},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-09T13:36:58.088832Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.396578Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:e139890cdfbe2b189e50713db77d1b412a276588815c3c076ed60406f0944c18","observation_id":"89e1fb23-82cc-48ab-8963-ad7587a9de85","resolution":{"observed_at":"2026-08-06T19:19:29.760539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.750136Z","title":"Enoto: Improving offline-to-online reinforcement learning with q-ensembles","venue":null,"work_id":"c2c19bd2-f5fa-4754-bde9-4607807d9ba6","year":2024},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-09T13:36:58.088832Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.398569Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:9b5e8ad505fcb0b637051ae1012ed201d4018b98dd8b5c2c539a267eeb87e8db","observation_id":"963958b2-a71a-488e-8987-d9889d18be8f","resolution":{"observed_at":"2026-08-06T19:19:29.753191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.742149Z","title":"Online decision transformer","venue":null,"work_id":"91152a4a-3769-4ccd-b4bb-6bd806acca6a","year":2022},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-09T13:36:58.088832Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.400451Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:cb797fb26ea193cc74b494312687e0fb3971099cc0c99b198978e6de1fa8c8ae","observation_id":"ab3132ae-9778-49a4-84b9-319bea955ec4","resolution":{"observed_at":"2026-08-06T19:19:29.744916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.734940Z","title":"Actor-critic alignment for offline-to-online reinforcement learning","venue":null,"work_id":"34a5b496-6d05-4404-ae39-7e7a540835a3","year":2023},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-09T13:36:58.088832Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.402324Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:ad2feeed6334db0ad5910657dd8dcdf2d4fbf3f2ce6883bcf977b46dd7566440","observation_id":"fb53cca9-2672-4a72-bd95-01c21239d0cb","resolution":{"observed_at":"2026-08-06T19:19:29.737615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.727557Z","title":"Train once, get a family: State-adaptive balances for offline-to-online reinforcement learning.Advances in Neural Information Processing Systems, 36, 2024","venue":null,"work_id":"4ec8f0fd-e901-47f7-b9bc-e36d994448db","year":2024},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-09T13:36:58.088832Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.404627Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:e77ff29067141c75adfcdf1d4daf6869f561a3a67fbd64e0b24ecb07df299f83","observation_id":"1df1ff13-ab37-47fc-b576-1c1c66aaeb7e","resolution":{"observed_at":"2026-08-06T19:19:29.730169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.720152Z","title":"Policy expansion for bridging offline-to-online reinforcement learning","venue":null,"work_id":"c296da03-def6-42ac-a0cd-5fa3a63ae00b","year":2023},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-09T13:36:58.088832Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.406945Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:7d046ff53cd78cac03bd2e44fa83864bd4e31e862ccfe7d473aff9486571c12c","observation_id":"6e2dcd07-f1b7-45e6-b59d-b4f3974fbdbc","resolution":{"observed_at":"2026-08-06T19:19:29.722584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.713044Z","title":"Albrecht, and Amos Storkey","venue":null,"work_id":"b7974e25-306d-476c-a126-7cbcb92ebf4c","year":2024},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-09T13:36:58.088832Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.409073Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:455dd8df287e888e829d401fce80a79dcadd080630aa00d4e72db40fd4079d45","observation_id":"9faaf102-b410-4ae3-bf10-5977dcb8ff12","resolution":{"observed_at":"2026-08-06T19:19:29.715340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.410801Z","title":"A comprehensive survey on safe reinforcement learning","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-09T13:36:58.088832Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.410801Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:706a4e8f3037854dfcc97443d3a38cc8a913df60fa583684e458c6eb34803ce2","observation_id":"aeff3033-7800-4f74-a7f8-cfbab583a70e","resolution":{"observed_at":"2026-08-06T19:19:29.410801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.700892Z","title":"Consideration of risk in reinforcement learning","venue":null,"work_id":"b96f8dc9-e879-4169-92c7-1c59a97a0d85","year":1994},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-09T13:36:58.088832Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.412546Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:01dd889f38dab0e76913d2d90e397877eb4e797e3e11c50efeb6dc473ad8bb1e","observation_id":"866b0f2c-0144-4aa1-857d-504538951ec7","resolution":{"observed_at":"2026-08-06T19:19:29.703434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.414793Z","title":"Robust control of markov decision processes with uncertain transition matrices.Operations Research, 53(5):780–798, 2005","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-09T13:36:58.088832Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.414793Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:c6b59c4ef28f352c4b1e4757c7cba728cdd23792404e4b8531f5db8acedb05ce","observation_id":"ad5a7b7e-cd11-4111-a7a1-b6e87ac55b02","resolution":{"observed_at":"2026-08-06T19:19:29.414793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.416648Z","title":"Safe offline reinforcement learning with feasibility-guided diffusion model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-09T13:36:58.088832Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.416648Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:561b91022c2697ee8d25306cb907fc7fc5a0bb499c6a7962d484217ed66582a8","observation_id":"b541c8e6-7200-49c9-8b4e-0ae5f1afcb13","resolution":{"observed_at":"2026-08-06T19:19:29.416648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.418498Z","title":"Enhancing efficiency of safe reinforcement learning via sample manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-09T13:36:58.088832Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.418498Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:6feba2de96cc5abcd1bf272072b9b05505602a3a4aced916bdc8cdebd9508665","observation_id":"c5de7a59-d088-434c-bc24-6fa26922873b","resolution":{"observed_at":"2026-08-06T19:19:29.418498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.420529Z","title":"Curriculum learning for reinforcement learning domains: A framework and survey.Journal of Machine Learning Research, 21(181):1–50, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-09T13:36:58.088832Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.420529Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:4cb196190377f00aa31c65c649c7b464e201dd7043d37a5a42ecb38e4f9e76ad","observation_id":"46eeeb28-8e94-4f3c-80ea-c5952b29cf04","resolution":{"observed_at":"2026-08-06T19:19:29.420529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.673363Z","title":"Causally aligned curriculum learning","venue":null,"work_id":"ea0b8d43-a3cf-4be8-baff-a2fd09eccf77","year":2024},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-09T13:36:58.088832Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.422499Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:c826965936a0b67af18582479458caa99cdd299734ab8f6674bcfc3006b909f9","observation_id":"26abd769-ff08-447c-97a1-4a6cacf296d7","resolution":{"observed_at":"2026-08-06T19:19:29.675926Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.424889Z","title":"Au- tomated curriculum learning for neural networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-09T13:36:58.088832Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.424889Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:a4048af8233f8e19abf1ad06888564e1eef563f3f98ae51ab42542669118cc2c","observation_id":"44dea0fa-db63-40bf-b85a-0142e4bb4af6","resolution":{"observed_at":"2026-08-06T19:19:29.424889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.426837Z","title":"MIT press, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-09T13:36:58.088832Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.426837Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:9e6ed1e5e2682cafac916fb8bccbbd79e1010210a575434d105ac4e9f26c79fa","observation_id":"7f211236-c2b5-42f5-a24d-baed0cfe0a8c","resolution":{"observed_at":"2026-08-06T19:19:29.426837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.654963Z","title":"Robust training with ensemble consensus","venue":null,"work_id":"e4dc483f-cd02-4f19-9821-4b397a2661fc","year":2020},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-09T13:36:58.088832Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.429055Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:15f6936f129b4d39845f7351555079fc14bcb056d8229ce421083dececd93aef","observation_id":"0b4402a7-9aa9-4766-b59a-a16ba0b5de03","resolution":{"observed_at":"2026-08-06T19:19:29.657694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.647648Z","title":"Simple and scalable predictive uncertainty estimation using deep ensembles","venue":null,"work_id":"af93c346-1ee9-40f0-8ca8-58cbbb1678e4","year":2017},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-09T13:36:58.088832Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.430924Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:0a927d020fe2d066789276b954aaf0f2b40689df577912f49f4bec9005fb9d2f","observation_id":"3cb9dd47-d8f6-4661-b75f-d620146f0dda","resolution":{"observed_at":"2026-08-06T19:19:29.649950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.639675Z","title":"Improving robustness and calibration in ensembles with diversity regularization","venue":null,"work_id":"f7b31604-6322-4125-af60-239842b87b7e","year":2022},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-09T13:36:58.088832Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.432775Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:94c02c7e58d68d975adb149b44dd219de1f1e7044698ecbb7cd49728a2f75a18","observation_id":"08ad4517-5379-48f5-a9bb-e9a489d45773","resolution":{"observed_at":"2026-08-06T19:19:29.642590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.632689Z","title":"Maximizing overall diversity for improved uncertainty estimates in deep ensembles.Proceedings of the AAAI Conference on Artificial Intelligence, 34(04):4264–4271, Apr","venue":null,"work_id":"c1c8ec21-01ba-4a27-9c75-97db3801316d","year":2020},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-09T13:36:58.088832Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.434936Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:ac550b512767b726046dd4b5d621c1064217a3a5a49097bbe96f17d4779d7a03","observation_id":"8e4c9760-98c5-4ea7-bce9-973c718bbc77","resolution":{"observed_at":"2026-08-06T19:19:29.635115Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.625811Z","title":"Improving adversarial robustness via promoting ensemble diversity","venue":null,"work_id":"a7697a5a-003f-4c43-a1a5-fc809659b022","year":2019},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-09T13:36:58.088832Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.437314Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:d90f1fa7f9dfb86f2981a47ffea40d2cae294a60444ce7e98771b2ec8663d09e","observation_id":"497e7924-326b-42e8-856f-d687b10c2d4b","resolution":{"observed_at":"2026-08-06T19:19:29.628329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.618865Z","title":"Webb, Henry W","venue":null,"work_id":"c0a74bc8-91c0-4090-acc3-aad23298a97f","year":2023},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-09T13:36:58.088832Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.439174Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:0a398bda158463a91ff3b15b600847544d5079d25325193fb3100ccb1d7933c5","observation_id":"98359dcb-0d9c-4d54-9794-f517139dcc7e","resolution":{"observed_at":"2026-08-06T19:19:29.621218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.611914Z","title":"Ensemble of averages: Improv- ing model selection and boosting performance in domain generalization","venue":null,"work_id":"39075043-2089-48bf-92b1-1d1a1fe2b4ff","year":2022},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-09T13:36:58.088832Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.441207Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:954177df97a907ecb872b32ef3dce284e4998bbb38ebdc8aa2a62c3cabc1708b","observation_id":"710834d2-13ba-415a-b6bd-246eb2e3a249","resolution":{"observed_at":"2026-08-06T19:19:29.614250Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.604386Z","title":"Noise contrastive priors for functional uncertainty","venue":null,"work_id":"6100757b-2864-4b4a-ac10-5fec6f1fceef","year":2020},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-09T13:36:58.088832Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.443024Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:aaac83b66152402958029a2771d47eef185e490952779a73b7186ac1f5ac1e67","observation_id":"e261abd3-e9c6-43c6-ac43-171884808c09","resolution":{"observed_at":"2026-08-06T19:19:29.606681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.445060Z","title":"Deep exploration via bootstrapped dqn.Advances in neural information processing systems, 29, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-09T13:36:58.088832Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.445060Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:f106ffebf4c3deff256fbb8cf0bc38e3c3773d3b6e5350a453bec0dcfd38c0df","observation_id":"7818270d-e5f4-46ad-8d86-1c2645b3c400","resolution":{"observed_at":"2026-08-06T19:19:29.445060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.591719Z","title":"Sunrise: A simple unified framework for ensemble learning in deep reinforcement learning","venue":null,"work_id":"42acbb43-7b74-491e-a4bb-3c9caa213c8f","year":2021},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-09T13:36:58.088832Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.447135Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:681485f5733ccae6669930cdf32393223598a203e274d7405c2ecc0f80fb51a1","observation_id":"684f6ff6-8c3c-4228-81b9-26cf183d0e63","resolution":{"observed_at":"2026-08-06T19:19:29.594053Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.584755Z","title":"Accurate uncertainty estimation and decomposition in ensemble learning.Advances in Neural Information Processing Systems, 32, 2019","venue":null,"work_id":"eb19e7f8-626f-4243-933f-68398708d00a","year":2019},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-09T13:36:58.088832Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.449288Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:3e7fafc781bae2a4d1a0ad1bf70209a0674a99a2781652cc2502ec7afc62d4e0","observation_id":"80a9eb5b-5761-4b2e-85d1-a21f6b0d1547","resolution":{"observed_at":"2026-08-06T19:19:29.587160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.01558","last_updated":"2022-06-03T13:20:16Z","snapshot_observed_at":"2026-07-06T13:17:08.463007Z","submitted_at":"2022-06-03T13:20:16Z","title":"Disentangling Epistemic and Aleatoric Uncertainty in Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.01558","snapshot_observed_at":"2026-08-06T19:19:29.451527Z","title":"Disentangling epistemic and aleatoric uncertainty in reinforcement learning.arXiv preprint arXiv:2206.01558, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-09T13:36:58.088832Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.451527Z"},"links":{"cited_paper":"/paper/2206.01558","citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:d0a325276ef0e790b7f18709895c91b9b0133c9268d518f4b56e955269cecfcb","observation_id":"941e3176-5522-4b1d-aa8a-c91731d50bd6","resolution":{"observed_at":"2026-08-06T19:19:29.451527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.453605Z","title":"Kingma and Jimmy Ba","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-09T13:36:58.088832Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.453605Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:6a08076a15d410f53561a2d89232814e3485dca039c3e52163bd7c6155b1b6f2","observation_id":"42e34f71-1de2-4658-8ed3-6accdde04c70","resolution":{"observed_at":"2026-08-06T19:19:29.453605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-06T19:19:29.455963Z","title":"Robustness","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-09T13:36:58.088832Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.455963Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:a199d0a875f75a0e9e547620289fe55773d798a29a37f4d7bb1a5dd1978bd280","observation_id":"8901a11e-c7fc-4d12-85bd-d8f69a797d87","resolution":{"observed_at":"2026-08-06T19:19:29.455963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.573797Z","title":"|R(s, a)−R(s′, a′)| ≤LR (s, a)−(s′, a′) ,∀(s, a),(s ′, a′)∈S×A,(19) and satisfies|R(s, a)| ≤Rmax","venue":null,"work_id":"055e98ff-f69b-4cf1-ba24-17c11558769a","year":null},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-09T13:36:58.088832Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.458862Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:fbc7494f88dd94ae90e9db2ef5224431a861b38612bdd7b178f09753549ba8d6","observation_id":"1b431425-3d5f-451c-b414-ff3fe25fd0c5","resolution":{"observed_at":"2026-08-06T19:19:29.576167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.566832Z","title":"We acknowledge that real-world contact dynamics can violate global Lipschitz continuity","venue":null,"work_id":"04dface9-6e6c-432d-ba02-b363ca2bf3d6","year":null},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-09T13:36:58.088832Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.461201Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:5b707b94219c48e16da64a8cf2456968c78cd19284a50bce7662640875609a8c","observation_id":"e0c46e7f-3d9e-44d3-a648-8c53cd3bca6c","resolution":{"observed_at":"2026-08-06T19:19:29.569443Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.560266Z","title":"distance","venue":null,"work_id":"a79f78e4-35b7-4030-a61b-fae70adaebaf","year":2000},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-09T13:36:58.088832Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.463669Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:a1532d3634c80368a0b696f0da68f45ce6b55069e8eb419b68ace01985fc58fd","observation_id":"dd71c4ac-e2c6-459b-bc1e-a08fa2317c59","resolution":{"observed_at":"2026-08-06T19:19:29.562216Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.551362Z","title":"• Depending on the country in which research is conducted, IRB approval (or equivalent) may be required for any human subjects research","venue":null,"work_id":"7485250f-794a-4df7-827d-de78ac9dbc33","year":2025},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-09T13:36:58.088832Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.466784Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:dd8e48f27512351b1f2461851ddbdf976e75d63fb8a349be5ff960191f5f039d","observation_id":"b8dd2bd5-6ccc-44d8-8534-bf3960160fc3","resolution":{"observed_at":"2026-08-06T19:19:29.555116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T13:36:58.088832Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation"},"reference_resolution":{"displayed":94,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":39,"verified_exact":0,"verified_fuzzy":54},"total_outbound_references":94},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 94 of 94 outbound references and 2 inbound Pith citation observations for arXiv:2507.06111."}