{"as_of":"2026-08-14T16:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:548b256409bd65c538c03e7c824870cee7e663e217005323d7c888000482022a","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T11:31:10.810713Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:53:09.773129Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-22T05:34:40.281222Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.02705","last_updated":"2025-02-04T20:40:44Z","snapshot_observed_at":"2026-08-14T04:29:53.155173Z","submitted_at":"2025-02-04T20:40:44Z","title":"Rapidly Adapting Policies to the Real World via Simulation-Guided Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02705","snapshot_observed_at":"2026-08-07T10:53:09.773129Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.04147","last_updated":"2026-07-17T06:06:23Z","snapshot_observed_at":"2026-08-14T09:26:04.339676Z","submitted_at":"2025-06-04T16:41:55Z","title":"SLAC: Safe and Efficient Real-Robot Reinforcement Learning via Unsupervised Simulation Pre-Training","version":5},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:09.773129Z"},"links":{"cited_paper":"/paper/2502.02705","citing_paper":"/paper/2506.04147"},"observation_digest":"sha256:2ee9f923df1284477d148ed9ed8d55df1cf489ce9c109589257ed6481b3c2bd8","observation_id":"9b64537e-37e9-42e4-8dd3-a89bd3ce4825","resolution":{"observed_at":"2026-08-07T10:53:09.773129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02705","last_updated":"2025-02-04T20:40:44Z","snapshot_observed_at":"2026-08-14T04:29:53.155173Z","submitted_at":"2025-02-04T20:40:44Z","title":"Rapidly Adapting Policies to the Real World via Simulation-Guided Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02705","snapshot_observed_at":"2026-08-06T19:53:06.350159Z","title":"Rapidly adapting policies to the real world via simulation-guided fine-tuning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.04452","last_updated":"2025-07-06T16:18:40Z","snapshot_observed_at":"2026-08-13T18:44:01.672245Z","submitted_at":"2025-07-06T16:18:40Z","title":"SimLauncher: Launching Sample-Efficient Real-world Robotic Reinforcement Learning via Simulation Pre-training","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T19:53:06.350159Z"},"links":{"cited_paper":"/paper/2502.02705","citing_paper":"/paper/2507.04452"},"observation_digest":"sha256:ba964d5a4ea63f7f68930dca8145f17379c31710742315cc49b7672dabf3dde5","observation_id":"c8bcfd32-6511-4a9f-ba0f-67ebe3691da3","resolution":{"observed_at":"2026-08-06T19:53:06.350159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02705","last_updated":"2025-02-04T20:40:44Z","snapshot_observed_at":"2026-08-14T04:29:53.155173Z","submitted_at":"2025-02-04T20:40:44Z","title":"Rapidly Adapting Policies to the Real World via Simulation-Guided Fine-Tuning","version":1},"cited_work":{"arxiv_id":"2502.02705","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.02705","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rapidly adapting policies to the real world via simulation-guided fine- tuning","venue":null,"work_id":"2a9263b8-a900-4040-861c-62f87bff2840","year":2025},"citing_paper":{"arxiv_id":"2603.15759","last_updated":"2026-05-12T15:04:33Z","snapshot_observed_at":"2026-07-06T22:49:19.323519Z","submitted_at":"2026-03-16T18:00:23Z","title":"Simulation Distillation: Pretraining World Models in Simulation for Rapid Real-World Adaptation","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-15T09:49:03.333757Z"},"links":{"cited_paper":"/paper/2502.02705","citing_paper":"/paper/2603.15759"},"observation_digest":"sha256:ac4e88f071602a69f0b2b74d93f85d3c7db80d4b272217b38ebadcd4a14b0a56","observation_id":"067fe033-1ea1-4e0c-b807-4ff601eb191c","resolution":{"observed_at":"2026-05-15T09:49:54.475351Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02705","last_updated":"2025-02-04T20:40:44Z","snapshot_observed_at":"2026-08-14T04:29:53.155173Z","submitted_at":"2025-02-04T20:40:44Z","title":"Rapidly Adapting Policies to the Real World via Simulation-Guided Fine-Tuning","version":1},"cited_work":{"arxiv_id":"2502.02705","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.02705","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rapidly adapting policies to the real world via simulation-guided fine- tuning","venue":null,"work_id":"2a9263b8-a900-4040-861c-62f87bff2840","year":2025},"citing_paper":{"arxiv_id":"2605.22123","last_updated":"2026-05-21T07:55:35Z","snapshot_observed_at":"2026-08-02T20:57:21.864024Z","submitted_at":"2026-05-21T07:55:35Z","title":"Beyond Pixels: Learning Invariant Rewards for Real-World Robotics From a Few Demonstrations","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-22T05:32:17.780012Z"},"links":{"cited_paper":"/paper/2502.02705","citing_paper":"/paper/2605.22123"},"observation_digest":"sha256:e2fb6b46eefb8896157f9ae1fc7278afc1c7cbbb20436a51c4468a643ef084f9","observation_id":"bbef72da-9f9e-42e2-be14-678f7680644e","resolution":{"observed_at":"2026-05-22T05:34:40.284030Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02705","last_updated":"2025-02-04T20:40:44Z","snapshot_observed_at":"2026-08-14T04:29:53.155173Z","submitted_at":"2025-02-04T20:40:44Z","title":"Rapidly Adapting Policies to the Real World via Simulation-Guided Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02705","snapshot_observed_at":"2026-08-01T01:41:50.557922Z","title":"Rapidly adapting policies to the real world via simulation-guided fine-tuning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25728","last_updated":"2026-07-28T13:52:12Z","snapshot_observed_at":"2026-08-09T09:28:19.957289Z","submitted_at":"2026-07-28T13:52:12Z","title":"Shared Voxel-Map-Based Cooperative Indoor UAV Guidance with a Multi-Agent Soft Actor-Critic Controller","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T01:41:50.557922Z"},"links":{"cited_paper":"/paper/2502.02705","citing_paper":"/paper/2607.25728"},"observation_digest":"sha256:3f4c9f3e283f9b8f16099a4401afebedc2c66050b548c71c85c2f870edfc3768","observation_id":"b285372f-d2df-4ee9-8cb0-5417e19f5528","resolution":{"observed_at":"2026-08-01T01:41:50.557922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2502.02705/citation-record","integrity":"/paper/2502.02705/integrity","json":"/paper/2502.02705/citation-record.json","paper":"/paper/2502.02705"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:31:11.361768Z","title":"Further suppose ∆r = max s r(s) − mins r(s) and ∆V = max s Vs(s) − mins Vs(s) are finite","venue":null,"work_id":"5aebc293-6695-4e7f-959e-d25c0357c772","year":2020},"citing_paper":{"arxiv_id":"2502.02705","last_updated":"2025-02-04T20:40:44Z","snapshot_observed_at":"2026-08-14T04:29:53.155173Z","submitted_at":"2025-02-04T20:40:44Z","title":"Rapidly Adapting Policies to the Real World via Simulation-Guided Fine-Tuning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-09T11:31:10.791377Z"},"links":{"citing_paper":"/paper/2502.02705"},"observation_digest":"sha256:6813b8c1aa4c53dd0e2d2ae660281e8fc105d7f6c0e1178151a07e1c6d4ab4dc","observation_id":"f200afa1-4088-42b5-a626-598fb834fd70","resolution":{"observed_at":"2026-08-09T11:31:11.366765Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2101.05982","last_updated":"2021-03-18T03:42:07Z","snapshot_observed_at":"2026-08-14T09:15:46.080027Z","submitted_at":"2021-01-15T06:25:58Z","title":"Randomized Ensembled Double Q-Learning: Learning Fast Without a Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.05982","snapshot_observed_at":"2026-08-09T11:31:10.639789Z","title":"Randomized ensembled double q-learning: Learning fast without a model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02705","last_updated":"2025-02-04T20:40:44Z","snapshot_observed_at":"2026-08-14T04:29:53.155173Z","submitted_at":"2025-02-04T20:40:44Z","title":"Rapidly Adapting Policies to the Real World via Simulation-Guided Fine-Tuning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-09T11:31:10.639789Z"},"links":{"cited_paper":"/paper/2101.05982","citing_paper":"/paper/2502.02705"},"observation_digest":"sha256:6de99a4def8310c358c7040b4df8e6bded8ac39a9ea440f193bd2d9e81bfd98a","observation_id":"ba8189ae-c835-4de2-a693-30fa28d15dae","resolution":{"observed_at":"2026-08-09T11:31:10.639789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:31:11.329214Z","title":"∞X t=0 γt¯r(st) # = V π real(s) − Vs(s0) ≥ Eρπ real(s)","venue":null,"work_id":"6ff3bade-c0b5-47bc-9991-d64b295f5609","year":2025},"citing_paper":{"arxiv_id":"2502.02705","last_updated":"2025-02-04T20:40:44Z","snapshot_observed_at":"2026-08-14T04:29:53.155173Z","submitted_at":"2025-02-04T20:40:44Z","title":"Rapidly Adapting Policies to the Real World via Simulation-Guided Fine-Tuning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-09T11:31:10.800593Z"},"links":{"citing_paper":"/paper/2502.02705"},"observation_digest":"sha256:c0e60b9c6f401b7c0161e65cb7cecb5fe517c3a351546743c713da3b4daaf4da","observation_id":"1f0ad521-36c7-459a-9c43-a803c24533e0","resolution":{"observed_at":"2026-08-09T11:31:11.334021Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.00568","last_updated":"2018-12-03T06:06:25Z","snapshot_observed_at":"2026-08-12T19:03:23.077411Z","submitted_at":"2018-12-03T06:06:25Z","title":"Visual Foresight: Model-Based Deep Reinforcement Learning for Vision-Based Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.00568","snapshot_observed_at":"2026-08-09T11:31:10.660450Z","title":"Visual fore- sight: Model-based deep reinforcement learning for vision-based robotic control","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.02705","last_updated":"2025-02-04T20:40:44Z","snapshot_observed_at":"2026-08-14T04:29:53.155173Z","submitted_at":"2025-02-04T20:40:44Z","title":"Rapidly Adapting Policies to the Real World via Simulation-Guided Fine-Tuning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-09T11:31:10.660450Z"},"links":{"cited_paper":"/paper/1812.00568","citing_paper":"/paper/2502.02705"},"observation_digest":"sha256:17b46e66088626210645cfe68bab9b3d0ff4042b9b3d8ea6fe3f6af52394247b","observation_id":"a6374873-e67e-449d-b2f5-f380bb0fd588","resolution":{"observed_at":"2026-08-09T11:31:10.660450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.12821","last_updated":"2023-05-22T08:29:00Z","snapshot_observed_at":"2026-08-13T11:37:30.287332Z","submitted_at":"2023-05-22T08:29:00Z","title":"FurnitureBench: Reproducible Real-World Benchmark for Long-Horizon Complex Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.12821","snapshot_observed_at":"2026-08-09T11:31:10.671456Z","title":"org/abs/2305.12821","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02705","last_updated":"2025-02-04T20:40:44Z","snapshot_observed_at":"2026-08-14T04:29:53.155173Z","submitted_at":"2025-02-04T20:40:44Z","title":"Rapidly Adapting Policies to the Real World via Simulation-Guided Fine-Tuning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-09T11:31:10.671456Z"},"links":{"cited_paper":"/paper/2305.12821","citing_paper":"/paper/2502.02705"},"observation_digest":"sha256:28f8b60c91a03ac9da4352c3d27ba66779f1b9078c99d37a5988bd0a78042233","observation_id":"2d05657e-a2fc-4cb6-a6fe-7a3f97185d8c","resolution":{"observed_at":"2026-08-09T11:31:10.671456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:31:11.477961Z","title":"What went wrong? closing the sim-to-real gap via differentiable causal discovery","venue":null,"work_id":"aa63afe5-010f-45b0-a287-fb67c7f1e504","year":2023},"citing_paper":{"arxiv_id":"2502.02705","last_updated":"2025-02-04T20:40:44Z","snapshot_observed_at":"2026-08-14T04:29:53.155173Z","submitted_at":"2025-02-04T20:40:44Z","title":"Rapidly Adapting Policies to the Real World via Simulation-Guided Fine-Tuning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-09T11:31:10.682334Z"},"links":{"citing_paper":"/paper/2502.02705"},"observation_digest":"sha256:efbf0474a4ad4f071305cdb69c8aeb0aab864758e4e9a738adfadb9ecbc03687","observation_id":"4b4e8856-c57c-45dc-9851-1db3dc103445","resolution":{"observed_at":"2026-08-09T11:31:11.482741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:31:11.463261Z","title":"RMA: rapid motor adaptation for legged robots","venue":null,"work_id":"9cb1ce5b-4619-4793-b5cc-e1055b4eef35","year":2025},"citing_paper":{"arxiv_id":"2502.02705","last_updated":"2025-02-04T20:40:44Z","snapshot_observed_at":"2026-08-14T04:29:53.155173Z","submitted_at":"2025-02-04T20:40:44Z","title":"Rapidly Adapting Policies to the Real World via Simulation-Guided Fine-Tuning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-09T11:31:10.687275Z"},"links":{"citing_paper":"/paper/2502.02705"},"observation_digest":"sha256:e653d5b60661c27cc6fff64466a6eb7bccb5da4035bce599e02b9000a492296a","observation_id":"31e1ca70-602d-456e-b6d9-d70ba6bdd539","resolution":{"observed_at":"2026-08-09T11:31:11.468213Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.06662","last_updated":"2022-03-13T14:30:55Z","snapshot_observed_at":"2026-08-13T16:24:11.137336Z","submitted_at":"2022-03-13T14:30:55Z","title":"DARA: Dynamics-Aware Reward Augmentation in Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.06662","snapshot_observed_at":"2026-08-09T11:31:10.691667Z","title":"Dara: Dynamics-aware reward augmentation in offline reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02705","last_updated":"2025-02-04T20:40:44Z","snapshot_observed_at":"2026-08-14T04:29:53.155173Z","submitted_at":"2025-02-04T20:40:44Z","title":"Rapidly Adapting Policies to the Real World via Simulation-Guided Fine-Tuning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-09T11:31:10.691667Z"},"links":{"cited_paper":"/paper/2203.06662","citing_paper":"/paper/2502.02705"},"observation_digest":"sha256:646a75d9ba05998191e19cd52aaa274ed4337b94c2a50f7f5d22a4f55b17bc72","observation_id":"b420593d-7593-4074-bc39-2452b91062a2","resolution":{"observed_at":"2026-08-09T11:31:10.691667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12931","last_updated":"2024-04-30T21:35:53Z","snapshot_observed_at":"2026-08-02T10:40:03.816188Z","submitted_at":"2023-10-19T17:31:01Z","title":"Eureka: Human-Level Reward Design via Coding Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12931","snapshot_observed_at":"2026-08-09T11:31:10.696945Z","title":"Eureka: Human-level reward design via coding large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02705","last_updated":"2025-02-04T20:40:44Z","snapshot_observed_at":"2026-08-14T04:29:53.155173Z","submitted_at":"2025-02-04T20:40:44Z","title":"Rapidly Adapting Policies to the Real World via Simulation-Guided Fine-Tuning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-09T11:31:10.696945Z"},"links":{"cited_paper":"/paper/2310.12931","citing_paper":"/paper/2502.02705"},"observation_digest":"sha256:3f08880f0eac32e9a44f8abfd27c9537be0593e61c12458dda56276c8136c61a","observation_id":"5819d1c4-b456-4357-947c-e70806da3f95","resolution":{"observed_at":"2026-08-09T11:31:10.696945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:31:11.447503Z","title":"Isaac gym: High performance gpu-based physics simulation for robot learning","venue":null,"work_id":"249a6887-b5e5-497f-9fd9-17e541596855","year":2021},"citing_paper":{"arxiv_id":"2502.02705","last_updated":"2025-02-04T20:40:44Z","snapshot_observed_at":"2026-08-14T04:29:53.155173Z","submitted_at":"2025-02-04T20:40:44Z","title":"Rapidly Adapting Policies to the Real World via Simulation-Guided Fine-Tuning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-09T11:31:10.702724Z"},"links":{"citing_paper":"/paper/2502.02705"},"observation_digest":"sha256:96a915f231edf8bb738f97f77db6934a7615a0eb5b6e5e54705d619f493e8c11","observation_id":"5d417802-c356-4b0b-a75e-2116b30f597a","resolution":{"observed_at":"2026-08-09T11:31:11.452871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12308","last_updated":"2024-06-27T01:22:30Z","snapshot_observed_at":"2026-08-14T08:38:51.732708Z","submitted_at":"2024-04-18T16:35:38Z","title":"ASID: Active Exploration for System Identification in Robotic Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12308","snapshot_observed_at":"2026-08-09T11:31:10.707879Z","title":"URL https://doi.org/10.1177/02783649231224053","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02705","last_updated":"2025-02-04T20:40:44Z","snapshot_observed_at":"2026-08-14T04:29:53.155173Z","submitted_at":"2025-02-04T20:40:44Z","title":"Rapidly Adapting Policies to the Real World via Simulation-Guided Fine-Tuning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-09T11:31:10.707879Z"},"links":{"cited_paper":"/paper/2404.12308","citing_paper":"/paper/2502.02705"},"observation_digest":"sha256:2e74270ec4e3e78ad9c3108e0bffdb9bb43c96442cd9bcd328fe274feab29c9a","observation_id":"6d3a13f7-8526-4076-96b7-fd3175598aab","resolution":{"observed_at":"2026-08-09T11:31:10.707879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.09359","last_updated":"2021-04-24T22:39:30Z","snapshot_observed_at":"2026-07-06T09:29:45.475911Z","submitted_at":"2020-06-16T17:54:41Z","title":"AWAC: Accelerating Online Reinforcement Learning with Offline Datasets","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.09359","snapshot_observed_at":"2026-08-09T11:31:10.713116Z","title":"Awac: Accelerating online rein- forcement learning with offline datasets","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2502.02705","last_updated":"2025-02-04T20:40:44Z","snapshot_observed_at":"2026-08-14T04:29:53.155173Z","submitted_at":"2025-02-04T20:40:44Z","title":"Rapidly Adapting Policies to the Real World via Simulation-Guided Fine-Tuning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-09T11:31:10.713116Z"},"links":{"cited_paper":"/paper/2006.09359","citing_paper":"/paper/2502.02705"},"observation_digest":"sha256:8b35deac9acd5e571eca5e5d7639a074362fb21c7f5accc90b9829f023f837f9","observation_id":"f607b61d-4dd9-4cce-bd01-df8e5bd3d53b","resolution":{"observed_at":"2026-08-09T11:31:10.713116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:31:11.431935Z","title":"Sim-to-real transfer of robotic control with dynamics randomization","venue":null,"work_id":"f0e053a9-d5dd-4830-a919-a78913b6d3f7","year":2018},"citing_paper":{"arxiv_id":"2502.02705","last_updated":"2025-02-04T20:40:44Z","snapshot_observed_at":"2026-08-14T04:29:53.155173Z","submitted_at":"2025-02-04T20:40:44Z","title":"Rapidly Adapting Policies to the Real World via Simulation-Guided Fine-Tuning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-09T11:31:10.718238Z"},"links":{"citing_paper":"/paper/2502.02705"},"observation_digest":"sha256:11831e037f4281897861438c23f5b9d730e78d854ac81a178fc94272a4446606","observation_id":"9d664a4c-e269-4b2c-852f-a80d26a62428","resolution":{"observed_at":"2026-08-09T11:31:11.436844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:31:11.416436Z","title":"14 Published as a conference paper at ICLR 2025 Aravind Rajeswaran, Vikash Kumar, Abhishek Gupta, Giulia Vezzani, John Schulman, Emanuel Todorov, and Sergey Levine","venue":null,"work_id":"b3fcecf4-e210-4238-94f6-333e5e9f1132","year":2025},"citing_paper":{"arxiv_id":"2502.02705","last_updated":"2025-02-04T20:40:44Z","snapshot_observed_at":"2026-08-14T04:29:53.155173Z","submitted_at":"2025-02-04T20:40:44Z","title":"Rapidly Adapting Policies to the Real World via Simulation-Guided Fine-Tuning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-09T11:31:10.723265Z"},"links":{"citing_paper":"/paper/2502.02705"},"observation_digest":"sha256:baaf7662ecccfda25fce4553c3b5b3fde05ddd0d4e62f30b7d7f40bf59fc9405","observation_id":"c997893d-ca5d-4f12-8ff1-c0110fae2c31","resolution":{"observed_at":"2026-08-09T11:31:11.421532Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.07860","last_updated":"2022-08-16T17:37:36Z","snapshot_observed_at":"2026-08-13T14:44:23.914749Z","submitted_at":"2022-08-16T17:37:36Z","title":"A Walk in the Park: Learning to Walk in 20 Minutes With Model-Free Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.07860","snapshot_observed_at":"2026-08-09T11:31:10.727780Z","title":"A walk in the park: Learning to walk in 20 minutes with model-free reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02705","last_updated":"2025-02-04T20:40:44Z","snapshot_observed_at":"2026-08-14T04:29:53.155173Z","submitted_at":"2025-02-04T20:40:44Z","title":"Rapidly Adapting Policies to the Real World via Simulation-Guided Fine-Tuning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-09T11:31:10.727780Z"},"links":{"cited_paper":"/paper/2208.07860","citing_paper":"/paper/2502.02705"},"observation_digest":"sha256:858b04ea4df583c024abfa6c6aea3b9af407f4ba0644fa263cf4a0c3df44ccf0","observation_id":"691abc2e-98b5-4e5c-a791-9e7d5ee60c29","resolution":{"observed_at":"2026-08-09T11:31:10.727780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:31:11.397232Z","title":"Integrated architectures for learning, planning, and reacting based on approxi- mating dynamic programming","venue":null,"work_id":"8e399a47-794b-415d-a894-f0c4f0f1e24b","year":1990},"citing_paper":{"arxiv_id":"2502.02705","last_updated":"2025-02-04T20:40:44Z","snapshot_observed_at":"2026-08-14T04:29:53.155173Z","submitted_at":"2025-02-04T20:40:44Z","title":"Rapidly Adapting Policies to the Real World via Simulation-Guided Fine-Tuning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-09T11:31:10.733142Z"},"links":{"citing_paper":"/paper/2502.02705"},"observation_digest":"sha256:4a254891a631b4ad4dd4ecc4d3545c02fa252c663fcbe5fc3811a2f9e53cd3e1","observation_id":"5172ce9e-65eb-4d46-80d5-5abb480c8306","resolution":{"observed_at":"2026-08-09T11:31:11.403276Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01885","last_updated":"2024-03-26T12:59:44Z","snapshot_observed_at":"2026-08-13T05:33:29.022955Z","submitted_at":"2023-11-03T12:54:05Z","title":"Domain Randomization via Entropy Maximization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01885","snapshot_observed_at":"2026-08-09T11:31:10.742814Z","title":"Dropo: Sim-to-real transfer with offline domain randomization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02705","last_updated":"2025-02-04T20:40:44Z","snapshot_observed_at":"2026-08-14T04:29:53.155173Z","submitted_at":"2025-02-04T20:40:44Z","title":"Rapidly Adapting Policies to the Real World via Simulation-Guided Fine-Tuning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-09T11:31:10.742814Z"},"links":{"cited_paper":"/paper/2311.01885","citing_paper":"/paper/2502.02705"},"observation_digest":"sha256:da1db923532c3569edb634eb0f29059cac54f6a66c04921644d7159e28877474","observation_id":"a7d09495-6b85-43a4-b46d-889e013f183d","resolution":{"observed_at":"2026-08-09T11:31:10.742814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03949","last_updated":"2024-11-24T02:02:33Z","snapshot_observed_at":"2026-08-13T04:01:59.358784Z","submitted_at":"2024-03-06T18:55:36Z","title":"Reconciling Reality through Simulation: A Real-to-Sim-to-Real Approach for Robust Manipulation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03949","snapshot_observed_at":"2026-08-09T11:31:10.753680Z","title":"URL https: //doi.org/10.48550/arXiv.2403.03949","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02705","last_updated":"2025-02-04T20:40:44Z","snapshot_observed_at":"2026-08-14T04:29:53.155173Z","submitted_at":"2025-02-04T20:40:44Z","title":"Rapidly Adapting Policies to the Real World via Simulation-Guided Fine-Tuning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-09T11:31:10.753680Z"},"links":{"cited_paper":"/paper/2403.03949","citing_paper":"/paper/2502.02705"},"observation_digest":"sha256:970b2b48116c21d2e274e6a005864e42f2e9c274b69f530167104eaa48e7040f","observation_id":"c4fb5b0d-48b6-4735-b0cf-67483e337c62","resolution":{"observed_at":"2026-08-09T11:31:10.753680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.08649","last_updated":"2019-06-20T14:13:12Z","snapshot_observed_at":"2026-08-14T16:05:26.608538Z","submitted_at":"2019-06-20T14:13:12Z","title":"Exploring Model-based Planning with Policy Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.08649","snapshot_observed_at":"2026-08-09T11:31:10.759214Z","title":"Exploring model-based planning with policy networks.arXiv preprint arXiv:1906.08649,","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2502.02705","last_updated":"2025-02-04T20:40:44Z","snapshot_observed_at":"2026-08-14T04:29:53.155173Z","submitted_at":"2025-02-04T20:40:44Z","title":"Rapidly Adapting Policies to the Real World via Simulation-Guided Fine-Tuning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-09T11:31:10.759214Z"},"links":{"cited_paper":"/paper/1906.08649","citing_paper":"/paper/2502.02705"},"observation_digest":"sha256:9a0b97054c28a8d720a0e718b83aaf6df1ca21c673da2433f78fc692bc25cf02","observation_id":"2b78bf66-7275-4f0c-94a6-2e1ccaa5869e","resolution":{"observed_at":"2026-08-09T11:31:10.759214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06721","last_updated":"2022-11-18T00:17:21Z","snapshot_observed_at":"2026-08-13T14:45:38.216950Z","submitted_at":"2022-08-13T20:04:17Z","title":"Lyapunov Design for Robust and Efficient Robotic Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.06721","snapshot_observed_at":"2026-08-09T11:31:10.765781Z","title":"Lyapunov design for robust and efficient robotic reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02705","last_updated":"2025-02-04T20:40:44Z","snapshot_observed_at":"2026-08-14T04:29:53.155173Z","submitted_at":"2025-02-04T20:40:44Z","title":"Rapidly Adapting Policies to the Real World via Simulation-Guided Fine-Tuning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-09T11:31:10.765781Z"},"links":{"cited_paper":"/paper/2208.06721","citing_paper":"/paper/2502.02705"},"observation_digest":"sha256:bd9a9ca808bce0c3a041bf41e7df5e69c4ca12441f5421117540cb3ba4827f85","observation_id":"27ab88ee-2b3d-42f3-8844-7d79ac2833d4","resolution":{"observed_at":"2026-08-09T11:31:10.765781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.08647","last_updated":"2023-06-16T23:02:21Z","snapshot_observed_at":"2026-08-14T02:24:36.496182Z","submitted_at":"2023-06-14T17:27:10Z","title":"Language to Rewards for Robotic Skill Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.08647","snapshot_observed_at":"2026-08-09T11:31:10.776502Z","title":"roboticsproceedings.org/rss13/p48.html","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02705","last_updated":"2025-02-04T20:40:44Z","snapshot_observed_at":"2026-08-14T04:29:53.155173Z","submitted_at":"2025-02-04T20:40:44Z","title":"Rapidly Adapting Policies to the Real World via Simulation-Guided Fine-Tuning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-09T11:31:10.776502Z"},"links":{"cited_paper":"/paper/2306.08647","citing_paper":"/paper/2502.02705"},"observation_digest":"sha256:96aa84bc4505fe9a2640ed9b02d2c74dfe50a6909e691d97b541f481739e7b48","observation_id":"2bda9692-72c5-4e35-b572-8005643dc710","resolution":{"observed_at":"2026-08-09T11:31:10.776502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.07762","last_updated":"2025-07-02T08:19:18Z","snapshot_observed_at":"2026-08-13T22:36:58.274520Z","submitted_at":"2024-12-10T18:57:12Z","title":"Efficient Online Reinforcement Learning Fine-Tuning Need Not Retain Offline Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.07762","snapshot_observed_at":"2026-08-09T11:31:10.781558Z","title":"Efficient online reinforce- ment learning fine-tuning need not retain offline data","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02705","last_updated":"2025-02-04T20:40:44Z","snapshot_observed_at":"2026-08-14T04:29:53.155173Z","submitted_at":"2025-02-04T20:40:44Z","title":"Rapidly Adapting Policies to the Real World via Simulation-Guided Fine-Tuning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-09T11:31:10.781558Z"},"links":{"cited_paper":"/paper/2412.07762","citing_paper":"/paper/2502.02705"},"observation_digest":"sha256:3de7023092d1a9d20c8dab42e823a1e74b12f3bb4c38756bab91bd297e2f5e98","observation_id":"1ddfece0-6ab0-4aea-b6bf-7c44da3370bb","resolution":{"observed_at":"2026-08-09T11:31:10.781558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:31:11.345193Z","title":"γH Vsim(sH ) + H−1X t=1 γtr(st) − Vsim(s0) # = E γH Vsim(sH ) − γH−1Vsim(sH−1) + γH r(sH−1) + E","venue":null,"work_id":"ad33a38b-375c-423e-a7bb-29314a266ba7","year":2025},"citing_paper":{"arxiv_id":"2502.02705","last_updated":"2025-02-04T20:40:44Z","snapshot_observed_at":"2026-08-14T04:29:53.155173Z","submitted_at":"2025-02-04T20:40:44Z","title":"Rapidly Adapting Policies to the Real World via Simulation-Guided Fine-Tuning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-09T11:31:10.795959Z"},"links":{"citing_paper":"/paper/2502.02705"},"observation_digest":"sha256:6e419858a2013ae34f9a0790db5e57088c1071f5262cf954cf8b5ee9babbe78e","observation_id":"71ae0c97-51cd-4358-a01e-b5d603cbb963","resolution":{"observed_at":"2026-08-09T11:31:11.350095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:31:11.312700Z","title":null,"venue":null,"work_id":"5146b316-0ef2-4b13-bdf2-eb9dd2aa9c66","year":2025},"citing_paper":{"arxiv_id":"2502.02705","last_updated":"2025-02-04T20:40:44Z","snapshot_observed_at":"2026-08-14T04:29:53.155173Z","submitted_at":"2025-02-04T20:40:44Z","title":"Rapidly Adapting Policies to the Real World via Simulation-Guided Fine-Tuning","version":1},"reference_index":512,"source":"pdf_text","source_observed_at":"2026-08-09T11:31:10.805828Z"},"links":{"citing_paper":"/paper/2502.02705"},"observation_digest":"sha256:6efd0b6875a3b0ec4e33a05200519cf835544e29706df0fb0d0bc463600b1103","observation_id":"b4f302e0-4a95-4672-83ea-5809449075c5","resolution":{"observed_at":"2026-08-09T11:31:11.317789Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:31:11.289569Z","title":"We don’t train on any simulation data during real-world fine-tuning because we empirically found it didn’t help fine-tuning performance in our settings","venue":null,"work_id":"1d15430c-a4b3-404c-abc6-e2103156181e","year":2025},"citing_paper":{"arxiv_id":"2502.02705","last_updated":"2025-02-04T20:40:44Z","snapshot_observed_at":"2026-08-14T04:29:53.155173Z","submitted_at":"2025-02-04T20:40:44Z","title":"Rapidly Adapting Policies to the Real World via Simulation-Guided Fine-Tuning","version":1},"reference_index":1536,"source":"pdf_text","source_observed_at":"2026-08-09T11:31:10.810713Z"},"links":{"citing_paper":"/paper/2502.02705"},"observation_digest":"sha256:fb2e6c0128a6ba681dd12d9fa54646b325000458ad704c1efd31bdfa6ff51cf6","observation_id":"4c9efcfc-060b-4a32-aa62-4a803ab023ed","resolution":{"observed_at":"2026-08-09T11:31:11.297912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:31:10.738072Z","title":"doi: 10.1145/122344.122377","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02705","last_updated":"2025-02-04T20:40:44Z","snapshot_observed_at":"2026-08-14T04:29:53.155173Z","submitted_at":"2025-02-04T20:40:44Z","title":"Rapidly Adapting Policies to the Real World via Simulation-Guided Fine-Tuning","version":1},"reference_index":1991,"source":"pdf_text","source_observed_at":"2026-08-09T11:31:10.738072Z"},"links":{"citing_paper":"/paper/2502.02705"},"observation_digest":"sha256:0efe80610b5525f2271298e5bdfd3bf153ba03e0cf6d7090bfaeed5c17db1393","observation_id":"ffad0629-a6c6-4468-bb3f-66938311de73","resolution":{"observed_at":"2026-08-09T11:31:10.738072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:31:11.378856Z","title":"16 Published as a conference paper at ICLR 2025 A P ROOFS Notation Recap","venue":null,"work_id":"bb7962ca-b8f1-4b21-81a3-21d5b61026bb","year":2025},"citing_paper":{"arxiv_id":"2502.02705","last_updated":"2025-02-04T20:40:44Z","snapshot_observed_at":"2026-08-14T04:29:53.155173Z","submitted_at":"2025-02-04T20:40:44Z","title":"Rapidly Adapting Policies to the Real World via Simulation-Guided Fine-Tuning","version":1},"reference_index":2008,"source":"pdf_text","source_observed_at":"2026-08-09T11:31:10.786477Z"},"links":{"citing_paper":"/paper/2502.02705"},"observation_digest":"sha256:20c7b931c69bfc417168a653b30d94feff77a2d5e508cc2a6386b33c67695280","observation_id":"9fba0ee2-6ab2-40b1-a112-85f1dd30b7f9","resolution":{"observed_at":"2026-08-09T11:31:11.384997Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03949","last_updated":"2024-11-24T02:02:33Z","snapshot_observed_at":"2026-08-13T04:01:59.358784Z","submitted_at":"2024-03-06T18:55:36Z","title":"Reconciling Reality through Simulation: A Real-to-Sim-to-Real Approach for Robust Manipulation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03949","snapshot_observed_at":"2026-08-09T11:31:10.747797Z","title":"Reconciling reality through simulation: A real-to-sim-to-real approach for robust ma- nipulation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02705","last_updated":"2025-02-04T20:40:44Z","snapshot_observed_at":"2026-08-14T04:29:53.155173Z","submitted_at":"2025-02-04T20:40:44Z","title":"Rapidly Adapting Policies to the Real World via Simulation-Guided Fine-Tuning","version":1},"reference_index":2012,"source":"pdf_text","source_observed_at":"2026-08-09T11:31:10.747797Z"},"links":{"cited_paper":"/paper/2403.03949","citing_paper":"/paper/2502.02705"},"observation_digest":"sha256:f2cd54a126a4b43c30d14ab2eda0254c1900e5a4bcb56e6b075f0141b9b2b422","observation_id":"990175b0-5743-4621-98f1-df4ffdb23c40","resolution":{"observed_at":"2026-08-09T11:31:10.747797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.02198","last_updated":"2024-05-20T20:09:24Z","snapshot_observed_at":"2026-08-14T04:53:12.590329Z","submitted_at":"2023-11-03T19:03:20Z","title":"Imitation Bootstrapped Reinforcement Learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.02198","snapshot_observed_at":"2026-08-09T11:31:10.676629Z","title":"Imitation bootstrapped reinforcement learn- ing","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02705","last_updated":"2025-02-04T20:40:44Z","snapshot_observed_at":"2026-08-14T04:29:53.155173Z","submitted_at":"2025-02-04T20:40:44Z","title":"Rapidly Adapting Policies to the Real World via Simulation-Guided Fine-Tuning","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-09T11:31:10.676629Z"},"links":{"cited_paper":"/paper/2311.02198","citing_paper":"/paper/2502.02705"},"observation_digest":"sha256:e9fab26364b6a118115f1e43c59b0f91c9187203b70f0fcd2cd5ebc7080cef3d","observation_id":"abd4174c-d514-4e8b-9ee8-4ab1c9174b25","resolution":{"observed_at":"2026-08-09T11:31:10.676629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02868","last_updated":"2024-07-17T09:29:19Z","snapshot_observed_at":"2026-08-13T04:26:55.794008Z","submitted_at":"2024-02-05T10:30:47Z","title":"Fine-tuning Reinforcement Learning Models is Secretly a Forgetting Mitigation Problem","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02868","snapshot_observed_at":"2026-08-09T11:31:10.771362Z","title":"Fine-tuning reinforcement learning models is secretly a forgetting mitigation problem","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.02705","last_updated":"2025-02-04T20:40:44Z","snapshot_observed_at":"2026-08-14T04:29:53.155173Z","submitted_at":"2025-02-04T20:40:44Z","title":"Rapidly Adapting Policies to the Real World via Simulation-Guided Fine-Tuning","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-09T11:31:10.771362Z"},"links":{"cited_paper":"/paper/2402.02868","citing_paper":"/paper/2502.02705"},"observation_digest":"sha256:c9019dd3e6fe48359d4546350fbb99f03676f9f84cfcb74d7de935d05f542895","observation_id":"80f01451-24cf-4fe0-bae2-1284d03b69fb","resolution":{"observed_at":"2026-08-09T11:31:10.771362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.13916","last_updated":"2021-04-14T23:38:31Z","snapshot_observed_at":"2026-08-11T17:50:10.167544Z","submitted_at":"2020-06-24T17:47:37Z","title":"Off-Dynamics Reinforcement Learning: Training for Transfer with Domain Classifiers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.13916","snapshot_observed_at":"2026-08-09T11:31:10.665872Z","title":"Off-dynamics reinforcement learning: Training for transfer with domain classifiers","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2502.02705","last_updated":"2025-02-04T20:40:44Z","snapshot_observed_at":"2026-08-14T04:29:53.155173Z","submitted_at":"2025-02-04T20:40:44Z","title":"Rapidly Adapting Policies to the Real World via Simulation-Guided Fine-Tuning","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-09T11:31:10.665872Z"},"links":{"cited_paper":"/paper/2006.13916","citing_paper":"/paper/2502.02705"},"observation_digest":"sha256:40f638f41031000b51007e0472f482f4c4de46f93cf39668571f2650a75e2179","observation_id":"fe82fe4d-9f49-434f-9614-cfe244d6b4e6","resolution":{"observed_at":"2026-08-09T11:31:10.665872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06680","last_updated":"2019-12-13T19:56:40Z","snapshot_observed_at":"2026-08-13T14:13:07.807518Z","submitted_at":"2019-12-13T19:56:40Z","title":"Dota 2 with Large Scale Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06680","snapshot_observed_at":"2026-08-09T11:31:10.635032Z","title":"Mohak Bhardwaj, Sanjiban Choudhury, and Byron Boots","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2502.02705","last_updated":"2025-02-04T20:40:44Z","snapshot_observed_at":"2026-08-14T04:29:53.155173Z","submitted_at":"2025-02-04T20:40:44Z","title":"Rapidly Adapting Policies to the Real World via Simulation-Guided Fine-Tuning","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-09T11:31:10.635032Z"},"links":{"cited_paper":"/paper/1912.06680","citing_paper":"/paper/2502.02705"},"observation_digest":"sha256:db23d4b31bd9ae5eb0b30f137866d8d7ef101674bfafcc3c331270066e6d63bc","observation_id":"8c2261ac-41e5-444e-8a78-21e3ab34c1f8","resolution":{"observed_at":"2026-08-09T11:31:10.635032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11656","last_updated":"2024-05-31T16:44:06Z","snapshot_observed_at":"2026-08-13T00:04:13.152464Z","submitted_at":"2024-05-19T20:01:29Z","title":"URDFormer: A Pipeline for Constructing Articulated Simulation Environments from Real-World Images","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.11656","snapshot_observed_at":"2026-08-09T11:31:10.645494Z","title":"Urdformer: A pipeline for constructing articulated simula- tion environments from real-world images","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02705","last_updated":"2025-02-04T20:40:44Z","snapshot_observed_at":"2026-08-14T04:29:53.155173Z","submitted_at":"2025-02-04T20:40:44Z","title":"Rapidly Adapting Policies to the Real World via Simulation-Guided Fine-Tuning","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-09T11:31:10.645494Z"},"links":{"cited_paper":"/paper/2405.11656","citing_paper":"/paper/2502.02705"},"observation_digest":"sha256:c2be8ecfcd34229f6fca20d288188d91783775e8b51012d1f1422528e7e77ee7","observation_id":"c79dad8c-042a-4cc1-bbbc-84b1a4888474","resolution":{"observed_at":"2026-08-09T11:31:10.645494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:31:11.492566Z","title":"Yuqing Du, Olivia Watkins, Trevor Darrell, Pieter Abbeel, and Deepak Pathak","venue":null,"work_id":"99901041-a55f-4b6e-a7bd-e8a23a27b5b8","year":2022},"citing_paper":{"arxiv_id":"2502.02705","last_updated":"2025-02-04T20:40:44Z","snapshot_observed_at":"2026-08-14T04:29:53.155173Z","submitted_at":"2025-02-04T20:40:44Z","title":"Rapidly Adapting Policies to the Real World via Simulation-Guided Fine-Tuning","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-09T11:31:10.655412Z"},"links":{"citing_paper":"/paper/2502.02705"},"observation_digest":"sha256:a017b0a9a82f342c100e11310238108a10925d4a8331889287b7710202e51176","observation_id":"d004ffad-3089-484b-9a69-bcc78b15ca00","resolution":{"observed_at":"2026-08-09T11:31:11.497464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:31:11.508082Z","title":"ProcTHOR: Large-scale embodied AI using procedural generation","venue":null,"work_id":"9cdc9900-4833-4070-8354-187ff031f875","year":2022},"citing_paper":{"arxiv_id":"2502.02705","last_updated":"2025-02-04T20:40:44Z","snapshot_observed_at":"2026-08-14T04:29:53.155173Z","submitted_at":"2025-02-04T20:40:44Z","title":"Rapidly Adapting Policies to the Real World via Simulation-Guided Fine-Tuning","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-09T11:31:10.650564Z"},"links":{"citing_paper":"/paper/2502.02705"},"observation_digest":"sha256:28327b323993adb61964340361ded2cd758c31da8af0947226bcc123e83fa5ef","observation_id":"f868a3a1-a76a-4d96-848b-d441a5776a05","resolution":{"observed_at":"2026-08-09T11:31:11.513809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.02705","last_updated":"2025-02-04T20:40:44Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-14T04:29:53.155173Z","submitted_at":"2025-02-04T20:40:44Z","title":"Rapidly Adapting Policies to the Real World via Simulation-Guided Fine-Tuning"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":0,"verified_fuzzy":13},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 5 inbound Pith citation observations for arXiv:2502.02705."}