{"as_of":"2026-08-11T12:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fcb1db317c82b9ea8ad8fff871770266cbd73dd93a170b100bf323fd54758a08","coverage":[{"denominator":37,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T14:25:11.996904Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T17:43:53.423654Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T23:17:29.871512Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.16389","last_updated":"2025-09-07T01:22:45Z","snapshot_observed_at":"2026-08-10T14:20:08.514108Z","submitted_at":"2025-01-26T00:27:04Z","title":"Bridging the Sim2Real Gap: Vision Encoder Pre-Training for Visuomotor Policy Transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.16389","snapshot_observed_at":"2026-08-06T17:43:53.423654Z","title":"Bridging the sim2real gap: Vision encoder pre-training for visuomotor policy transfer,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.10087","last_updated":"2025-07-14T09:13:07Z","snapshot_observed_at":"2026-08-09T16:03:14.420559Z","submitted_at":"2025-07-14T09:13:07Z","title":"Foundation Model Driven Robotics: A Comprehensive Review","version":1},"reference_index":160,"source":"pdf_text","source_observed_at":"2026-08-06T17:43:53.423654Z"},"links":{"cited_paper":"/paper/2501.16389","citing_paper":"/paper/2507.10087"},"observation_digest":"sha256:ce4645f7e478023023100f045a9d0e642b2d8aa6f11683accf5361430f21a5a3","observation_id":"79be9ace-f054-4d7b-99fb-a61a9dfe33e7","resolution":{"observed_at":"2026-08-06T17:43:53.423654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16389","last_updated":"2025-09-07T01:22:45Z","snapshot_observed_at":"2026-08-10T14:20:08.514108Z","submitted_at":"2025-01-26T00:27:04Z","title":"Bridging the Sim2Real Gap: Vision Encoder Pre-Training for Visuomotor Policy Transfer","version":2},"cited_work":{"arxiv_id":"2501.16389","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.16389","snapshot_observed_at":"2026-07-02T23:17:29.871512Z","title":"Bridging the sim2real gap: Vision encoder pre-training for visuomotor policy transfer,","venue":null,"work_id":"6d4b9610-7bfa-4e9f-a1ce-c4dc422d55a8","year":2025},"citing_paper":{"arxiv_id":"2606.08564","last_updated":"2026-06-07T10:41:38Z","snapshot_observed_at":"2026-08-02T02:27:26.406086Z","submitted_at":"2026-06-07T10:41:38Z","title":"Real-IKEA: Physical Fidelity is the Prerequisite for Robust Manipulation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-27T18:18:34.508629Z"},"links":{"cited_paper":"/paper/2501.16389","citing_paper":"/paper/2606.08564"},"observation_digest":"sha256:c0a59ceed7ee668d4f1dba5ee616788c00dabbb49eb3cfa19e085c16817ab9cf","observation_id":"e6e0a101-94d8-48b3-93c6-729d07da8b50","resolution":{"observed_at":"2026-07-02T23:17:29.873350Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.16389/citation-record","integrity":"/paper/2501.16389/integrity","json":"/paper/2501.16389/citation-record.json","paper":"/paper/2501.16389"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1017/s0269888998002033","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:25:12.036580Z","title":"On autonomous robots,","venue":null,"work_id":"18681563-acb9-4a00-a837-cc52fb099069","year":1998},"citing_paper":{"arxiv_id":"2501.16389","last_updated":"2025-09-07T01:22:45Z","snapshot_observed_at":"2026-08-10T14:20:08.514108Z","submitted_at":"2025-01-26T00:27:04Z","title":"Bridging the Sim2Real Gap: Vision Encoder Pre-Training for Visuomotor Policy Transfer","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T14:25:11.852074Z"},"links":{"citing_paper":"/paper/2501.16389"},"observation_digest":"sha256:412400f9a3b866bddec2701e5c2136147641bec335785d7e726868b200573526","observation_id":"4b106370-674e-4ed8-841f-43f15cfb5e2f","resolution":{"observed_at":"2026-08-10T14:25:12.041728Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:25:12.634643Z","title":"Diffusion policy: Visuomotor policy learning via action diffusion,","venue":null,"work_id":"034145a8-2887-418a-84cc-dd4b6715200b","year":null},"citing_paper":{"arxiv_id":"2501.16389","last_updated":"2025-09-07T01:22:45Z","snapshot_observed_at":"2026-08-10T14:20:08.514108Z","submitted_at":"2025-01-26T00:27:04Z","title":"Bridging the Sim2Real Gap: Vision Encoder Pre-Training for Visuomotor Policy Transfer","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T14:25:11.856399Z"},"links":{"citing_paper":"/paper/2501.16389"},"observation_digest":"sha256:a52ef537e6fbb30987b600f712ed5e2fc0c15cd3b6c29f5d3bf3fa31ce7164a7","observation_id":"29b4e106-9065-458c-b996-0e55b60ccac3","resolution":{"observed_at":"2026-08-10T14:25:12.638082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:25:12.624567Z","title":"Self-supervised correspondence in visuomotor policy learning,","venue":null,"work_id":"ba9e8ee3-a53a-4dd1-88d9-536cca9f4389","year":null},"citing_paper":{"arxiv_id":"2501.16389","last_updated":"2025-09-07T01:22:45Z","snapshot_observed_at":"2026-08-10T14:20:08.514108Z","submitted_at":"2025-01-26T00:27:04Z","title":"Bridging the Sim2Real Gap: Vision Encoder Pre-Training for Visuomotor Policy Transfer","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T14:25:11.865578Z"},"links":{"citing_paper":"/paper/2501.16389"},"observation_digest":"sha256:6ca013237b2b6fa2fbcfc3b3e270050b87a3b512a5bc1494b7ef784ebf081ec0","observation_id":"0765b91a-117b-4be1-9c93-fd85d0c90f44","resolution":{"observed_at":"2026-08-10T14:25:12.628038Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03109","last_updated":"2022-10-06T17:59:01Z","snapshot_observed_at":"2026-08-10T20:46:50.330118Z","submitted_at":"2022-10-06T17:59:01Z","title":"Real-World Robot Learning with Masked Visual Pre-training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03109","snapshot_observed_at":"2026-08-10T14:25:11.872790Z","title":"Real-world robot learning with masked visual pre-training,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.16389","last_updated":"2025-09-07T01:22:45Z","snapshot_observed_at":"2026-08-10T14:20:08.514108Z","submitted_at":"2025-01-26T00:27:04Z","title":"Bridging the Sim2Real Gap: Vision Encoder Pre-Training for Visuomotor Policy Transfer","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T14:25:11.872790Z"},"links":{"cited_paper":"/paper/2210.03109","citing_paper":"/paper/2501.16389"},"observation_digest":"sha256:c83c0e40d971709e36f5adf239212e1a7022f0864c75ad4e4d1edc4dd6a6b201","observation_id":"f62cd1d4-d8b3-413d-8346-7b1305da04f1","resolution":{"observed_at":"2026-08-10T14:25:11.872790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:25:11.876772Z","title":"Transferring policy of deep reinforcement learning from simulation to reality for robotics,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.16389","last_updated":"2025-09-07T01:22:45Z","snapshot_observed_at":"2026-08-10T14:20:08.514108Z","submitted_at":"2025-01-26T00:27:04Z","title":"Bridging the Sim2Real Gap: Vision Encoder Pre-Training for Visuomotor Policy Transfer","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T14:25:11.876772Z"},"links":{"citing_paper":"/paper/2501.16389"},"observation_digest":"sha256:49045ea353d68b677cfe284139819f672fd2c9baeb977b8ab82fa0671b0ef5b6","observation_id":"6cb39def-0bab-4090-8154-a9690f0c0a43","resolution":{"observed_at":"2026-08-10T14:25:11.876772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2411.06657","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:25:12.433937Z","title":"Renaissance: Investigating the pretraining of vision-language encoders,","venue":null,"work_id":"43c55a84-f89e-47b1-a009-3ef0dbacaef4","year":2024},"citing_paper":{"arxiv_id":"2501.16389","last_updated":"2025-09-07T01:22:45Z","snapshot_observed_at":"2026-08-10T14:20:08.514108Z","submitted_at":"2025-01-26T00:27:04Z","title":"Bridging the Sim2Real Gap: Vision Encoder Pre-Training for Visuomotor Policy Transfer","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T14:25:11.881093Z"},"links":{"citing_paper":"/paper/2501.16389"},"observation_digest":"sha256:4b34bb92e3af8d8c9e03479916fc095142a7e07493ac78dc28f5bd02563d3a7c","observation_id":"4c57c39d-0d6e-4527-9c25-962ee03616de","resolution":{"observed_at":"2026-08-10T14:25:12.440760Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:25:12.614372Z","title":"What do we learn from a large-scale study of pre-trained visual representations in sim and real environments?","venue":null,"work_id":"d671a135-7667-49ce-acb9-57dd5b857905","year":null},"citing_paper":{"arxiv_id":"2501.16389","last_updated":"2025-09-07T01:22:45Z","snapshot_observed_at":"2026-08-10T14:20:08.514108Z","submitted_at":"2025-01-26T00:27:04Z","title":"Bridging the Sim2Real Gap: Vision Encoder Pre-Training for Visuomotor Policy Transfer","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T14:25:11.884739Z"},"links":{"citing_paper":"/paper/2501.16389"},"observation_digest":"sha256:c26f105ecd9576bf29527a8dc1990be27c51a7baad0d28ac518ac3c85efa65a2","observation_id":"60e0646f-db06-470f-9b39-bb862d2f829e","resolution":{"observed_at":"2026-08-10T14:25:12.617996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:25:12.604021Z","title":"What makes pre-trained visual representations successful for robust manipulation?","venue":null,"work_id":"c1ce27cc-a053-4725-9c5f-c4e8a3baace8","year":2024},"citing_paper":{"arxiv_id":"2501.16389","last_updated":"2025-09-07T01:22:45Z","snapshot_observed_at":"2026-08-10T14:20:08.514108Z","submitted_at":"2025-01-26T00:27:04Z","title":"Bridging the Sim2Real Gap: Vision Encoder Pre-Training for Visuomotor Policy Transfer","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T14:25:11.892799Z"},"links":{"citing_paper":"/paper/2501.16389"},"observation_digest":"sha256:4105168aa42e07ae7883770e14de2b6c859903b235741dde5f8e2efaf223012a","observation_id":"b8eb694c-c504-4db5-94c4-9f022e2ca2ad","resolution":{"observed_at":"2026-08-10T14:25:12.607472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:25:11.896511Z","title":"Imagenet: A large-scale hierarchical image database,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2501.16389","last_updated":"2025-09-07T01:22:45Z","snapshot_observed_at":"2026-08-10T14:20:08.514108Z","submitted_at":"2025-01-26T00:27:04Z","title":"Bridging the Sim2Real Gap: Vision Encoder Pre-Training for Visuomotor Policy Transfer","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T14:25:11.896511Z"},"links":{"citing_paper":"/paper/2501.16389"},"observation_digest":"sha256:a9dfdf13d4edf1e5868de3b2210af37b8fed3bf7b32bc9a16b92f63acb73feb4","observation_id":"bb2bbc4a-90a2-485e-beca-30a1467255ba","resolution":{"observed_at":"2026-08-10T14:25:11.896511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:25:11.888221Z","title":"Available: https://doi.org/10.1109/ICRA57147.2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.16389","last_updated":"2025-09-07T01:22:45Z","snapshot_observed_at":"2026-08-10T14:20:08.514108Z","submitted_at":"2025-01-26T00:27:04Z","title":"Bridging the Sim2Real Gap: Vision Encoder Pre-Training for Visuomotor Policy Transfer","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T14:25:11.888221Z"},"links":{"citing_paper":"/paper/2501.16389"},"observation_digest":"sha256:9ea33fa7e988986da20de3dfe9e92a42f9def94e987cddc15944ad80d3fd6df9","observation_id":"21819738-8c0d-46a0-97c5-6c300fd0b6d9","resolution":{"observed_at":"2026-08-10T14:25:11.888221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.12345","last_updated":"2024-05-31T21:36:57Z","snapshot_observed_at":"2026-07-06T13:45:34.899866Z","submitted_at":"2022-08-25T21:08:01Z","title":"Light-weight probing of unsupervised representations for Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.12345","snapshot_observed_at":"2026-08-10T14:25:11.903992Z","title":"Light- weight probing of unsupervised representations for reinforcement learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.16389","last_updated":"2025-09-07T01:22:45Z","snapshot_observed_at":"2026-08-10T14:20:08.514108Z","submitted_at":"2025-01-26T00:27:04Z","title":"Bridging the Sim2Real Gap: Vision Encoder Pre-Training for Visuomotor Policy Transfer","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T14:25:11.903992Z"},"links":{"cited_paper":"/paper/2208.12345","citing_paper":"/paper/2501.16389"},"observation_digest":"sha256:14f4836b6fb9bd75e22eda2f3c814d500518df990c9609d996a35f4d5c642aa5","observation_id":"2cda4ae2-ec8b-49f1-8a66-bc03ef828e18","resolution":{"observed_at":"2026-08-10T14:25:11.903992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.12821","last_updated":"2023-05-22T08:29:00Z","snapshot_observed_at":"2026-08-01T20:31:21.496677Z","submitted_at":"2023-05-22T08:29:00Z","title":"FurnitureBench: Reproducible Real-World Benchmark for Long-Horizon Complex Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.12821","snapshot_observed_at":"2026-08-10T14:25:11.907954Z","title":"Furniturebench: Reproducible real-world benchmark for long-horizon complex manipulation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.16389","last_updated":"2025-09-07T01:22:45Z","snapshot_observed_at":"2026-08-10T14:20:08.514108Z","submitted_at":"2025-01-26T00:27:04Z","title":"Bridging the Sim2Real Gap: Vision Encoder Pre-Training for Visuomotor Policy Transfer","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T14:25:11.907954Z"},"links":{"cited_paper":"/paper/2305.12821","citing_paper":"/paper/2501.16389"},"observation_digest":"sha256:8f8e047316d250482e58fc82a98c13df79493f727945f2397fd57b5375d6ca9b","observation_id":"4fd52381-588b-44cb-b6fe-7539255f0995","resolution":{"observed_at":"2026-08-10T14:25:11.907954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:25:12.586861Z","title":"Learning to manipulate anywhere: A visual generalizable framework for reinforcement learning,","venue":null,"work_id":"2279ad88-f2b5-4dc8-aefc-e17a46e2a234","year":2024},"citing_paper":{"arxiv_id":"2501.16389","last_updated":"2025-09-07T01:22:45Z","snapshot_observed_at":"2026-08-10T14:20:08.514108Z","submitted_at":"2025-01-26T00:27:04Z","title":"Bridging the Sim2Real Gap: Vision Encoder Pre-Training for Visuomotor Policy Transfer","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T14:25:11.900316Z"},"links":{"citing_paper":"/paper/2501.16389"},"observation_digest":"sha256:9ffd3b34f657753a4d7c307e36a5dfbb042419a9090a8483e6ee6220437b21da","observation_id":"c2db903c-6425-4b6b-865b-7ba68fd7fa37","resolution":{"observed_at":"2026-08-10T14:25:12.591072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.12601","last_updated":"2022-11-18T05:57:09Z","snapshot_observed_at":"2026-08-11T08:36:53.636356Z","submitted_at":"2022-03-23T17:55:09Z","title":"R3M: A Universal Visual Representation for Robot Manipulation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.12601","snapshot_observed_at":"2026-08-10T14:25:11.919782Z","title":"R3m: A universal visual representation for robot manipulation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.16389","last_updated":"2025-09-07T01:22:45Z","snapshot_observed_at":"2026-08-10T14:20:08.514108Z","submitted_at":"2025-01-26T00:27:04Z","title":"Bridging the Sim2Real Gap: Vision Encoder Pre-Training for Visuomotor Policy Transfer","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T14:25:11.919782Z"},"links":{"cited_paper":"/paper/2203.12601","citing_paper":"/paper/2501.16389"},"observation_digest":"sha256:884e42bbb7828df75995864ebe8a01d001b94848aefcbfca53f97883e0b1ccb3","observation_id":"4d5bfdef-a012-404b-a2e5-b1a0dd89e351","resolution":{"observed_at":"2026-08-10T14:25:11.919782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:25:12.575790Z","title":"From imitation to refinement – residual rl for precise assembly,","venue":null,"work_id":"5eecc7d6-a653-433b-923d-08a5db248aec","year":null},"citing_paper":{"arxiv_id":"2501.16389","last_updated":"2025-09-07T01:22:45Z","snapshot_observed_at":"2026-08-10T14:20:08.514108Z","submitted_at":"2025-01-26T00:27:04Z","title":"Bridging the Sim2Real Gap: Vision Encoder Pre-Training for Visuomotor Policy Transfer","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T14:25:11.911949Z"},"links":{"citing_paper":"/paper/2501.16389"},"observation_digest":"sha256:a2cbb243c90450eb31c4b483630d8c39c4b21373a89e9e863ede3366beab8b2f","observation_id":"283d771c-63ef-49a3-a896-02d062abd8a6","resolution":{"observed_at":"2026-08-10T14:25:12.579603Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.16677","last_updated":"2024-12-12T18:40:16Z","snapshot_observed_at":"2026-08-06T09:19:26.296394Z","submitted_at":"2024-07-23T17:44:54Z","title":"From Imitation to Refinement -- Residual RL for Precise Assembly","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.16677","snapshot_observed_at":"2026-08-10T14:25:11.915439Z","title":"Available: https://arxiv.org/abs/2407.16677","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16389","last_updated":"2025-09-07T01:22:45Z","snapshot_observed_at":"2026-08-10T14:20:08.514108Z","submitted_at":"2025-01-26T00:27:04Z","title":"Bridging the Sim2Real Gap: Vision Encoder Pre-Training for Visuomotor Policy Transfer","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T14:25:11.915439Z"},"links":{"cited_paper":"/paper/2407.16677","citing_paper":"/paper/2501.16389"},"observation_digest":"sha256:775667c10ca628684b179336986776c5e3953e59d64b583f94e68ce94040eeac","observation_id":"b287a526-eed0-4cb5-83be-50d05ac221a3","resolution":{"observed_at":"2026-08-10T14:25:11.915439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.18240","last_updated":"2024-02-01T19:42:05Z","snapshot_observed_at":"2026-08-10T20:46:20.003645Z","submitted_at":"2023-03-31T17:56:33Z","title":"Where are we in the search for an Artificial Visual Cortex for Embodied Intelligence?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.18240","snapshot_observed_at":"2026-08-10T14:25:11.935534Z","title":"Where are we in the search for an artificial visual cortex for embodied intelligence?","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.16389","last_updated":"2025-09-07T01:22:45Z","snapshot_observed_at":"2026-08-10T14:20:08.514108Z","submitted_at":"2025-01-26T00:27:04Z","title":"Bridging the Sim2Real Gap: Vision Encoder Pre-Training for Visuomotor Policy Transfer","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T14:25:11.935534Z"},"links":{"cited_paper":"/paper/2303.18240","citing_paper":"/paper/2501.16389"},"observation_digest":"sha256:52d5f750b8e54b05ba28f0746e7ad1b0e081027bac8e0f6d1384591f2740e1d2","observation_id":"40dfeda3-2228-4352-a9ee-a69e361543ff","resolution":{"observed_at":"2026-08-10T14:25:11.935534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.02244","last_updated":"2019-11-20T17:26:40Z","snapshot_observed_at":"2026-08-10T08:03:59.120263Z","submitted_at":"2019-05-06T19:38:31Z","title":"Searching for MobileNetV3","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.02244","snapshot_observed_at":"2026-08-10T14:25:11.939684Z","title":"Searching for mobilenetv3,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.16389","last_updated":"2025-09-07T01:22:45Z","snapshot_observed_at":"2026-08-10T14:20:08.514108Z","submitted_at":"2025-01-26T00:27:04Z","title":"Bridging the Sim2Real Gap: Vision Encoder Pre-Training for Visuomotor Policy Transfer","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T14:25:11.939684Z"},"links":{"cited_paper":"/paper/1905.02244","citing_paper":"/paper/2501.16389"},"observation_digest":"sha256:341f28cb68202a4cd11df5ef4f3156fce96009ce8e67122d83aa899e83d3e7db","observation_id":"2b7a98e4-f64e-401d-b6eb-70265a5e9452","resolution":{"observed_at":"2026-08-10T14:25:11.939684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.11946","last_updated":"2020-09-11T05:08:01Z","snapshot_observed_at":"2026-08-10T19:44:30.311627Z","submitted_at":"2019-05-28T17:05:32Z","title":"EfficientNet: Rethinking Model Scaling for Convolutional Neural Networks","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.11946","snapshot_observed_at":"2026-08-10T14:25:11.927887Z","title":"Efficientnet: Rethinking model scaling for convolutional neural networks,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.16389","last_updated":"2025-09-07T01:22:45Z","snapshot_observed_at":"2026-08-10T14:20:08.514108Z","submitted_at":"2025-01-26T00:27:04Z","title":"Bridging the Sim2Real Gap: Vision Encoder Pre-Training for Visuomotor Policy Transfer","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T14:25:11.927887Z"},"links":{"cited_paper":"/paper/1905.11946","citing_paper":"/paper/2501.16389"},"observation_digest":"sha256:b6ce355583833d36d57af8fa546c70d428999afa3ed39443932badfd9baab0d4","observation_id":"aa8a6a02-22ac-467f-82d5-3adcd7072da5","resolution":{"observed_at":"2026-08-10T14:25:11.927887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1409.1556","last_updated":"2015-04-10T16:25:04Z","snapshot_observed_at":"2026-08-10T22:24:05.831832Z","submitted_at":"2014-09-04T19:48:04Z","title":"Very Deep Convolutional Networks for Large-Scale Image Recognition","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1409.1556","snapshot_observed_at":"2026-08-10T14:25:11.931762Z","title":"Very deep convolutional networks for large-scale image recognition,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.16389","last_updated":"2025-09-07T01:22:45Z","snapshot_observed_at":"2026-08-10T14:20:08.514108Z","submitted_at":"2025-01-26T00:27:04Z","title":"Bridging the Sim2Real Gap: Vision Encoder Pre-Training for Visuomotor Policy Transfer","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T14:25:11.931762Z"},"links":{"cited_paper":"/paper/1409.1556","citing_paper":"/paper/2501.16389"},"observation_digest":"sha256:78c846c8c7a9bf45871409327f11905648d65e9628b04b574371657dba5d2f40","observation_id":"12596bae-fb10-40d7-97f4-1a9546213133","resolution":{"observed_at":"2026-08-10T14:25:11.931762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.06173","last_updated":"2022-03-11T18:58:10Z","snapshot_observed_at":"2026-08-06T13:06:27.360959Z","submitted_at":"2022-03-11T18:58:10Z","title":"Masked Visual Pre-training for Motor Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.06173","snapshot_observed_at":"2026-08-10T14:25:11.951087Z","title":"Masked visual pre-training for motor control,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.16389","last_updated":"2025-09-07T01:22:45Z","snapshot_observed_at":"2026-08-10T14:20:08.514108Z","submitted_at":"2025-01-26T00:27:04Z","title":"Bridging the Sim2Real Gap: Vision Encoder Pre-Training for Visuomotor Policy Transfer","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T14:25:11.951087Z"},"links":{"cited_paper":"/paper/2203.06173","citing_paper":"/paper/2501.16389"},"observation_digest":"sha256:460effcfeef7befb2bf0266d5bb4f9d9e148cd2444ccc42a39652c97dabe2677","observation_id":"7a56de53-79bc-4a58-97ff-a6a37bfc6d58","resolution":{"observed_at":"2026-08-10T14:25:11.951087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:25:12.564478Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows,","venue":null,"work_id":"bb984cf1-840b-4b5b-9127-886914600061","year":null},"citing_paper":{"arxiv_id":"2501.16389","last_updated":"2025-09-07T01:22:45Z","snapshot_observed_at":"2026-08-10T14:20:08.514108Z","submitted_at":"2025-01-26T00:27:04Z","title":"Bridging the Sim2Real Gap: Vision Encoder Pre-Training for Visuomotor Policy Transfer","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T14:25:11.955066Z"},"links":{"citing_paper":"/paper/2501.16389"},"observation_digest":"sha256:dfeb030f68b8aa7a9ea0a529d82aeae764dbe32efe0f34e968724cce236720da","observation_id":"00f17867-8b55-4c5c-b37f-ad9a932a0fee","resolution":{"observed_at":"2026-08-10T14:25:12.568402Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.22325","last_updated":"2024-10-30T03:33:08Z","snapshot_observed_at":"2026-08-10T02:46:02.602855Z","submitted_at":"2024-10-29T17:58:13Z","title":"Robots Pre-train Robots: Manipulation-Centric Robotic Representation from Large-Scale Robot Datasets","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.22325","snapshot_observed_at":"2026-08-10T14:25:11.943438Z","title":"Robots pre-train robots: Manipulation-centric robotic representation from large-scale robot datasets,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.16389","last_updated":"2025-09-07T01:22:45Z","snapshot_observed_at":"2026-08-10T14:20:08.514108Z","submitted_at":"2025-01-26T00:27:04Z","title":"Bridging the Sim2Real Gap: Vision Encoder Pre-Training for Visuomotor Policy Transfer","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T14:25:11.943438Z"},"links":{"cited_paper":"/paper/2410.22325","citing_paper":"/paper/2501.16389"},"observation_digest":"sha256:d08f17766927f788513a3afe5c0e39d17c0e6221ac0103f97e4bb2766f6a2a9f","observation_id":"f9ec4f2e-6caa-4143-93ef-1f727ab1204b","resolution":{"observed_at":"2026-08-10T14:25:11.943438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-10T01:12:16.468283Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-10T14:25:11.947513Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.16389","last_updated":"2025-09-07T01:22:45Z","snapshot_observed_at":"2026-08-10T14:20:08.514108Z","submitted_at":"2025-01-26T00:27:04Z","title":"Bridging the Sim2Real Gap: Vision Encoder Pre-Training for Visuomotor Policy Transfer","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T14:25:11.947513Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2501.16389"},"observation_digest":"sha256:d10f913406ca295b25739a94b6ec9fd316c42f99d5cec714778b54553d7bf495","observation_id":"6a2e8bb6-b0df-44fb-906d-a8dec3464994","resolution":{"observed_at":"2026-08-10T14:25:11.947513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.00030","last_updated":"2023-03-07T02:29:59Z","snapshot_observed_at":"2026-08-02T00:17:16.761436Z","submitted_at":"2022-09-30T18:14:07Z","title":"VIP: Towards Universal Visual Reward and Representation via Value-Implicit Pre-Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.00030","snapshot_observed_at":"2026-08-10T14:25:11.969987Z","title":"Vip: Towards universal visual reward and representation via value-implicit pre-training,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.16389","last_updated":"2025-09-07T01:22:45Z","snapshot_observed_at":"2026-08-10T14:20:08.514108Z","submitted_at":"2025-01-26T00:27:04Z","title":"Bridging the Sim2Real Gap: Vision Encoder Pre-Training for Visuomotor Policy Transfer","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T14:25:11.969987Z"},"links":{"cited_paper":"/paper/2210.00030","citing_paper":"/paper/2501.16389"},"observation_digest":"sha256:0dbd0cd802c3500af2da070920af832ff988fd251101b4cd28bb7edb04de6d0e","observation_id":"6c9c8dfd-dc37-4967-ac58-bc287bfd476e","resolution":{"observed_at":"2026-08-10T14:25:11.969987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.18911","last_updated":"2024-07-26T17:59:52Z","snapshot_observed_at":"2026-07-06T18:52:34.247456Z","submitted_at":"2024-07-26T17:59:52Z","title":"HRP: Human Affordances for Robotic Pre-Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.18911","snapshot_observed_at":"2026-08-10T14:25:11.974441Z","title":"Hrp: Human affordances for robotic pre-training,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.16389","last_updated":"2025-09-07T01:22:45Z","snapshot_observed_at":"2026-08-10T14:20:08.514108Z","submitted_at":"2025-01-26T00:27:04Z","title":"Bridging the Sim2Real Gap: Vision Encoder Pre-Training for Visuomotor Policy Transfer","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T14:25:11.974441Z"},"links":{"cited_paper":"/paper/2407.18911","citing_paper":"/paper/2501.16389"},"observation_digest":"sha256:b33d8efaa05f208d53b9933b3d6ee33736ca062914fa1692359f19d3094a05a8","observation_id":"1ecf8ce2-dc53-4829-8ca9-479540812e5f","resolution":{"observed_at":"2026-08-10T14:25:11.974441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1511.08458","last_updated":"2015-12-02T18:06:03Z","snapshot_observed_at":"2026-07-06T04:37:52.737823Z","submitted_at":"2015-11-26T17:45:01Z","title":"An Introduction to Convolutional Neural Networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.08458","snapshot_observed_at":"2026-08-10T14:25:11.978261Z","title":"An introduction to convolutional neural networks,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.16389","last_updated":"2025-09-07T01:22:45Z","snapshot_observed_at":"2026-08-10T14:20:08.514108Z","submitted_at":"2025-01-26T00:27:04Z","title":"Bridging the Sim2Real Gap: Vision Encoder Pre-Training for Visuomotor Policy Transfer","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T14:25:11.978261Z"},"links":{"cited_paper":"/paper/1511.08458","citing_paper":"/paper/2501.16389"},"observation_digest":"sha256:dafd673e6ecced53983fcee26a8598aad408b708c4b930ad992ec105f15f9301","observation_id":"e6d99cba-134f-4ed1-80b8-3f0f5b693fe5","resolution":{"observed_at":"2026-08-10T14:25:11.978261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00020","last_updated":"2021-02-26T19:04:58Z","snapshot_observed_at":"2026-07-06T10:45:03.059688Z","submitted_at":"2021-02-26T19:04:58Z","title":"Learning Transferable Visual Models From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00020","snapshot_observed_at":"2026-08-10T14:25:11.962491Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.16389","last_updated":"2025-09-07T01:22:45Z","snapshot_observed_at":"2026-08-10T14:20:08.514108Z","submitted_at":"2025-01-26T00:27:04Z","title":"Bridging the Sim2Real Gap: Vision Encoder Pre-Training for Visuomotor Policy Transfer","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T14:25:11.962491Z"},"links":{"cited_paper":"/paper/2103.00020","citing_paper":"/paper/2501.16389"},"observation_digest":"sha256:5cc29114e2249872c7a13f06fdb16cbe1588c432d95e6599764bb841c6a9645c","observation_id":"065d30e4-bda5-4cd9-a7b5-f7c777e3f973","resolution":{"observed_at":"2026-08-10T14:25:11.962491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:25:12.553082Z","title":"Dinov2: Learning robust visual features without supervision,","venue":null,"work_id":"d2d38d7b-753d-44f9-b5c2-a17f1755de29","year":2024},"citing_paper":{"arxiv_id":"2501.16389","last_updated":"2025-09-07T01:22:45Z","snapshot_observed_at":"2026-08-10T14:20:08.514108Z","submitted_at":"2025-01-26T00:27:04Z","title":"Bridging the Sim2Real Gap: Vision Encoder Pre-Training for Visuomotor Policy Transfer","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T14:25:11.966267Z"},"links":{"citing_paper":"/paper/2501.16389"},"observation_digest":"sha256:04d6dd34ba6d06356f5e138d70fd17ffd5fa3d754b7c3e07de01770ecf68eeb1","observation_id":"f9fe7eab-8a62-4410-9061-a3cbb1896351","resolution":{"observed_at":"2026-08-10T14:25:12.556895Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:25:11.989991Z","title":"A survey on contrastive self-supervised learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.16389","last_updated":"2025-09-07T01:22:45Z","snapshot_observed_at":"2026-08-10T14:20:08.514108Z","submitted_at":"2025-01-26T00:27:04Z","title":"Bridging the Sim2Real Gap: Vision Encoder Pre-Training for Visuomotor Policy Transfer","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T14:25:11.989991Z"},"links":{"citing_paper":"/paper/2501.16389"},"observation_digest":"sha256:f43ae000fd9f682eeb9ee7c4d5d782a391a012b1d75e16c514a7a94b80ebfd1e","observation_id":"e2bd6474-08e2-477d-8001-5a327804173b","resolution":{"observed_at":"2026-08-10T14:25:11.989991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:25:11.993484Z","title":"Compressive-projection principal component analysis,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2501.16389","last_updated":"2025-09-07T01:22:45Z","snapshot_observed_at":"2026-08-10T14:20:08.514108Z","submitted_at":"2025-01-26T00:27:04Z","title":"Bridging the Sim2Real Gap: Vision Encoder Pre-Training for Visuomotor Policy Transfer","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T14:25:11.993484Z"},"links":{"citing_paper":"/paper/2501.16389"},"observation_digest":"sha256:546e185578e032b84576b226f3e8a93d5d8512bde3a937170b811225b036d5ab","observation_id":"48629d3d-04b7-45b7-a8b7-83b7627ad96b","resolution":{"observed_at":"2026-08-10T14:25:11.993484Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1512.03385","last_updated":"2015-12-10T19:51:55Z","snapshot_observed_at":"2026-07-06T04:39:28.429064Z","submitted_at":"2015-12-10T19:51:55Z","title":"Deep Residual Learning for Image Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1512.03385","snapshot_observed_at":"2026-08-10T14:25:11.996904Z","title":"Deep residual learning for image recognition,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.16389","last_updated":"2025-09-07T01:22:45Z","snapshot_observed_at":"2026-08-10T14:20:08.514108Z","submitted_at":"2025-01-26T00:27:04Z","title":"Bridging the Sim2Real Gap: Vision Encoder Pre-Training for Visuomotor Policy Transfer","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T14:25:11.996904Z"},"links":{"cited_paper":"/paper/1512.03385","citing_paper":"/paper/2501.16389"},"observation_digest":"sha256:9b8bf2cb2d36385e0998780d45a4f0f8e924723343e43b61b7a110ac5ca96256","observation_id":"8c352f2a-94b9-4d39-89eb-0c2e322a7333","resolution":{"observed_at":"2026-08-10T14:25:11.996904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.06709","last_updated":"2022-06-08T12:41:38Z","snapshot_observed_at":"2026-07-06T12:37:32.486119Z","submitted_at":"2022-02-14T13:58:43Z","title":"How Do Vision Transformers Work?","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.06709","snapshot_observed_at":"2026-08-10T14:25:11.982373Z","title":"How do vision transformers work?","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.16389","last_updated":"2025-09-07T01:22:45Z","snapshot_observed_at":"2026-08-10T14:20:08.514108Z","submitted_at":"2025-01-26T00:27:04Z","title":"Bridging the Sim2Real Gap: Vision Encoder Pre-Training for Visuomotor Policy Transfer","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T14:25:11.982373Z"},"links":{"cited_paper":"/paper/2202.06709","citing_paper":"/paper/2501.16389"},"observation_digest":"sha256:c66667a7d2c65bc153aab37493de2493a7e1cd194c1025701ba7eef8315702f1","observation_id":"50ead4e3-8886-4ec9-9447-d9d80d9ae90e","resolution":{"observed_at":"2026-08-10T14:25:11.982373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:25:11.986401Z","title":"Grad-cam: Visual explanations from deep networks via gradient-based localization,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.16389","last_updated":"2025-09-07T01:22:45Z","snapshot_observed_at":"2026-08-10T14:20:08.514108Z","submitted_at":"2025-01-26T00:27:04Z","title":"Bridging the Sim2Real Gap: Vision Encoder Pre-Training for Visuomotor Policy Transfer","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T14:25:11.986401Z"},"links":{"citing_paper":"/paper/2501.16389"},"observation_digest":"sha256:c0b979031afcbdd56eb81b37ec9749bf45053dff7b65dd8951beaf21338949e2","observation_id":"43f06ba0-e03c-4c0d-a155-d6710822a389","resolution":{"observed_at":"2026-08-10T14:25:11.986401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:25:11.869322Z","title":"Available: https://doi.org/10.1109/LRA.2019.2956365","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.16389","last_updated":"2025-09-07T01:22:45Z","snapshot_observed_at":"2026-08-10T14:20:08.514108Z","submitted_at":"2025-01-26T00:27:04Z","title":"Bridging the Sim2Real Gap: Vision Encoder Pre-Training for Visuomotor Policy Transfer","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-10T14:25:11.869322Z"},"links":{"citing_paper":"/paper/2501.16389"},"observation_digest":"sha256:e1fe389d3dcf9e9ee16a05f42da6ad4901ace630f16eade6b2711cbba658ee92","observation_id":"544f2560-c7e6-45a5-854a-038b57b246a7","resolution":{"observed_at":"2026-08-10T14:25:11.869322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.14030","last_updated":"2021-08-17T16:41:34Z","snapshot_observed_at":"2026-08-07T00:32:15.123562Z","submitted_at":"2021-03-25T17:59:31Z","title":"Swin Transformer: Hierarchical Vision Transformer using Shifted Windows","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.14030","snapshot_observed_at":"2026-08-10T14:25:11.958732Z","title":"Available: https://arxiv.org/abs/2103.14030","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16389","last_updated":"2025-09-07T01:22:45Z","snapshot_observed_at":"2026-08-10T14:20:08.514108Z","submitted_at":"2025-01-26T00:27:04Z","title":"Bridging the Sim2Real Gap: Vision Encoder Pre-Training for Visuomotor Policy Transfer","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-10T14:25:11.958732Z"},"links":{"cited_paper":"/paper/2103.14030","citing_paper":"/paper/2501.16389"},"observation_digest":"sha256:d87fefdb123bfc643bfd0cf73408a878e51ade8cf8abc19a276478e5758c26d9","observation_id":"adbf05e1-87aa-4191-aec0-5a942af4fae0","resolution":{"observed_at":"2026-08-10T14:25:11.958732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04137","last_updated":"2024-03-14T04:36:31Z","snapshot_observed_at":"2026-08-08T17:26:38.829859Z","submitted_at":"2023-03-07T18:50:03Z","title":"Diffusion Policy: Visuomotor Policy Learning via Action Diffusion","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.04137","snapshot_observed_at":"2026-08-10T14:25:11.860923Z","title":"Available: https://arxiv.org/abs/2303.04137","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16389","last_updated":"2025-09-07T01:22:45Z","snapshot_observed_at":"2026-08-10T14:20:08.514108Z","submitted_at":"2025-01-26T00:27:04Z","title":"Bridging the Sim2Real Gap: Vision Encoder Pre-Training for Visuomotor Policy Transfer","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-10T14:25:11.860923Z"},"links":{"cited_paper":"/paper/2303.04137","citing_paper":"/paper/2501.16389"},"observation_digest":"sha256:1725a49894e7e14dbb6fdd3920005b31cdd51296615c7bfaa0b36db0e1954a5b","observation_id":"d3464721-3e2a-46e4-b116-1ccea24103f5","resolution":{"observed_at":"2026-08-10T14:25:11.860923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.16389","last_updated":"2025-09-07T01:22:45Z","latest_version":2,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-10T14:20:08.514108Z","submitted_at":"2025-01-26T00:27:04Z","title":"Bridging the Sim2Real Gap: Vision Encoder Pre-Training for Visuomotor Policy Transfer"},"reference_resolution":{"displayed":37,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":2,"verified_fuzzy":8},"total_outbound_references":37},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 37 of 37 outbound references and 2 inbound Pith citation observations for arXiv:2501.16389."}