{"as_of":"2026-08-20T11:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:23ab4f020cffbee2ab3c1e3d8a49913553c4d45a61918e655a76e6f8e5def350","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-21T23:59:11.510737Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.09180/citation-record","integrity":"/paper/2507.09180/integrity","json":"/paper/2507.09180/citation-record.json","paper":"/paper/2507.09180"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multimodality Driven Impedance-Based Sim2Real Transfer Learning for Robotic Multiple Peg-in-Hole Assembly","venue":null,"work_id":"e2db379a-b47a-432a-9c27-ed01c6dc4b49","year":2024},"citing_paper":{"arxiv_id":"2507.09180","last_updated":"2026-05-20T08:46:12Z","snapshot_observed_at":"2026-08-18T13:03:02.931773Z","submitted_at":"2025-07-12T07:58:02Z","title":"Multimodal Fusion for Sim2real Transfer in Visual Reinforcement Learning","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-21T23:59:11.510737Z"},"links":{"citing_paper":"/paper/2507.09180"},"observation_digest":"sha256:bbc842701613e52e7e9cfa3fcb74f21454efaf8b441a20ba4218a38f0dd9cd6a","observation_id":"819f32f1-4621-4109-a888-b093931d560f","resolution":{"observed_at":"2026-05-22T00:00:48.462630Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Toward Effective Deep Reinforcement Learn- ing for 3d Robotic Manipulation: Multimodal End-to-End Reinforce- ment Learning from Visual and Proprioceptive Feedback","venue":null,"work_id":"295e93c5-0663-4998-8ad2-10dc8290303f","year":2022},"citing_paper":{"arxiv_id":"2507.09180","last_updated":"2026-05-20T08:46:12Z","snapshot_observed_at":"2026-08-18T13:03:02.931773Z","submitted_at":"2025-07-12T07:58:02Z","title":"Multimodal Fusion for Sim2real Transfer in Visual Reinforcement Learning","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-21T23:59:11.510737Z"},"links":{"citing_paper":"/paper/2507.09180"},"observation_digest":"sha256:7f5a24d3d90e2840cba3abf80979b4681f96016750a5b4066a55ff14795b3660","observation_id":"8d78e3ad-1c86-4eaf-b309-797e105dcc02","resolution":{"observed_at":"2026-05-22T00:00:48.465276Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual-Force- Tactile Fusion for Gentle Intricate Insertion Tasks","venue":null,"work_id":"a976fb9c-8a2e-4042-a774-190edafb443d","year":2024},"citing_paper":{"arxiv_id":"2507.09180","last_updated":"2026-05-20T08:46:12Z","snapshot_observed_at":"2026-08-18T13:03:02.931773Z","submitted_at":"2025-07-12T07:58:02Z","title":"Multimodal Fusion for Sim2real Transfer in Visual Reinforcement Learning","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-21T23:59:11.510737Z"},"links":{"citing_paper":"/paper/2507.09180"},"observation_digest":"sha256:85936c7c46ddfe6543bd583567ab46d160af18432021c1b23e60fcb6d1e5d9f8","observation_id":"510bbe18-c457-486b-a352-19a6d00d963f","resolution":{"observed_at":"2026-05-22T00:00:48.457490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visuotactile-RL: Learning Multimodal Manipulation Policies with Deep Reinforcement Learning","venue":null,"work_id":"cb94e84c-4ac4-4104-9bd4-08780e074df7","year":2022},"citing_paper":{"arxiv_id":"2507.09180","last_updated":"2026-05-20T08:46:12Z","snapshot_observed_at":"2026-08-18T13:03:02.931773Z","submitted_at":"2025-07-12T07:58:02Z","title":"Multimodal Fusion for Sim2real Transfer in Visual Reinforcement Learning","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-21T23:59:11.510737Z"},"links":{"citing_paper":"/paper/2507.09180"},"observation_digest":"sha256:f81ea6f61383fdfc1a32059a5b1f4a903e3479cfd6f1d43bd5551b8855f2abf9","observation_id":"aa08801e-49a0-4579-9131-ed5b7c7778cd","resolution":{"observed_at":"2026-05-22T00:00:48.460466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Drm: Mastering Visual Reinforcement Learning through Dormant Ratio Minimization","venue":null,"work_id":"fccb83d6-e600-4e30-93a6-f665bbf6d363","year":2024},"citing_paper":{"arxiv_id":"2507.09180","last_updated":"2026-05-20T08:46:12Z","snapshot_observed_at":"2026-08-18T13:03:02.931773Z","submitted_at":"2025-07-12T07:58:02Z","title":"Multimodal Fusion for Sim2real Transfer in Visual Reinforcement Learning","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-21T23:59:11.510737Z"},"links":{"citing_paper":"/paper/2507.09180"},"observation_digest":"sha256:136abd4ace92abe4a3b11d1ca1d3cb8ad3af5929e3997137bf8a3f05cfedaa38","observation_id":"0a5c09e0-3a73-4c39-978e-5b4af7ad94fc","resolution":{"observed_at":"2026-05-22T00:00:48.451660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning Better with Less: Effective Aug- mentation for Sample-Efficient Visual Reinforcement Learning","venue":null,"work_id":"d2a7ed4e-d7d9-4942-abbf-22a16c63ab26","year":2023},"citing_paper":{"arxiv_id":"2507.09180","last_updated":"2026-05-20T08:46:12Z","snapshot_observed_at":"2026-08-18T13:03:02.931773Z","submitted_at":"2025-07-12T07:58:02Z","title":"Multimodal Fusion for Sim2real Transfer in Visual Reinforcement Learning","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-21T23:59:11.510737Z"},"links":{"citing_paper":"/paper/2507.09180"},"observation_digest":"sha256:4e9ca6995ff17115a3d0c137754aaebf1093301764f6e048e229542cafa7e2fa","observation_id":"1be78e89-8b07-4076-8a3b-5e35c60f0f18","resolution":{"observed_at":"2026-05-22T00:00:48.454738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.10190","last_updated":"2020-07-31T13:43:53Z","snapshot_observed_at":"2026-08-19T22:41:50.520967Z","submitted_at":"2020-04-21T17:57:04Z","title":"Never Stop Learning: The Effectiveness of Fine-Tuning in Robotic Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2004.10190","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2004.10190","snapshot_observed_at":"2026-07-04T08:29:41.688986Z","title":"Never stop learning: The effectiveness of fine-tuning in robotic reinforcement learning","venue":null,"work_id":"9e9883b4-bd48-4981-9bf1-798b3e831692","year":2004},"citing_paper":{"arxiv_id":"2507.09180","last_updated":"2026-05-20T08:46:12Z","snapshot_observed_at":"2026-08-18T13:03:02.931773Z","submitted_at":"2025-07-12T07:58:02Z","title":"Multimodal Fusion for Sim2real Transfer in Visual Reinforcement Learning","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-21T23:59:11.510737Z"},"links":{"cited_paper":"/paper/2004.10190","citing_paper":"/paper/2507.09180"},"observation_digest":"sha256:c2d3fa7fcff9403862ecc60e0d87769928ec1ad2b71f9e25beb6eb301fb79c1e","observation_id":"e0548e26-4b01-4c05-ac3c-ca7de706ca46","resolution":{"observed_at":"2026-05-22T00:00:47.815454Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual Rein- forcement Learning With Self-Supervised 3d Representations","venue":null,"work_id":"59a22b9d-a9bd-4c53-a441-fb5316c32f3f","year":2023},"citing_paper":{"arxiv_id":"2507.09180","last_updated":"2026-05-20T08:46:12Z","snapshot_observed_at":"2026-08-18T13:03:02.931773Z","submitted_at":"2025-07-12T07:58:02Z","title":"Multimodal Fusion for Sim2real Transfer in Visual Reinforcement Learning","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-21T23:59:11.510737Z"},"links":{"citing_paper":"/paper/2507.09180"},"observation_digest":"sha256:3c9a6ff5424ea5a872b16a3df527dd265d047de2848a0aed0c218dcece7d2a42","observation_id":"c07c4075-db03-4749-895b-cd3ce8d6c3b8","resolution":{"observed_at":"2026-05-22T00:00:48.479284Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Real-World Robot Learning with Masked Visual Pre-training","venue":null,"work_id":"a014fffd-1647-4508-b00c-8c377957ab92","year":2022},"citing_paper":{"arxiv_id":"2507.09180","last_updated":"2026-05-20T08:46:12Z","snapshot_observed_at":"2026-08-18T13:03:02.931773Z","submitted_at":"2025-07-12T07:58:02Z","title":"Multimodal Fusion for Sim2real Transfer in Visual Reinforcement Learning","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-21T23:59:11.510737Z"},"links":{"citing_paper":"/paper/2507.09180"},"observation_digest":"sha256:67774ff88d96b220ca64363169799b2cd157acfc2fe32ed3e34ae3094acf4ee7","observation_id":"fa0067e0-96f7-41b9-af15-fc49d41facab","resolution":{"observed_at":"2026-05-22T00:00:48.473756Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pre-Trained Image Encoder for Generalizable Visual Reinforcement Learning","venue":null,"work_id":"bd501684-c747-4a4f-af2b-495b3ae1612a","year":2022},"citing_paper":{"arxiv_id":"2507.09180","last_updated":"2026-05-20T08:46:12Z","snapshot_observed_at":"2026-08-18T13:03:02.931773Z","submitted_at":"2025-07-12T07:58:02Z","title":"Multimodal Fusion for Sim2real Transfer in Visual Reinforcement Learning","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-21T23:59:11.510737Z"},"links":{"citing_paper":"/paper/2507.09180"},"observation_digest":"sha256:8570122539a0f7bbe758b946038048a589e2d5966fe6d16c695f7e30bea2ef77","observation_id":"6af81014-8041-4faf-973a-42cf48a879d1","resolution":{"observed_at":"2026-05-22T00:00:48.484737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Efficient RL via Disentangled Environment and Agent Representations","venue":null,"work_id":"42ec7796-1b43-4675-ba12-37ec215cebee","year":2023},"citing_paper":{"arxiv_id":"2507.09180","last_updated":"2026-05-20T08:46:12Z","snapshot_observed_at":"2026-08-18T13:03:02.931773Z","submitted_at":"2025-07-12T07:58:02Z","title":"Multimodal Fusion for Sim2real Transfer in Visual Reinforcement Learning","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-21T23:59:11.510737Z"},"links":{"citing_paper":"/paper/2507.09180"},"observation_digest":"sha256:0c33601bd7613c93432501fed3542a5b7bfd03f2281099c1f99c24eef253ea1b","observation_id":"07adfbcc-108a-40ed-9a0b-fd89f18e8c49","resolution":{"observed_at":"2026-05-22T00:00:48.552525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"DEAR: Disentangled Environment and Agent Representations for Reinforcement Learning without Reconstruction","venue":null,"work_id":"6d642d03-811f-40d0-ac3d-1f989fba39c7","year":2024},"citing_paper":{"arxiv_id":"2507.09180","last_updated":"2026-05-20T08:46:12Z","snapshot_observed_at":"2026-08-18T13:03:02.931773Z","submitted_at":"2025-07-12T07:58:02Z","title":"Multimodal Fusion for Sim2real Transfer in Visual Reinforcement Learning","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-21T23:59:11.510737Z"},"links":{"citing_paper":"/paper/2507.09180"},"observation_digest":"sha256:02e8ed657d272d337f823552e12b36f40e26c1ab74db4b6bc872b45a9e0358cb","observation_id":"c4c4d2b4-d089-4e9e-9a4c-daa4306e67ad","resolution":{"observed_at":"2026-05-22T00:00:48.544094Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sim- to-Real Transfer of Robotic Control with Dynamics Randomization","venue":null,"work_id":"4af37898-e996-482f-acd1-3249f41cc971","year":2018},"citing_paper":{"arxiv_id":"2507.09180","last_updated":"2026-05-20T08:46:12Z","snapshot_observed_at":"2026-08-18T13:03:02.931773Z","submitted_at":"2025-07-12T07:58:02Z","title":"Multimodal Fusion for Sim2real Transfer in Visual Reinforcement Learning","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-21T23:59:11.510737Z"},"links":{"citing_paper":"/paper/2507.09180"},"observation_digest":"sha256:16501574b3c663c3f7027c08523e41547b589396b14406f62f6c136869a32a05","observation_id":"9ffc13f5-d2a5-431d-8935-4ece2cdb6a6d","resolution":{"observed_at":"2026-05-22T00:00:48.541096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Analysis of Randomization Effects on Sim2Real Transfer in Reinforcement Learning for Robotic Manipula- tion Tasks","venue":null,"work_id":"fdce9128-f31e-4508-98ef-c8958c4d4fe0","year":2022},"citing_paper":{"arxiv_id":"2507.09180","last_updated":"2026-05-20T08:46:12Z","snapshot_observed_at":"2026-08-18T13:03:02.931773Z","submitted_at":"2025-07-12T07:58:02Z","title":"Multimodal Fusion for Sim2real Transfer in Visual Reinforcement Learning","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-21T23:59:11.510737Z"},"links":{"citing_paper":"/paper/2507.09180"},"observation_digest":"sha256:8dfe01812fb7c00754fc942de1c4ea54b6393a21748fc7f43a1c8db323650d8b","observation_id":"372cd3e8-aad1-4e1a-8052-87b845ba17d4","resolution":{"observed_at":"2026-05-22T00:00:48.538756Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"CMX: Cross-Modal Fusion for RGB-X Semantic Segmentation With Trans- formers","venue":null,"work_id":"b0a42331-2d83-4fe9-85cc-bdf58f519080","year":2023},"citing_paper":{"arxiv_id":"2507.09180","last_updated":"2026-05-20T08:46:12Z","snapshot_observed_at":"2026-08-18T13:03:02.931773Z","submitted_at":"2025-07-12T07:58:02Z","title":"Multimodal Fusion for Sim2real Transfer in Visual Reinforcement Learning","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-21T23:59:11.510737Z"},"links":{"citing_paper":"/paper/2507.09180"},"observation_digest":"sha256:65ceb0ef5aa67a21ef7007728408e9be495bf05d7c0623550632a4921910e446","observation_id":"287b9720-f9a8-47d6-baf6-ccb72dc5781f","resolution":{"observed_at":"2026-05-22T00:00:48.547103Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Spatio-channel attention blocks for cross-modal crowd counting","venue":null,"work_id":"961eabb6-3d3c-4ef3-bc83-2eb7afe3f4a3","year":2022},"citing_paper":{"arxiv_id":"2507.09180","last_updated":"2026-05-20T08:46:12Z","snapshot_observed_at":"2026-08-18T13:03:02.931773Z","submitted_at":"2025-07-12T07:58:02Z","title":"Multimodal Fusion for Sim2real Transfer in Visual Reinforcement Learning","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-21T23:59:11.510737Z"},"links":{"citing_paper":"/paper/2507.09180"},"observation_digest":"sha256:4ed18ca062497031627039923fa638595562817087327e5865adc4909e08cb62","observation_id":"4b9af81e-e195-4ef1-9ef4-230290db922b","resolution":{"observed_at":"2026-05-22T00:00:48.481735Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","venue":null,"work_id":"b5b0361e-eae8-49d4-97ed-d037b301dbbc","year":2021},"citing_paper":{"arxiv_id":"2507.09180","last_updated":"2026-05-20T08:46:12Z","snapshot_observed_at":"2026-08-18T13:03:02.931773Z","submitted_at":"2025-07-12T07:58:02Z","title":"Multimodal Fusion for Sim2real Transfer in Visual Reinforcement Learning","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-21T23:59:11.510737Z"},"links":{"citing_paper":"/paper/2507.09180"},"observation_digest":"sha256:fd4db099665c98c97e71de8f0c5424c3c2e45016d5c4cc634817762d7e3e1bd3","observation_id":"660c378f-e534-4fc6-8c4e-032dfb787225","resolution":{"observed_at":"2026-05-22T00:00:48.532896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Look where you look! Saliency-guided Q-networks for generalization in visual Reinforcement Learning","venue":null,"work_id":"325271f3-facc-44cf-8983-fbcaee9fbb28","year":2022},"citing_paper":{"arxiv_id":"2507.09180","last_updated":"2026-05-20T08:46:12Z","snapshot_observed_at":"2026-08-18T13:03:02.931773Z","submitted_at":"2025-07-12T07:58:02Z","title":"Multimodal Fusion for Sim2real Transfer in Visual Reinforcement Learning","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-21T23:59:11.510737Z"},"links":{"citing_paper":"/paper/2507.09180"},"observation_digest":"sha256:1e1a7a72954ba1eb53c61ed6db8a8229b220cbe69e6a291779ba532fd0b99282","observation_id":"8f248516-1040-42cb-91c6-cd8d89c16cc3","resolution":{"observed_at":"2026-05-22T00:00:48.524300Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"RL-ViGen: A Reinforcement Learning Benchmark for Visual Generalization","venue":null,"work_id":"c15bc4e0-eb15-45c4-bd2d-1f2ef938cccc","year":2023},"citing_paper":{"arxiv_id":"2507.09180","last_updated":"2026-05-20T08:46:12Z","snapshot_observed_at":"2026-08-18T13:03:02.931773Z","submitted_at":"2025-07-12T07:58:02Z","title":"Multimodal Fusion for Sim2real Transfer in Visual Reinforcement Learning","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-21T23:59:11.510737Z"},"links":{"citing_paper":"/paper/2507.09180"},"observation_digest":"sha256:e48003796a75a7883f5a6f521cfbcc8f49763db1e6a30355bf4ba27cf024b403","observation_id":"eb2cde8e-813b-4a3a-86c6-783959127e92","resolution":{"observed_at":"2026-05-22T00:00:48.526964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reinforcement Learning with Augmented Data","venue":null,"work_id":"19422a85-6c7a-4637-a12c-d120790e7c37","year":2020},"citing_paper":{"arxiv_id":"2507.09180","last_updated":"2026-05-20T08:46:12Z","snapshot_observed_at":"2026-08-18T13:03:02.931773Z","submitted_at":"2025-07-12T07:58:02Z","title":"Multimodal Fusion for Sim2real Transfer in Visual Reinforcement Learning","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-21T23:59:11.510737Z"},"links":{"citing_paper":"/paper/2507.09180"},"observation_digest":"sha256:75ea20664add715afae553b4b60ce38f715bafc575f48c19eb3a8a04ba6c6371","observation_id":"c3dce98c-5c9a-4511-a9b0-5912c9d74ecb","resolution":{"observed_at":"2026-05-22T00:00:48.530072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Image Augmentation Is All You Need: Regularizing Deep Reinforcement Learning from Pixels","venue":null,"work_id":"e749c83d-ba04-426a-9162-376ebc2d9d59","year":2021},"citing_paper":{"arxiv_id":"2507.09180","last_updated":"2026-05-20T08:46:12Z","snapshot_observed_at":"2026-08-18T13:03:02.931773Z","submitted_at":"2025-07-12T07:58:02Z","title":"Multimodal Fusion for Sim2real Transfer in Visual Reinforcement Learning","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-21T23:59:11.510737Z"},"links":{"citing_paper":"/paper/2507.09180"},"observation_digest":"sha256:843bd385fb3db57eeb1e8724db1d6f938542827153ebb84ec862cebc9083aaf3","observation_id":"36e7d5df-290b-4e26-8594-46669f09c04b","resolution":{"observed_at":"2026-05-22T00:00:48.535815Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mastering Visual Con- tinuous Control: Improved Data-Augmented Reinforcement Learning","venue":null,"work_id":"eaf62a87-5ecb-45e6-ab1f-48b5614a0818","year":2022},"citing_paper":{"arxiv_id":"2507.09180","last_updated":"2026-05-20T08:46:12Z","snapshot_observed_at":"2026-08-18T13:03:02.931773Z","submitted_at":"2025-07-12T07:58:02Z","title":"Multimodal Fusion for Sim2real Transfer in Visual Reinforcement Learning","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-21T23:59:11.510737Z"},"links":{"citing_paper":"/paper/2507.09180"},"observation_digest":"sha256:e1e00f610ba56037244a9545af369e5049c6eea6e6efe156c3fc8563945b6db7","observation_id":"e5333ba0-176b-4f15-bc4a-1395285169c3","resolution":{"observed_at":"2026-05-22T00:00:48.555546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Stabilizing Deep Q-Learning with ConvNets and Vision Transformers under Data Augmentation","venue":null,"work_id":"9dac63c8-5b9c-4010-8383-12f7304a6e3c","year":2021},"citing_paper":{"arxiv_id":"2507.09180","last_updated":"2026-05-20T08:46:12Z","snapshot_observed_at":"2026-08-18T13:03:02.931773Z","submitted_at":"2025-07-12T07:58:02Z","title":"Multimodal Fusion for Sim2real Transfer in Visual Reinforcement Learning","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-21T23:59:11.510737Z"},"links":{"citing_paper":"/paper/2507.09180"},"observation_digest":"sha256:cfa6f2057e526faaffb61047898393727a00b2b88fc740d13317197687367f0e","observation_id":"377dc0ef-2789-4972-91ed-92692b06f24f","resolution":{"observed_at":"2026-05-22T00:00:48.518285Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deep Residual Learning for Image Recognition","venue":null,"work_id":"322d7ebb-8716-465b-935b-d289fe973e56","year":2016},"citing_paper":{"arxiv_id":"2507.09180","last_updated":"2026-05-20T08:46:12Z","snapshot_observed_at":"2026-08-18T13:03:02.931773Z","submitted_at":"2025-07-12T07:58:02Z","title":"Multimodal Fusion for Sim2real Transfer in Visual Reinforcement Learning","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-21T23:59:11.510737Z"},"links":{"citing_paper":"/paper/2507.09180"},"observation_digest":"sha256:c45a93b849b87b5c6f06d4b9d74d18dd7bcd11df21c985704acf20de3167ea39","observation_id":"530bde21-bfc6-4976-9500-492c596d1dea","resolution":{"observed_at":"2026-05-22T00:00:48.515010Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.06173","last_updated":"2022-03-11T18:58:10Z","snapshot_observed_at":"2026-08-16T17:15:14.047305Z","submitted_at":"2022-03-11T18:58:10Z","title":"Masked Visual Pre-training for Motor Control","version":1},"cited_work":{"arxiv_id":"2203.06173","doi":null,"metadata_source":"pith","pith_arxiv_id":"2203.06173","snapshot_observed_at":"2026-07-08T01:44:26.089441Z","title":"Masked visual pre-training for motor control","venue":"cs.CV","work_id":"87cf1bc9-a17c-4f06-8a24-80a4a1051a0b","year":2022},"citing_paper":{"arxiv_id":"2507.09180","last_updated":"2026-05-20T08:46:12Z","snapshot_observed_at":"2026-08-18T13:03:02.931773Z","submitted_at":"2025-07-12T07:58:02Z","title":"Multimodal Fusion for Sim2real Transfer in Visual Reinforcement Learning","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-21T23:59:11.510737Z"},"links":{"cited_paper":"/paper/2203.06173","citing_paper":"/paper/2507.09180"},"observation_digest":"sha256:047ca7b92112fe9c6fe1fac2707b78429a58817d350716dfa268c1819bf1fb59","observation_id":"c3b17517-3b51-487e-8d98-3de0ce097121","resolution":{"observed_at":"2026-05-22T00:00:47.807886Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The Unsurprising Effectiveness of Pre-Trained Vision Models for Control","venue":null,"work_id":"2f2a791b-2a08-4fbd-8406-65af2f28a883","year":2022},"citing_paper":{"arxiv_id":"2507.09180","last_updated":"2026-05-20T08:46:12Z","snapshot_observed_at":"2026-08-18T13:03:02.931773Z","submitted_at":"2025-07-12T07:58:02Z","title":"Multimodal Fusion for Sim2real Transfer in Visual Reinforcement Learning","version":4},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-21T23:59:11.510737Z"},"links":{"citing_paper":"/paper/2507.09180"},"observation_digest":"sha256:b72d67f25b08458e23b900a38296efdddfd2d30532ec5771a88d61142453d490","observation_id":"4b6b602e-e262-4c37-9079-1815a06132f9","resolution":{"observed_at":"2026-05-22T00:00:48.521463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"R3M: A Universal Visual Representation for Robot Manipulation","venue":null,"work_id":"c98ab9b1-4247-4c8e-b822-c084d3b8d1cd","year":2022},"citing_paper":{"arxiv_id":"2507.09180","last_updated":"2026-05-20T08:46:12Z","snapshot_observed_at":"2026-08-18T13:03:02.931773Z","submitted_at":"2025-07-12T07:58:02Z","title":"Multimodal Fusion for Sim2real Transfer in Visual Reinforcement Learning","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-21T23:59:11.510737Z"},"links":{"citing_paper":"/paper/2507.09180"},"observation_digest":"sha256:bb29c79d77d0657120a1597619ee315daa7a9ea2317eac91376887135e013c56","observation_id":"aec0c839-1368-42c1-9823-227e0b13837f","resolution":{"observed_at":"2026-05-22T00:00:48.506608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Look Closer: Bridging Egocentric and Third-Person Views With Transformers for Robotic Manipulation","venue":null,"work_id":"5b75ad69-8a26-45c7-8a82-92c8e2cee19a","year":2022},"citing_paper":{"arxiv_id":"2507.09180","last_updated":"2026-05-20T08:46:12Z","snapshot_observed_at":"2026-08-18T13:03:02.931773Z","submitted_at":"2025-07-12T07:58:02Z","title":"Multimodal Fusion for Sim2real Transfer in Visual Reinforcement Learning","version":4},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-21T23:59:11.510737Z"},"links":{"citing_paper":"/paper/2507.09180"},"observation_digest":"sha256:3b791f26b8fb46e57cabc80066fcbcf7fe83e69d6dcff98400f1184572e8b2e4","observation_id":"51b462f2-a171-4ab5-9849-d242070b39ae","resolution":{"observed_at":"2026-05-22T00:00:48.510005Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.22325","last_updated":"2024-10-30T03:33:08Z","snapshot_observed_at":"2026-08-16T13:04:51.127094Z","submitted_at":"2024-10-29T17:58:13Z","title":"Robots Pre-train Robots: Manipulation-Centric Robotic Representation from Large-Scale Robot Datasets","version":2},"cited_work":{"arxiv_id":"2410.22325","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.22325","snapshot_observed_at":"2026-07-03T18:08:46.873665Z","title":"Robots Pre-train Robots: Manipulation-Centric Robotic Representation from Large-Scale Robot Dataset","venue":null,"work_id":"c9285d9b-d37c-480b-bcb7-49e83d78b23d","year":2024},"citing_paper":{"arxiv_id":"2507.09180","last_updated":"2026-05-20T08:46:12Z","snapshot_observed_at":"2026-08-18T13:03:02.931773Z","submitted_at":"2025-07-12T07:58:02Z","title":"Multimodal Fusion for Sim2real Transfer in Visual Reinforcement Learning","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-21T23:59:11.510737Z"},"links":{"cited_paper":"/paper/2410.22325","citing_paper":"/paper/2507.09180"},"observation_digest":"sha256:06e016722484f8f41820d228331def1b45f5231c2127b6a40d6231208123ec20","observation_id":"51050fac-863d-4dcb-9a39-2889c432a0f6","resolution":{"observed_at":"2026-05-22T00:00:47.811883Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12945","last_updated":"2025-04-22T17:57:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-19T17:48:38Z","title":"DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset","version":2},"cited_work":{"arxiv_id":"2403.12945","doi":"10.48550/arxiv.2403.12945","metadata_source":"pith","pith_arxiv_id":"2403.12945","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset","venue":"cs.RO","work_id":"13253de2-3d89-415c-8c2f-3adb25d4c337","year":2024},"citing_paper":{"arxiv_id":"2507.09180","last_updated":"2026-05-20T08:46:12Z","snapshot_observed_at":"2026-08-18T13:03:02.931773Z","submitted_at":"2025-07-12T07:58:02Z","title":"Multimodal Fusion for Sim2real Transfer in Visual Reinforcement Learning","version":4},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-21T23:59:11.510737Z"},"links":{"cited_paper":"/paper/2403.12945","citing_paper":"/paper/2507.09180"},"observation_digest":"sha256:cb1364de533088172cb2998de714f84a23aa1602475944d9a831ba599f7a29ae","observation_id":"9cb800de-f89b-43ec-a47c-41272866f1ed","resolution":{"observed_at":"2026-05-22T00:00:47.819430Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sim-to-Real Transfer of Robotic Assembly with Visual Inputs Using CycleGAN and Force Control","venue":null,"work_id":"307ff1a1-4513-44c2-92b7-95b43ed511b4","year":2022},"citing_paper":{"arxiv_id":"2507.09180","last_updated":"2026-05-20T08:46:12Z","snapshot_observed_at":"2026-08-18T13:03:02.931773Z","submitted_at":"2025-07-12T07:58:02Z","title":"Multimodal Fusion for Sim2real Transfer in Visual Reinforcement Learning","version":4},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-21T23:59:11.510737Z"},"links":{"citing_paper":"/paper/2507.09180"},"observation_digest":"sha256:0749e6d2d6e7b02a3aabd3c6a8dfa387e09e5dbc690099bc97d5894ba2262acd","observation_id":"73f6c1ee-06f7-4d4e-be03-f6573b0507fa","resolution":{"observed_at":"2026-05-22T00:00:48.512678Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Domain randomization for transferring deep neural networks from simulation to the real world","venue":null,"work_id":"a9750bb7-146f-4ce6-8b34-d25651d2d60d","year":2017},"citing_paper":{"arxiv_id":"2507.09180","last_updated":"2026-05-20T08:46:12Z","snapshot_observed_at":"2026-08-18T13:03:02.931773Z","submitted_at":"2025-07-12T07:58:02Z","title":"Multimodal Fusion for Sim2real Transfer in Visual Reinforcement Learning","version":4},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-21T23:59:11.510737Z"},"links":{"citing_paper":"/paper/2507.09180"},"observation_digest":"sha256:277fbe0d84776516e0c64918fe5896b4dee1e8247cf439c47ed417ef4e5901ec","observation_id":"092e63b1-6c79-4bd5-ab7b-f2242ff76fe4","resolution":{"observed_at":"2026-05-22T00:00:48.504132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning to Manipulate Anywhere: A Visual Generalizable Framework For Reinforcement Learning","venue":null,"work_id":"069528f0-fffc-4805-b2a0-d63a3d684cfb","year":2024},"citing_paper":{"arxiv_id":"2507.09180","last_updated":"2026-05-20T08:46:12Z","snapshot_observed_at":"2026-08-18T13:03:02.931773Z","submitted_at":"2025-07-12T07:58:02Z","title":"Multimodal Fusion for Sim2real Transfer in Visual Reinforcement Learning","version":4},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-21T23:59:11.510737Z"},"links":{"citing_paper":"/paper/2507.09180"},"observation_digest":"sha256:43a47726c3ae2f7abafb3a1d021c450bb682cf8800765df69155d19c1381077f","observation_id":"4150663c-7785-4e60-8a48-2a250411e38e","resolution":{"observed_at":"2026-05-22T00:00:48.558548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Masked Autoencoders Are Scalable Vision Learners","venue":null,"work_id":"56b0eb2e-c108-46f7-83d2-f9c37c435489","year":2022},"citing_paper":{"arxiv_id":"2507.09180","last_updated":"2026-05-20T08:46:12Z","snapshot_observed_at":"2026-08-18T13:03:02.931773Z","submitted_at":"2025-07-12T07:58:02Z","title":"Multimodal Fusion for Sim2real Transfer in Visual Reinforcement Learning","version":4},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-21T23:59:11.510737Z"},"links":{"citing_paper":"/paper/2507.09180"},"observation_digest":"sha256:cd191134bb7776c2f66ee2d6a2d7584da0fff870bd547c73aec379af2c9e4f58","observation_id":"aac1a16e-3098-4d89-a2df-b969353f36a7","resolution":{"observed_at":"2026-05-22T00:00:48.498205Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The Power of the Senses: Generalizable Manipulation from Vision and Touch through Masked Multimodal Learning","venue":null,"work_id":"00145db8-628d-48a3-917a-77e3d9b25efb","year":2024},"citing_paper":{"arxiv_id":"2507.09180","last_updated":"2026-05-20T08:46:12Z","snapshot_observed_at":"2026-08-18T13:03:02.931773Z","submitted_at":"2025-07-12T07:58:02Z","title":"Multimodal Fusion for Sim2real Transfer in Visual Reinforcement Learning","version":4},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-21T23:59:11.510737Z"},"links":{"citing_paper":"/paper/2507.09180"},"observation_digest":"sha256:a1a800c954e558300c9c450217863c3f2923ea2cf5026944e2f0923167b0360f","observation_id":"efeedff3-5e4d-4550-a950-082789236f8d","resolution":{"observed_at":"2026-05-22T00:00:48.549670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"CURL: Contrastive Unsuper- vised Representations for Reinforcement Learning","venue":null,"work_id":"b432b240-328d-482b-bd6a-fe6f50d7ee2a","year":2020},"citing_paper":{"arxiv_id":"2507.09180","last_updated":"2026-05-20T08:46:12Z","snapshot_observed_at":"2026-08-18T13:03:02.931773Z","submitted_at":"2025-07-12T07:58:02Z","title":"Multimodal Fusion for Sim2real Transfer in Visual Reinforcement Learning","version":4},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-21T23:59:11.510737Z"},"links":{"citing_paper":"/paper/2507.09180"},"observation_digest":"sha256:df05fe759415fc398b84bec10fcee6668d6b7456e8b254424cddae3ec458fb0b","observation_id":"fc16e5fa-c481-4d91-9ab9-16de5de6e87f","resolution":{"observed_at":"2026-05-22T00:00:48.495138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multi-view Disentanglement for Reinforcement Learning with Multiple Cameras","venue":null,"work_id":"e49d4840-e596-4663-ade2-fe00071b4866","year":2024},"citing_paper":{"arxiv_id":"2507.09180","last_updated":"2026-05-20T08:46:12Z","snapshot_observed_at":"2026-08-18T13:03:02.931773Z","submitted_at":"2025-07-12T07:58:02Z","title":"Multimodal Fusion for Sim2real Transfer in Visual Reinforcement Learning","version":4},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-21T23:59:11.510737Z"},"links":{"citing_paper":"/paper/2507.09180"},"observation_digest":"sha256:32ea905fe045a7dbc98c2ccb48f730a43ef76f3d42e23c9f4b3eece8f8c7dd15","observation_id":"6a314cfc-55d8-49af-b34b-654321bb534d","resolution":{"observed_at":"2026-05-22T00:00:48.501516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"TACO: Temporal Latent Action-Driven Contrastive Loss for Visual Reinforcement Learning","venue":null,"work_id":"612bcf2a-bd73-4161-b829-6a18e3b15e78","year":2023},"citing_paper":{"arxiv_id":"2507.09180","last_updated":"2026-05-20T08:46:12Z","snapshot_observed_at":"2026-08-18T13:03:02.931773Z","submitted_at":"2025-07-12T07:58:02Z","title":"Multimodal Fusion for Sim2real Transfer in Visual Reinforcement Learning","version":4},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-21T23:59:11.510737Z"},"links":{"citing_paper":"/paper/2507.09180"},"observation_digest":"sha256:64fbf40dee65e83775d62ff76b721ce4c4fcadd97d3b21eac53b5fb169171e70","observation_id":"299dd699-b181-48dd-a673-5b1c92e361ad","resolution":{"observed_at":"2026-05-22T00:00:48.470699Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Continuous control with deep reinforcement learning","venue":null,"work_id":"f0c5dedc-fc4c-43dd-bf57-7c03f6391dba","year":2016},"citing_paper":{"arxiv_id":"2507.09180","last_updated":"2026-05-20T08:46:12Z","snapshot_observed_at":"2026-08-18T13:03:02.931773Z","submitted_at":"2025-07-12T07:58:02Z","title":"Multimodal Fusion for Sim2real Transfer in Visual Reinforcement Learning","version":4},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-21T23:59:11.510737Z"},"links":{"citing_paper":"/paper/2507.09180"},"observation_digest":"sha256:db03807a6446030bd35bc5749b1b979c51f7a0a04374f16722ecad5c91051bd1","observation_id":"d7a8daee-7227-42b9-a07d-060f3888dbba","resolution":{"observed_at":"2026-05-22T00:00:48.476645Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Variable Impedance Control in End-Effector Space: An Action Space for Reinforcement Learning in Contact-Rich Tasks","venue":null,"work_id":"341c3b0d-2439-45c2-8cfe-6b0bd9d12807","year":2019},"citing_paper":{"arxiv_id":"2507.09180","last_updated":"2026-05-20T08:46:12Z","snapshot_observed_at":"2026-08-18T13:03:02.931773Z","submitted_at":"2025-07-12T07:58:02Z","title":"Multimodal Fusion for Sim2real Transfer in Visual Reinforcement Learning","version":4},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-21T23:59:11.510737Z"},"links":{"citing_paper":"/paper/2507.09180"},"observation_digest":"sha256:f775bb1acce786d0aaf13c8e6dfb9e82c21bc0854f7a54f5b7f61d0cab676d7f","observation_id":"086d17ed-75a1-4838-9acf-c9c0f071d749","resolution":{"observed_at":"2026-05-22T00:00:48.492445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Grad-CAM: Visual Explanations from Deep Networks via Gradient-Based Localization","venue":null,"work_id":"3fc15d5e-e459-45f4-905c-2132fb0753bd","year":2017},"citing_paper":{"arxiv_id":"2507.09180","last_updated":"2026-05-20T08:46:12Z","snapshot_observed_at":"2026-08-18T13:03:02.931773Z","submitted_at":"2025-07-12T07:58:02Z","title":"Multimodal Fusion for Sim2real Transfer in Visual Reinforcement Learning","version":4},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-21T23:59:11.510737Z"},"links":{"citing_paper":"/paper/2507.09180"},"observation_digest":"sha256:f2e5d108dbd0200342fe460cde154c26ccd1086ccbd6f71ac1c59f3ea3bab37b","observation_id":"e5eb2811-775b-46fe-89b5-38cad8a0611c","resolution":{"observed_at":"2026-05-22T00:00:48.468244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Early Convolutions Help Transformers See Better","venue":null,"work_id":"a9243b91-4a60-4f5f-8439-59bbaef3b4e4","year":2021},"citing_paper":{"arxiv_id":"2507.09180","last_updated":"2026-05-20T08:46:12Z","snapshot_observed_at":"2026-08-18T13:03:02.931773Z","submitted_at":"2025-07-12T07:58:02Z","title":"Multimodal Fusion for Sim2real Transfer in Visual Reinforcement Learning","version":4},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-21T23:59:11.510737Z"},"links":{"citing_paper":"/paper/2507.09180"},"observation_digest":"sha256:110860ab6a2b4ed90726fbb79fa43bb2c92e1beac226d80a6b91539e695ffb1b","observation_id":"50cd6993-c053-4ca3-b366-4d134a9c3380","resolution":{"observed_at":"2026-05-22T00:00:48.487384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Swin Transformer: Hierarchical Vision Transformer using Shifted Windows","venue":null,"work_id":"f80064c0-7f69-4c9a-833d-724ea296d906","year":2021},"citing_paper":{"arxiv_id":"2507.09180","last_updated":"2026-05-20T08:46:12Z","snapshot_observed_at":"2026-08-18T13:03:02.931773Z","submitted_at":"2025-07-12T07:58:02Z","title":"Multimodal Fusion for Sim2real Transfer in Visual Reinforcement Learning","version":4},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-21T23:59:11.510737Z"},"links":{"citing_paper":"/paper/2507.09180"},"observation_digest":"sha256:5dd6e8efddec09ec74fc151e184a1c888c917ee5f18931dd148ff59287d0c4c3","observation_id":"20ac7303-cd56-4cd3-91ab-ea8399408e12","resolution":{"observed_at":"2026-05-22T00:00:48.489897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.09180","last_updated":"2026-05-20T08:46:12Z","latest_version":4,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T13:03:02.931773Z","submitted_at":"2025-07-12T07:58:02Z","title":"Multimodal Fusion for Sim2real Transfer in Visual Reinforcement Learning"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":4,"verified_fuzzy":39},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 0 inbound Pith citation observations for arXiv:2507.09180."}