{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2023:J7DWNDU3HCEOCOX57JS4H2J5XR","short_pith_number":"pith:J7DWNDU3","schema_version":"1.0","canonical_sha256":"4fc7668e9b3888e13afdfa65c3e93dbc5ee1f26a4426955b6d397d2a4099de5f","source":{"kind":"arxiv","id":"2311.00899","version":1},"attestation_state":"computed","paper":{"title":"RoboVQA: Multimodal Long-Horizon Reasoning for Robotics","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.RO","authors_text":"Brian Ichter, Christine Chan, Debidatta Dwibedi, Fei Xia, Gabriel Dulac-Arnold, Izhak Shafran, Jeffrey Zhao, Karol Hausman, Keerthana Gopalakrishnan, Nikhil J Joshi, Pannag Sanketi, Peng Xu, Pete Florence, Pierre Sermanet, Robert Baruch, Sharath Maddineni, Suvir Mirchandani, Tianli Ding, Wei Han, Yao Lu, Yuan Cao","submitted_at":"2023-11-01T23:40:07Z","abstract_excerpt":"We present a scalable, bottom-up and intrinsically diverse data collection scheme that can be used for high-level reasoning with long and medium horizons and that has 2.2x higher throughput compared to traditional narrow top-down step-by-step collection. We collect realistic data by performing any user requests within the entirety of 3 office buildings and using multiple robot and human embodiments. With this data, we show that models trained on all embodiments perform better than ones trained on the robot data only, even when evaluated solely on robot episodes. We find that for a fixed collec"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2311.00899","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.RO","submitted_at":"2023-11-01T23:40:07Z","cross_cats_sorted":[],"title_canon_sha256":"351cdb0761a74a9f25a49847542e2de583a8fbb5424aeca0cbbaae2371f304de","abstract_canon_sha256":"b4293bc49616c3a0d1ab6700fae7d7aa17a61f3d9a67169fd9e76a9a84d84d14"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T07:08:17.243046Z","signature_b64":"f59KpG2SSgrwuY1v+Hbqj1zVDfU/rhsNX+qvL7qY3Q94PsJBbiKycuuT+3vlbWrkdL9jzK+D5CAZt5MZB5IQAw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"4fc7668e9b3888e13afdfa65c3e93dbc5ee1f26a4426955b6d397d2a4099de5f","last_reissued_at":"2026-07-05T07:08:17.242577Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T07:08:17.242577Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"RoboVQA: Multimodal Long-Horizon Reasoning for Robotics","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.RO","authors_text":"Brian Ichter, Christine Chan, Debidatta Dwibedi, Fei Xia, Gabriel Dulac-Arnold, Izhak Shafran, Jeffrey Zhao, Karol Hausman, Keerthana Gopalakrishnan, Nikhil J Joshi, Pannag Sanketi, Peng Xu, Pete Florence, Pierre Sermanet, Robert Baruch, Sharath Maddineni, Suvir Mirchandani, Tianli Ding, Wei Han, Yao Lu, Yuan Cao","submitted_at":"2023-11-01T23:40:07Z","abstract_excerpt":"We present a scalable, bottom-up and intrinsically diverse data collection scheme that can be used for high-level reasoning with long and medium horizons and that has 2.2x higher throughput compared to traditional narrow top-down step-by-step collection. We collect realistic data by performing any user requests within the entirety of 3 office buildings and using multiple robot and human embodiments. With this data, we show that models trained on all embodiments perform better than ones trained on the robot data only, even when evaluated solely on robot episodes. We find that for a fixed collec"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2311.00899","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2311.00899/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2311.00899","created_at":"2026-07-05T07:08:17.242632+00:00"},{"alias_kind":"arxiv_version","alias_value":"2311.00899v1","created_at":"2026-07-05T07:08:17.242632+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2311.00899","created_at":"2026-07-05T07:08:17.242632+00:00"},{"alias_kind":"pith_short_12","alias_value":"J7DWNDU3HCEO","created_at":"2026-07-05T07:08:17.242632+00:00"},{"alias_kind":"pith_short_16","alias_value":"J7DWNDU3HCEOCOX5","created_at":"2026-07-05T07:08:17.242632+00:00"},{"alias_kind":"pith_short_8","alias_value":"J7DWNDU3","created_at":"2026-07-05T07:08:17.242632+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":12,"internal_anchor_count":1,"sample":[{"citing_arxiv_id":"2604.18483","citing_title":"Steadily moving semi-infinite fracture in plane poroelasticity","ref_index":84,"is_internal_anchor":true},{"citing_arxiv_id":"2607.00310","citing_title":"RetailSMV: Exocentric vs. Egocentric Adaptation of Foundation Video World Models in Retail","ref_index":20,"is_internal_anchor":false},{"citing_arxiv_id":"2606.02277","citing_title":"RoboSemanticBench: Diagnosing Semantic Grounding in Action Prediction for VLA Models","ref_index":27,"is_internal_anchor":false},{"citing_arxiv_id":"2605.27284","citing_title":"FineVLA: Fine-Grained Instruction Alignment for Steerable Vision-Language-Action Policies","ref_index":7,"is_internal_anchor":false},{"citing_arxiv_id":"2605.17070","citing_title":"EPIC-Bench: A Perception-Centric Benchmark for Fine-Grained Embodied Visual Grounding in Vision-Language Models","ref_index":5,"is_internal_anchor":false},{"citing_arxiv_id":"2605.19328","citing_title":"RoboJailBench: Benchmarking Adversarial Attacks and Defenses in Embodied Robotic Agents","ref_index":23,"is_internal_anchor":false},{"citing_arxiv_id":"2403.01823","citing_title":"RT-H: Action Hierarchies Using Language","ref_index":33,"is_internal_anchor":false},{"citing_arxiv_id":"2403.09631","citing_title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","ref_index":53,"is_internal_anchor":false},{"citing_arxiv_id":"2605.02881","citing_title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","ref_index":31,"is_internal_anchor":false},{"citing_arxiv_id":"2605.00397","citing_title":"MiniVLA-Nav v1: A Multi-Scene Simulation Dataset for Language-Conditioned Robot Navigation","ref_index":12,"is_internal_anchor":false},{"citing_arxiv_id":"2605.02881","citing_title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","ref_index":33,"is_internal_anchor":false},{"citing_arxiv_id":"2604.18484","citing_title":"XEmbodied: A Foundation Model with Enhanced Geometric and Physical Cues for Large-Scale Embodied Environments","ref_index":84,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/J7DWNDU3HCEOCOX57JS4H2J5XR","json":"https://pith.science/pith/J7DWNDU3HCEOCOX57JS4H2J5XR.json","graph_json":"https://pith.science/api/pith-number/J7DWNDU3HCEOCOX57JS4H2J5XR/graph.json","events_json":"https://pith.science/api/pith-number/J7DWNDU3HCEOCOX57JS4H2J5XR/events.json","paper":"https://pith.science/paper/J7DWNDU3"},"agent_actions":{"view_html":"https://pith.science/pith/J7DWNDU3HCEOCOX57JS4H2J5XR","download_json":"https://pith.science/pith/J7DWNDU3HCEOCOX57JS4H2J5XR.json","view_paper":"https://pith.science/paper/J7DWNDU3","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2311.00899&json=true","fetch_graph":"https://pith.science/api/pith-number/J7DWNDU3HCEOCOX57JS4H2J5XR/graph.json","fetch_events":"https://pith.science/api/pith-number/J7DWNDU3HCEOCOX57JS4H2J5XR/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/J7DWNDU3HCEOCOX57JS4H2J5XR/action/timestamp_anchor","attest_storage":"https://pith.science/pith/J7DWNDU3HCEOCOX57JS4H2J5XR/action/storage_attestation","attest_author":"https://pith.science/pith/J7DWNDU3HCEOCOX57JS4H2J5XR/action/author_attestation","sign_citation":"https://pith.science/pith/J7DWNDU3HCEOCOX57JS4H2J5XR/action/citation_signature","submit_replication":"https://pith.science/pith/J7DWNDU3HCEOCOX57JS4H2J5XR/action/replication_record"}},"created_at":"2026-07-05T07:08:17.242632+00:00","updated_at":"2026-07-05T07:08:17.242632+00:00"}