Pith. sign in

Paper Citation Record · LEDGER

Tactile Modality Fusion for Vision-Language-Action Models

As of 10 August 2026, this Paper Citation Record lists 73 of 73 outbound references and 3 inbound Pith citation observations for arXiv:2603.14604.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2603.14604 v2

Coverage vector

measured 73 of 73 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-02T18:13:12.014696Z

measured 76 of 76 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-10T06:31:04.303077+00:00

measured 3 of 3 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-02T01:39:24.557281Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-03T01:37:31.010271Z

Reference resolution

73 of 73 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved73
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 3f34ed4c-bba2-4b4d-b83d-cd35bf4dd2a5 · outbound

This paper cites Do As I Can, Not As I Say: Grounding Language in Robotic Affordances.

Tactile Modality Fusion for Vision-Language-Action Models Do As I Can, Not As I Say: Grounding Language in Robotic Affordances

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-02T18:13:06.795351Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T18:13:06.795351Z digest=sha256:71744fe18b5d7ecb08ea2cfef6abb9e75a13fa7380b83165487571e47eff4c0a

Observation 6258e8ec-64ec-4a78-a3bb-5a54aaf2a646 · outbound

This paper cites Advances in neural information processing systems35, 23716– 23736 (2022).

Tactile Modality Fusion for Vision-Language-Action Models Advances in neural information processing systems35, 23716– 23736 (2022)

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-02T18:13:06.841068Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T18:13:06.841068Z digest=sha256:83dd5e7433b503052b1d556548fdbeac232ead262ce6dca44c13b37d5009d1b0

Observation d6494ec4-d000-4342-82fd-969f49bfc6a7 · outbound

This paper cites VLA-Touch: Enhancing Vision-Language-Action Models with Dual-Level Tactile Feedback.

Tactile Modality Fusion for Vision-Language-Action Models VLA-Touch: Enhancing Vision-Language-Action Models with Dual-Level Tactile Feedback

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-02T18:13:06.907792Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T18:13:06.907792Z digest=sha256:d447815dacbeb9fd398b90fd4abc27687ff79808efc7dc5e6fba939966a6a159

Observation a0d75951-e1f7-49cd-b782-e84dc536a45a · outbound

This paper cites $\pi_0$: A Vision-Language-Action Flow Model for General Robot Control.

Tactile Modality Fusion for Vision-Language-Action Models $\pi_0$: A Vision-Language-Action Flow Model for General Robot Control

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-02T18:13:06.985926Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T18:13:06.985926Z digest=sha256:713fefa0d5fc2f22482c350e61608881066357da132110dd6a3c92369f814218

Observation 36c6dbcc-c8e5-4326-b572-2965663b0be4 · outbound

This paper cites Psychological science15(6), 397–402 (2004).

Tactile Modality Fusion for Vision-Language-Action Models Psychological science15(6), 397–402 (2004)

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-02T18:13:07.034820Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T18:13:07.034820Z digest=sha256:477838f9d312921d64e8b877de9e58ab3617893625418b31395343af3b5b4c2c

Observation e3b17f51-7d85-4bae-923c-7ae02da3768a · outbound

This paper cites RT-1: Robotics Transformer for Real-World Control at Scale.

Tactile Modality Fusion for Vision-Language-Action Models RT-1: Robotics Transformer for Real-World Control at Scale

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-02T18:13:07.096665Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T18:13:07.096665Z digest=sha256:48ddce59a8f6b65e934dc6295901e32f20b5e2326b8fec5516f99ae0be66ee18

Observation 9adab058-f014-43d7-9344-b052dadc815c · outbound

This paper cites Advances in neural information processing systems33, 1877–1901 (2020).

Tactile Modality Fusion for Vision-Language-Action Models Advances in neural information processing systems33, 1877–1901 (2020)

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-02T18:13:07.124463Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T18:13:07.124463Z digest=sha256:bbaf66ff2c3cba3f0337c5247f3506ca9e948c9511c0fd5829a7f55ce8eadb38

Observation e4a86493-5e8d-4052-b600-8b08b057a8f6 · outbound

This paper cites IEEE Robotics and Automation Letters3(4), 3300–3307 (2018).

Tactile Modality Fusion for Vision-Language-Action Models IEEE Robotics and Automation Letters3(4), 3300–3307 (2018)

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-02T18:13:07.151602Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T18:13:07.151602Z digest=sha256:29e463b76dd0324a70778256dc45a17dbacb11b7eaf99c9779300d593f883562

Observation 0ad129fb-16da-4a95-8e5c-a80c562723ce · outbound

This paper cites PaLI-X: On Scaling up a Multilingual Vision and Language Model.

Tactile Modality Fusion for Vision-Language-Action Models PaLI-X: On Scaling up a Multilingual Vision and Language Model

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-02T18:13:07.224966Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T18:13:07.224966Z digest=sha256:315757b93c8d5a025394fb5515da5f310318dd3c10bf851ca22330f75676a83d

Observation 601cb75c-89dd-4295-8929-91b68450fba3 · outbound

This paper cites PaLI: A Jointly-Scaled Multilingual Language-Image Model.

Tactile Modality Fusion for Vision-Language-Action Models PaLI: A Jointly-Scaled Multilingual Language-Image Model

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-02T18:13:07.308552Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T18:13:07.308552Z digest=sha256:94bcea9f87c39ae6da9a58611555b9c97280b2c9b5c0d1304ecbe8390185f8c6

Observation a0b3892a-9e86-44c5-a093-09db641c0bf5 · outbound

This paper cites Information Fusion p.

Tactile Modality Fusion for Vision-Language-Action Models Information Fusion p

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-02T18:13:07.392605Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T18:13:07.392605Z digest=sha256:f4dfb362af1852604364e75ea3da5dc25af2f579c4ae30d1ff84dff420f3d5f4

Observation ead208a5-67e0-4b85-9631-beacdaa80b8e · outbound

This paper cites arXiv preprint arXiv:2508.08706 (2025).

Tactile Modality Fusion for Vision-Language-Action Models arXiv preprint arXiv:2508.08706 (2025)

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-02T18:13:07.476091Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T18:13:07.476091Z digest=sha256:eac07480eea9b3644d59fe7730312ae46dc75797d137896ef1abc12a07a0fdf9

Observation 5e8d3e96-6df9-4fa1-8718-9714c9d8d3b5 · outbound

This paper cites Journal of machine learning research24(240), 1– 113 (2023).

Tactile Modality Fusion for Vision-Language-Action Models Journal of machine learning research24(240), 1– 113 (2023)

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-02T18:13:07.558364Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T18:13:07.558364Z digest=sha256:5037e6e2fe3714e04177a5caa2c8e3a144d2b91722d56d458d92557a4144e6c0

Observation 8d05bea7-43ce-4f13-872b-3f0090c21411 · outbound

This paper cites arXiv preprint arXiv:2510.06339 (2025).

Tactile Modality Fusion for Vision-Language-Action Models arXiv preprint arXiv:2510.06339 (2025)

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-02T18:13:07.615106Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T18:13:07.615106Z digest=sha256:72453e1486e6c3ac592bb62e86f23fb571b80d21558740fe4d9dbd58b6c98a12

Observation 7e6e979b-93a1-4c6b-b73a-881527bfe91b · outbound

This paper cites In: 2021 IEEE International Conference on Robotics and Automation (ICRA).

Tactile Modality Fusion for Vision-Language-Action Models In: 2021 IEEE International Conference on Robotics and Automation (ICRA)

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-02T18:13:07.706161Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T18:13:07.706161Z digest=sha256:a588075838a739d67d6ed4c1f39cc8e930d75538960f2096a1a402effa77e95d

Observation 5918619e-4726-4b61-bbda-4ab2f23ea125 · outbound

This paper cites An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale.

Tactile Modality Fusion for Vision-Language-Action Models An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-02T18:13:07.778147Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T18:13:07.778147Z digest=sha256:6a34fc3168eec7adc2d14f89ec5d21628e154d67fdde18ad48577b571542ae31

Observation 861dd294-8eba-463c-a0ed-3e00aef39b82 · outbound

This paper cites PaLM-E: An Embodied Multimodal Language Model.

Tactile Modality Fusion for Vision-Language-Action Models PaLM-E: An Embodied Multimodal Language Model

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-02T18:13:07.837052Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T18:13:07.837052Z digest=sha256:642876fdb1469247a6101f4155e09f2b46cb04b740fbe802969d86982f421f07

Observation e305a5a0-6309-4572-a440-c6880c811375 · outbound

This paper cites Vision-Language Models as Success Detectors.

Tactile Modality Fusion for Vision-Language-Action Models Vision-Language Models as Success Detectors

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-02T18:13:07.921806Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T18:13:07.921806Z digest=sha256:618cce59b862d663a75933326d19626a3ba4c9c14e16fd360264c1b5f06bf257

Observation 40c8a758-a5a6-4bba-8d36-65869e596aaa · outbound

This paper cites AnyTouch: Learning Unified Static-Dynamic Representation across Multiple Visuo-tactile Sensors.

Tactile Modality Fusion for Vision-Language-Action Models AnyTouch: Learning Unified Static-Dynamic Representation across Multiple Visuo-tactile Sensors

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-02T18:13:08.015826Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T18:13:08.015826Z digest=sha256:780cddd8bad0e9eed87d43a28834a75875e0bfc4e950d239c952b1f933ff0932

Observation 39061e10-d237-47bc-8498-d6e8b862c3cb · outbound

This paper cites arXiv preprint arXiv:2602.09617 (2026).

Tactile Modality Fusion for Vision-Language-Action Models arXiv preprint arXiv:2602.09617 (2026)

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-02T18:13:08.055469Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T18:13:08.055469Z digest=sha256:980555bff6d800333ab02d6315dc142ce6c7823dc9dd36b58858696355d2cf98

Observation dca2794f-f9a9-4f69-9640-131516996e8b · outbound

This paper cites In: 2025 IEEE International Conference on Robotics and Automation (ICRA).

Tactile Modality Fusion for Vision-Language-Action Models In: 2025 IEEE International Conference on Robotics and Automation (ICRA)

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-02T18:13:08.109251Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T18:13:08.109251Z digest=sha256:89a72495ef18e0f671f344a716597161a78db1d13e804aba096b3e3d6a7c7640

Observation ba64634d-3e1d-459e-bf6a-57ba1c06ca7b · outbound

This paper cites Sensor-Invariant Tactile Representation.

Tactile Modality Fusion for Vision-Language-Action Models Sensor-Invariant Tactile Representation

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-02T18:13:08.161723Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T18:13:08.161723Z digest=sha256:6ffa681f3af836201a80512049d045be23d9c1f20370fe403d65bb872591a441

Observation 616c25a0-efb5-4371-942a-fb6cf81455b7 · outbound

This paper cites In: 2022 International Conference on Robotics and Automation (ICRA).

Tactile Modality Fusion for Vision-Language-Action Models In: 2022 International Conference on Robotics and Automation (ICRA)

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-02T18:13:08.223322Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T18:13:08.223322Z digest=sha256:7150a75ada0b1855cb153a43988789bc0dac8ae5ab49cc04f35ed9a152458823

Observation c03427cf-0db2-4c44-8bf8-fbe1f5bee086 · outbound

This paper cites TLA: Tactile-Language-Action Model for Contact-Rich Manipulation.

Tactile Modality Fusion for Vision-Language-Action Models TLA: Tactile-Language-Action Model for Contact-Rich Manipulation

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-02T18:13:08.267569Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T18:13:08.267569Z digest=sha256:c9b0b06cadf0470298a2794cdbc8b21677f049ef3d212071fdbb1c02b8d08c47

Observation de5deb5a-7550-405d-b329-55a59f165636 · outbound

This paper cites ViTacFormer: Learning Cross-Modal Representation for Visuo-Tactile Dexterous Manipulation.

Tactile Modality Fusion for Vision-Language-Action Models ViTacFormer: Learning Cross-Modal Representation for Visuo-Tactile Dexterous Manipulation

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-02T18:13:08.352641Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T18:13:08.352641Z digest=sha256:008e9b9a781abaeb84a1231d15b63d1ed3dc97f25390464c65943b7026656327

Observation c27e80c4-4980-4c2b-bb94-7182c26d975e · outbound

This paper cites Sparsh: Self-supervised touch representations for vision-based tactile sensing.

Tactile Modality Fusion for Vision-Language-Action Models Sparsh: Self-supervised touch representations for vision-based tactile sensing

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-02T18:13:08.412026Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T18:13:08.412026Z digest=sha256:39ba0ff86d3dc3b5b3b970aa77b3ff89025e0599f956f280aa11c0ccdffc9066

Observation 4db7c627-f0c7-497c-88d6-25d77d59c1bf · outbound

This paper cites In: 2018 IEEE/RSJ In- ternational Conference on Intelligent Robots and Systems (IROS).

Tactile Modality Fusion for Vision-Language-Action Models In: 2018 IEEE/RSJ In- ternational Conference on Intelligent Robots and Systems (IROS)

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-02T18:13:08.454187Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T18:13:08.454187Z digest=sha256:26af7c313bcd90507e244dabb1cb3e4ab9513cf4206768fa3fac16728574255f

Observation 933b42ad-2553-4ba7-a0c6-3e80d15b7d35 · outbound

This paper cites In: Proceedings of the IEEE/CVF winter conference on applications of computer vision.

Tactile Modality Fusion for Vision-Language-Action Models In: Proceedings of the IEEE/CVF winter conference on applications of computer vision

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-02T18:13:08.505791Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T18:13:08.505791Z digest=sha256:2b363e8187cdc1d02ae47fc081421afe02c27459d8ca923ed420bad97f25ed0b

Observation 20551140-11a6-4b6a-ba0c-f5b874ae7c6a · outbound

This paper cites ICLR1(2), 3 (2022).

Tactile Modality Fusion for Vision-Language-Action Models ICLR1(2), 3 (2022)

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-02T18:13:08.556229Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T18:13:08.556229Z digest=sha256:7cd001a341ebe92ad0d57521f9014562ad3cc9e6eab8068b3c4b9ccffa3e72c4

Observation 04cdd81c-52e5-4a7b-86f1-4416e321dd33 · outbound

This paper cites Tactile-VLA: Unlocking Vision-Language-Action Model's Physical Knowledge for Tactile Generalization.

Tactile Modality Fusion for Vision-Language-Action Models Tactile-VLA: Unlocking Vision-Language-Action Model's Physical Knowledge for Tactile Generalization

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-02T18:13:08.634601Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T18:13:08.634601Z digest=sha256:1cb85ac0c641bf83875cd66f9ff5808848634979c410827684bf96a2fdeee7cd

Observation 127b1add-ce06-4fdf-8957-37e9218ef891 · outbound

This paper cites $\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization.

Tactile Modality Fusion for Vision-Language-Action Models $\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-02T18:13:08.696040Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T18:13:08.696040Z digest=sha256:69f7f43ef748a997a71547ba99cce2c001dd0b3a84c8e6fb38f6cd2e9de92ced

Observation 1adf34a0-24c3-4c6b-880c-682db1f84b72 · outbound

This paper cites In: International conference on machine learning.

Tactile Modality Fusion for Vision-Language-Action Models In: International conference on machine learning

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-02T18:13:08.777067Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T18:13:08.777067Z digest=sha256:aed205e2047dd41fd2e49cc3cef824ba2a1da2876328cf55083d62a931fabf84

Observation 041d3044-be7e-492a-b04e-8447821c8e84 · outbound

This paper cites Nature Reviews Neuroscience10(5), 345–359 (2009).

Tactile Modality Fusion for Vision-Language-Action Models Nature Reviews Neuroscience10(5), 345–359 (2009)

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-02T18:13:08.846773Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T18:13:08.846773Z digest=sha256:eaaff1df7f9ec59629766bb053d0ef9c3992145947f9e0b692e7a77af0053e8f

Observation d3cb7da0-d8c5-4875-b423-34306bcb00d1 · outbound

This paper cites Beyond Sight: Finetuning Generalist Robot Policies with Heterogeneous Sensors via Language Grounding.

Tactile Modality Fusion for Vision-Language-Action Models Beyond Sight: Finetuning Generalist Robot Policies with Heterogeneous Sensors via Language Grounding

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-02T18:13:08.910882Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T18:13:08.910882Z digest=sha256:b1cb5db6a30357326498ff31e99acf385fd06b6bb072ca3a8f6b19905dee4585

Observation 34f57c71-facf-489c-be05-ae940a3238bd · outbound

This paper cites Language-Driven Representation Learning for Robotics.

Tactile Modality Fusion for Vision-Language-Action Models Language-Driven Representation Learning for Robotics

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-02T18:13:09.022758Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T18:13:09.022758Z digest=sha256:ef7d6c68901f6078e74d059a5d91a4c5516ce4deebfec478170c803ce82939aa

Observation 76d7649f-3af9-4056-b086-8dd32e1b7076 · outbound

This paper cites Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success.

Tactile Modality Fusion for Vision-Language-Action Models Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-02T18:13:09.098895Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T18:13:09.098895Z digest=sha256:f39f43904563e609762c5f460a2cb3dd91166373208ed9721762772617128420

Observation c7443929-eb81-4f5c-bad4-79ebc5fbb9c8 · outbound

This paper cites OpenVLA: An Open-Source Vision-Language-Action Model.

Tactile Modality Fusion for Vision-Language-Action Models OpenVLA: An Open-Source Vision-Language-Action Model

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-02T18:13:09.169219Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T18:13:09.169219Z digest=sha256:c8d4ad444fdcf13b548dc4dad0043aa954d8f856d6817487526e30ea868a0201

Observation 3f311d55-be2e-43a4-b03e-765903f3ed45 · outbound

This paper cites IEEE Robotics and Automation Letters5(3), 3838–3845 (2020).

Tactile Modality Fusion for Vision-Language-Action Models IEEE Robotics and Automation Letters5(3), 3838–3845 (2020)

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-02T18:13:09.212647Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T18:13:09.212647Z digest=sha256:9d33c6a82ae00f787d7748af098432da281d55f1baeca35203fd017255af837b

Observation 505a6ee5-60e7-4206-b5af-6c97a5288192 · outbound

This paper cites In: 2019 International conference on robotics and automation (ICRA).

Tactile Modality Fusion for Vision-Language-Action Models In: 2019 International conference on robotics and automation (ICRA)

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-02T18:13:09.322227Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T18:13:09.322227Z digest=sha256:e282a93145436000b5cf06d619202f18b03ead1e57d0515cbce5830cc03400c1

Observation e1797b32-a9b0-4844-9166-8f8ab2585014 · outbound

This paper cites In: 2025 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS).

Tactile Modality Fusion for Vision-Language-Action Models In: 2025 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-02T18:13:09.368990Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T18:13:09.368990Z digest=sha256:4616a864b78c36857b455e7aed5f488794d025507d20fbd66d7423402f257cf7

Observation aeb7f255-83c4-430a-b637-2e73ad2c1088 · outbound

This paper cites In: International conference on machine learning.

Tactile Modality Fusion for Vision-Language-Action Models In: International conference on machine learning

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-02T18:13:09.424325Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T18:13:09.424325Z digest=sha256:31623da8ff0c5d2836aef16dd3f1a4f86113b65024de55b9613bf336a75f0409

Observation adce82ed-f6e7-4a26-ba11-fa37f4645376 · outbound

This paper cites In: International confer- ence on machine learning.

Tactile Modality Fusion for Vision-Language-Action Models In: International confer- ence on machine learning

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-02T18:13:09.478304Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T18:13:09.478304Z digest=sha256:9c7082605b9c5555c4450f94dfede9a178254373b0ac484f0c4238fbf0f1eeef

Observation e1caae98-d953-426b-ba1d-31ed564e9643 · outbound

This paper cites CLTP: Contrastive Language-Tactile Pre-training for 3D Contact Geometry Understanding.

Tactile Modality Fusion for Vision-Language-Action Models CLTP: Contrastive Language-Tactile Pre-training for 3D Contact Geometry Understanding

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-02T18:13:09.529978Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T18:13:09.529978Z digest=sha256:7fadea9a932baf4e486fd3740e82c1823246a1f8cc7304f28b412aa600efb4f7

Observation 7de51efb-8644-4f82-98cf-575084e215bd · outbound

This paper cites R3M: A Universal Visual Representation for Robot Manipulation.

Tactile Modality Fusion for Vision-Language-Action Models R3M: A Universal Visual Representation for Robot Manipulation

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-02T18:13:09.607919Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T18:13:09.607919Z digest=sha256:9c357a6b002b4d5885d8eb3a77ea15d92d7e0ccfd287965b1141c59b9129a4bb

Observation c829cf96-cb03-4e4f-968a-95c9367961b9 · outbound

This paper cites DINOv2: Learning Robust Visual Features without Supervision.

Tactile Modality Fusion for Vision-Language-Action Models DINOv2: Learning Robust Visual Features without Supervision

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-02T18:13:09.675980Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T18:13:09.675980Z digest=sha256:b05a6e67fe147605bf355102a402fc2ea964f68e34451d6c430da1d286591c36

Observation 3c76438d-3963-47ce-ad6d-b0004ecab254 · outbound

This paper cites In: 2024 IEEE International Conference on Robotics and Automation (ICRA).

Tactile Modality Fusion for Vision-Language-Action Models In: 2024 IEEE International Conference on Robotics and Automation (ICRA)

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-02T18:13:09.717918Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T18:13:09.717918Z digest=sha256:41d69838d12f086901551b88f475905bac4bacca986a3f05497cae6dec412905

Observation ef69fd43-3cac-4706-ad83-9d06de5c1209 · outbound

This paper cites In: Proceedings of the AAAI conference on artificial intelligence.

Tactile Modality Fusion for Vision-Language-Action Models In: Proceedings of the AAAI conference on artificial intelligence

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-02T18:13:09.792802Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T18:13:09.792802Z digest=sha256:215955030f0ede7296f96b9db803f3d706795c24c5033dd9b7309e270d38f602

Observation ded66399-8092-45b5-a5d4-5ab58bd745db · outbound

This paper cites In: Conference on Robot Learning.

Tactile Modality Fusion for Vision-Language-Action Models In: Conference on Robot Learning

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-02T18:13:09.848489Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T18:13:09.848489Z digest=sha256:20faaeb61d250f9dbe9e5a1d83a6fe9c2060005db3dbbbba1d41018a5471bdd6

Observation 2aa15305-7c81-4620-9cb7-c4fd8e002897 · outbound

This paper cites In: International conference on machine learning.

Tactile Modality Fusion for Vision-Language-Action Models In: International conference on machine learning

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-02T18:13:09.905181Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T18:13:09.905181Z digest=sha256:186c660cd727837c2ae56b490a95255c63f43862774c5eea2cac7af6a82f19a6

Observation c63c0463-486f-4d07-afe8-796d0b118edf · outbound

This paper cites In: Conference on robot learning.

Tactile Modality Fusion for Vision-Language-Action Models In: Conference on robot learning

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-02T18:13:09.965173Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T18:13:09.965173Z digest=sha256:c2a2710a85d15d8bc18f80a3ffc990a77723a368730c4f56b760b806785d5115

Observation 23669dcf-f178-4663-8333-323d850e7a7f · outbound

This paper cites Losing Visual Needles in Image Haystacks: Vision Language Models are Easily Distracted in Short and Long Contexts.

Tactile Modality Fusion for Vision-Language-Action Models Losing Visual Needles in Image Haystacks: Vision Language Models are Easily Distracted in Short and Long Contexts

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-02T18:13:10.024015Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T18:13:10.024015Z digest=sha256:2152b5fe2be86bf47c9bea610c394ffbb782d085e4ca4dc969c5f5ce0c293209

Observation 32ac22bf-acff-4cc6-9a9a-592459ba4bbf · outbound

This paper cites The International Journal of Robotics Research40(12-14), 1385–1401 (2021).

Tactile Modality Fusion for Vision-Language-Action Models The International Journal of Robotics Research40(12-14), 1385–1401 (2021)

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-02T18:13:10.082001Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T18:13:10.082001Z digest=sha256:3279511446936838bbca2e9f54102d4a1234b924bc04814cda70d41a9fddbc6c

Observation 885c24c1-a978-40be-85e0-aee70ce2b7bd · outbound

This paper cites In: Conference on robot learning.

Tactile Modality Fusion for Vision-Language-Action Models In: Conference on robot learning

Reference 53

Resolution
unresolved
no resolver link, observed 2026-08-02T18:13:10.157420Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T18:13:10.157420Z digest=sha256:7dcbe6d8bcb7ced39862a01198f3d4b190a8e7504ebf07ebc9e0db0ae45c73ba

Observation c80735aa-51fb-49ea-b4f0-a69e76cfb67e · outbound

This paper cites Open-World Object Manipulation using Pre-trained Vision-Language Models.

Tactile Modality Fusion for Vision-Language-Action Models Open-World Object Manipulation using Pre-trained Vision-Language Models

Reference 54

Resolution
unresolved
no resolver link, observed 2026-08-02T18:13:10.246106Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T18:13:10.246106Z digest=sha256:96142dfea4dd21efd5bd1500dfe62352165803dc325ccc259c95de46689a3424

Observation 24cd187c-f8b5-4314-be61-a802fb0bf898 · outbound

This paper cites Octo: An Open-Source Generalist Robot Policy.

Tactile Modality Fusion for Vision-Language-Action Models Octo: An Open-Source Generalist Robot Policy

Reference 55

Resolution
unresolved
no resolver link, observed 2026-08-02T18:13:10.319568Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T18:13:10.319568Z digest=sha256:c10b47e98572bf19e4518d7c9ef9244b6e23431a61e58dc24833010fe6f6421b

Observation d0b97498-a348-4d1e-8dfd-732af6bfa9c4 · outbound

This paper cites LLaMA: Open and Efficient Foundation Language Models.

Tactile Modality Fusion for Vision-Language-Action Models LLaMA: Open and Efficient Foundation Language Models

Reference 56

Resolution
unresolved
no resolver link, observed 2026-08-02T18:13:10.399210Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T18:13:10.399210Z digest=sha256:7b83b14ccd9cdfe79a233a7b56c5380c6be512db6023a45cefd07f4fb2e0771f

Observation 57bb3016-a743-42e1-8178-cbc91e5f8ba8 · outbound

This paper cites Llama 2: Open Foundation and Fine-Tuned Chat Models.

Tactile Modality Fusion for Vision-Language-Action Models Llama 2: Open Foundation and Fine-Tuned Chat Models

Reference 57

Resolution
unresolved
no resolver link, observed 2026-08-02T18:13:10.481317Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T18:13:10.481317Z digest=sha256:ec914fc572620b58ff6bd04e0f338017e051563327e428fb83650c77a0f138cc

Observation eb60596a-a6a9-4b1a-ab2e-be93d1c0dcd0 · outbound

This paper cites Advances in neural information pro- cessing systems30(2017).

Tactile Modality Fusion for Vision-Language-Action Models Advances in neural information pro- cessing systems30(2017)

Reference 58

Resolution
unresolved
no resolver link, observed 2026-08-02T18:13:10.537110Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T18:13:10.537110Z digest=sha256:aafb871ff765806ffe3cd751c8c16a5d9708564ffc044ea5e6a16de2d9e93686

Observation 654216c6-3e0d-420a-8b21-d7a05231b02e · outbound

This paper cites an unresolved cited work.

Tactile Modality Fusion for Vision-Language-Action Models Unresolved cited work

Reference 59

Resolution
unresolved
no resolver link, observed 2026-08-02T18:13:10.593287Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T18:13:10.593287Z digest=sha256:15f70909ea27338ec33c869efdd18a5c1d3f5450e75904094499710c01aa1c75

Observation 805b1cfa-eb08-4b7b-ad36-2e07087fa9bf · outbound

This paper cites Advances in neural information processing systems35, 24824–24837 (2022).

Tactile Modality Fusion for Vision-Language-Action Models Advances in neural information processing systems35, 24824–24837 (2022)

Reference 60

Resolution
unresolved
no resolver link, observed 2026-08-02T18:13:10.648350Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T18:13:10.648350Z digest=sha256:a13ddadf3ae22c0f647e46470aadcaa68584bf8e4d3f26814a2cead54f45b947

Observation f905c60a-f98b-4f24-b296-8c46a576bc4d · outbound

This paper cites Cable Routing and Assembly using Tactile-driven Motion Primitives.

Tactile Modality Fusion for Vision-Language-Action Models Cable Routing and Assembly using Tactile-driven Motion Primitives

Reference 61

Resolution
unresolved
no resolver link, observed 2026-08-02T18:13:10.690047Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T18:13:10.690047Z digest=sha256:0fad96c8135d8a128a5a58cffef635da764fc3892df0b04533aac9f88719817e

Observation 007e1999-317f-4737-ba4e-bc7ac70bc2dd · outbound

This paper cites In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition.

Tactile Modality Fusion for Vision-Language-Action Models In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition

Reference 62

Resolution
unresolved
no resolver link, observed 2026-08-02T18:13:10.771971Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T18:13:10.771971Z digest=sha256:f5f493dc06f2b1326a776fba4005e6e855b74359f1c86b136a132717a7582154

Observation efc1d857-1338-4e96-8a43-541ab4f035da · outbound

This paper cites arXiv preprint arXiv:2505.22159 (2025).

Tactile Modality Fusion for Vision-Language-Action Models arXiv preprint arXiv:2505.22159 (2025)

Reference 63

Resolution
unresolved
no resolver link, observed 2026-08-02T18:13:10.837649Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T18:13:10.837649Z digest=sha256:01bd97192b14d1f84aeeaeaf7783cb30ce8edb6ab455cfa4b98dafe8b1d62b52

Observation 70506059-6dd4-423e-8a34-b5902ce5266e · outbound

This paper cites Octopi: Object Property Reasoning with Large Tactile-Language Models.

Tactile Modality Fusion for Vision-Language-Action Models Octopi: Object Property Reasoning with Large Tactile-Language Models

Reference 64

Resolution
unresolved
no resolver link, observed 2026-08-02T18:13:10.937804Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T18:13:10.937804Z digest=sha256:a97821d76a2162aa066cc576d996f63e29a2cd97568199c35797275428576749

Observation 45bb2ade-7cf6-41e8-9b86-28f9a6eb6a40 · outbound

This paper cites Sensors17(12), 2762 (2017).

Tactile Modality Fusion for Vision-Language-Action Models Sensors17(12), 2762 (2017)

Reference 65

Resolution
unresolved
no resolver link, observed 2026-08-02T18:13:11.043398Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T18:13:11.043398Z digest=sha256:d4aa64995b3eadf0a43b7fdf5343c54e184ce050769285f8e56f0b2862eb37a7

Observation 160e4104-c656-4a46-a88b-1743004779b9 · outbound

This paper cites In: 2024 IEEE International Conference on Robotics and Automation (ICRA).

Tactile Modality Fusion for Vision-Language-Action Models In: 2024 IEEE International Conference on Robotics and Automation (ICRA)

Reference 66

Resolution
unresolved
no resolver link, observed 2026-08-02T18:13:11.147689Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T18:13:11.147689Z digest=sha256:48cc16b7fcc83f1db91dc25fafe5f17bdaa7a1cc3166a552d4626c2321847d2c

Observation 8dc72ecf-bcf6-4563-9508-354e09bf5898 · outbound

This paper cites In: Proceedings of the IEEE/CVF international conference on computer vision.

Tactile Modality Fusion for Vision-Language-Action Models In: Proceedings of the IEEE/CVF international conference on computer vision

Reference 67

Resolution
unresolved
no resolver link, observed 2026-08-02T18:13:11.249555Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T18:13:11.249555Z digest=sha256:226dc3465496714947c5c3b4956cc25038892a4a5f6de104ce5e52f280a9bef4

Observation 54ebce5b-3ef5-44da-bbed-05a604582b7d · outbound

This paper cites VTLA: Vision-Tactile-Language-Action Model with Preference Learning for Insertion Manipulation.

Tactile Modality Fusion for Vision-Language-Action Models VTLA: Vision-Tactile-Language-Action Model with Preference Learning for Insertion Manipulation

Reference 68

Resolution
unresolved
no resolver link, observed 2026-08-02T18:13:11.413729Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T18:13:11.413729Z digest=sha256:9b226f63925ea6a2328067e28438962d819cc5f3aac4accbe532cd9b67f0f02c

Observation 274813c4-d68f-485c-86d6-adaa706c12bd · outbound

This paper cites Grounding Classical Task Planners via Vision-Language Models.

Tactile Modality Fusion for Vision-Language-Action Models Grounding Classical Task Planners via Vision-Language Models

Reference 69

Resolution
unresolved
no resolver link, observed 2026-08-02T18:13:11.550160Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T18:13:11.550160Z digest=sha256:975c330bdb575890e700b7258f5da3594276e0e2aa3e7637f500b4590d3929f0

Observation 56ea649e-b5ae-4847-b257-295bb132218d · outbound

This paper cites TouchGuide: Inference-Time Steering of Visuomotor Policies via Touch Guidance.

Tactile Modality Fusion for Vision-Language-Action Models TouchGuide: Inference-Time Steering of Visuomotor Policies via Touch Guidance

Reference 70

Resolution
unresolved
no resolver link, observed 2026-08-02T18:13:11.618026Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T18:13:11.618026Z digest=sha256:df27f1d51959f1ca631b9a128f517849c0ad6f23c347bbc4d8e172ea62d02892

Observation e685ac13-732c-4348-8399-c7fb9c1e5eb4 · outbound

This paper cites In: 2025 IEEE International Conference on Robotics and Automation (ICRA).

Tactile Modality Fusion for Vision-Language-Action Models In: 2025 IEEE International Conference on Robotics and Automation (ICRA)

Reference 71

Resolution
unresolved
no resolver link, observed 2026-08-02T18:13:11.776055Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T18:13:11.776055Z digest=sha256:ae84c324c0b9f52268a30a10b2c1e1615b4a07ba16008852a94e74dfe81201d8

Observation a4fc770a-4ea1-4e38-ae89-9b6867973401 · outbound

This paper cites Transferable Tactile Transformers for Representation Learning Across Diverse Sensors and Tasks.

Tactile Modality Fusion for Vision-Language-Action Models Transferable Tactile Transformers for Representation Learning Across Diverse Sensors and Tasks

Reference 72

Resolution
unresolved
no resolver link, observed 2026-08-02T18:13:11.893666Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T18:13:11.893666Z digest=sha256:b9314212bffe4b7848300e64053d8e416cccdb053d1e21f566ec2f785d2bffee

Observation 60b0970f-0bc4-4100-9a3b-05a0391c5163 · outbound

This paper cites In: Conference on Robot Learning.

Tactile Modality Fusion for Vision-Language-Action Models In: Conference on Robot Learning

Reference 73

Resolution
unresolved
no resolver link, observed 2026-08-02T18:13:12.014696Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T18:13:12.014696Z digest=sha256:e305e2920b17ab2a99a2db6b1f32b4082ed546310893e956291aa7d55b6247da

Pith citing papers

Observation dd273e23-845d-4651-9400-69a0ec62ba92 · inbound

AetheRock: An Arm-Worn Robot Teaching System for Force-Guided Vision-Tactile Learning cites this paper.

AetheRock: An Arm-Worn Robot Teaching System for Force-Guided Vision-Tactile Learning Tactile Modality Fusion for Vision-Language-Action Models

Reference 36

Resolution
verified exact
arxiv_id, observed 2026-07-16T01:21:46.008504Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-06-27T16:25:09.975308Z digest=sha256:4bab675d3304f0c221f402ef9f21229b9517fe205844510e50f32f257842eafc

Observation 7ce87b69-0e10-49be-a370-409bad48f53e · inbound

Representation-Aligned Tactile Grounding for Contact-Rich Robotic Manipulation cites this paper.

Representation-Aligned Tactile Grounding for Contact-Rich Robotic Manipulation Tactile Modality Fusion for Vision-Language-Action Models

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-02T01:39:24.557281Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T01:39:24.557281Z digest=sha256:63fa45ae7199d4bbe8178aae42b24c9ef6ef3880ec36d3f163ce2e74456d05ac

Observation a81ff2ac-2c64-42ae-8331-e3d5c19db8a6 · inbound

ViTacWorld: Scaling Visuo-Tactile World Models for Contact-Rich Robot Manipulation cites this paper.

ViTacWorld: Scaling Visuo-Tactile World Models for Contact-Rich Robot Manipulation Tactile Modality Fusion for Vision-Language-Action Models

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-01T04:28:09.527853Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T04:28:09.527853Z digest=sha256:045f887b6acce3cc4dd4f04a713ff8b4eaaf23d8b22cc21b8822f778d7ff513a