{"as_of":"2026-08-10T12:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6dbdb7616cfb269a5f08436c30d29b26fc6d441eb129068b4efa7f48ed621da7","coverage":[{"denominator":73,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":73,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T18:13:12.014696Z","state":"measured"},{"denominator":76,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":76,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T01:39:24.557281Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T01:37:31.010271Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2603.14604","last_updated":"2026-07-15T00:55:50Z","snapshot_observed_at":"2026-08-07T00:53:09.787457Z","submitted_at":"2026-03-15T20:57:51Z","title":"Tactile Modality Fusion for Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2603.14604","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2603.14604","snapshot_observed_at":"2026-07-16T01:21:46.008504Z","title":"Morissette, A","venue":null,"work_id":"63a5d748-afce-47e9-87dc-d5770c6f7ba2","year":2026},"citing_paper":{"arxiv_id":"2606.09777","last_updated":"2026-06-08T17:38:57Z","snapshot_observed_at":"2026-08-02T02:10:16.108128Z","submitted_at":"2026-06-08T17:38:57Z","title":"AetheRock: An Arm-Worn Robot Teaching System for Force-Guided Vision-Tactile Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-27T16:25:09.975308Z"},"links":{"cited_paper":"/paper/2603.14604","citing_paper":"/paper/2606.09777"},"observation_digest":"sha256:4bab675d3304f0c221f402ef9f21229b9517fe205844510e50f32f257842eafc","observation_id":"dd273e23-845d-4651-9400-69a0ec62ba92","resolution":{"observed_at":"2026-07-16T01:21:46.008504Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.14604","last_updated":"2026-07-15T00:55:50Z","snapshot_observed_at":"2026-08-07T00:53:09.787457Z","submitted_at":"2026-03-15T20:57:51Z","title":"Tactile Modality Fusion for Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.14604","snapshot_observed_at":"2026-08-02T01:39:24.557281Z","title":"Morissette et al","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14609","last_updated":"2026-07-16T06:12:05Z","snapshot_observed_at":"2026-08-09T03:06:08.499674Z","submitted_at":"2026-07-16T06:12:05Z","title":"Representation-Aligned Tactile Grounding for Contact-Rich Robotic Manipulation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T01:39:24.557281Z"},"links":{"cited_paper":"/paper/2603.14604","citing_paper":"/paper/2607.14609"},"observation_digest":"sha256:63fa45ae7199d4bbe8178aae42b24c9ef6ef3880ec36d3f163ce2e74456d05ac","observation_id":"7ce87b69-0e10-49be-a370-409bad48f53e","resolution":{"observed_at":"2026-08-02T01:39:24.557281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.14604","last_updated":"2026-07-15T00:55:50Z","snapshot_observed_at":"2026-08-07T00:53:09.787457Z","submitted_at":"2026-03-15T20:57:51Z","title":"Tactile Modality Fusion for Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.14604","snapshot_observed_at":"2026-08-01T04:28:09.527853Z","title":"Morissette, A","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.22530","last_updated":"2026-07-24T17:59:33Z","snapshot_observed_at":"2026-08-07T23:28:12.417967Z","submitted_at":"2026-07-24T17:59:33Z","title":"ViTacWorld: Scaling Visuo-Tactile World Models for Contact-Rich Robot Manipulation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T04:28:09.527853Z"},"links":{"cited_paper":"/paper/2603.14604","citing_paper":"/paper/2607.22530"},"observation_digest":"sha256:045f887b6acce3cc4dd4f04a713ff8b4eaaf23d8b22cc21b8822f778d7ff513a","observation_id":"a81ff2ac-2c64-42ae-8331-e3d5c19db8a6","resolution":{"observed_at":"2026-08-01T04:28:09.527853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2603.14604/citation-record","integrity":"/paper/2603.14604/integrity","json":"/paper/2603.14604/citation-record.json","paper":"/paper/2603.14604"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2204.01691","last_updated":"2022-08-16T16:06:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-04T17:57:11Z","title":"Do As I Can, Not As I Say: Grounding Language in Robotic Affordances","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.01691","snapshot_observed_at":"2026-08-02T18:13:06.795351Z","title":"arXiv preprint arXiv:2204.01691 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.14604","last_updated":"2026-07-15T00:55:50Z","snapshot_observed_at":"2026-08-07T00:53:09.787457Z","submitted_at":"2026-03-15T20:57:51Z","title":"Tactile Modality Fusion for Vision-Language-Action Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T18:13:06.795351Z"},"links":{"cited_paper":"/paper/2204.01691","citing_paper":"/paper/2603.14604"},"observation_digest":"sha256:71744fe18b5d7ecb08ea2cfef6abb9e75a13fa7380b83165487571e47eff4c0a","observation_id":"3f34ed4c-bba2-4b4d-b83d-cd35bf4dd2a5","resolution":{"observed_at":"2026-08-02T18:13:06.795351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:13:06.841068Z","title":"Advances in neural information processing systems35, 23716– 23736 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.14604","last_updated":"2026-07-15T00:55:50Z","snapshot_observed_at":"2026-08-07T00:53:09.787457Z","submitted_at":"2026-03-15T20:57:51Z","title":"Tactile Modality Fusion for Vision-Language-Action Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T18:13:06.841068Z"},"links":{"citing_paper":"/paper/2603.14604"},"observation_digest":"sha256:83dd5e7433b503052b1d556548fdbeac232ead262ce6dca44c13b37d5009d1b0","observation_id":"6258e8ec-64ec-4a78-a3bb-5a54aaf2a646","resolution":{"observed_at":"2026-08-02T18:13:06.841068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.17294","last_updated":"2025-07-29T12:31:26Z","snapshot_observed_at":"2026-08-07T12:19:24.704554Z","submitted_at":"2025-07-23T07:54:10Z","title":"VLA-Touch: Enhancing Vision-Language-Action Models with Dual-Level Tactile Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.17294","snapshot_observed_at":"2026-08-02T18:13:06.907792Z","title":"arXiv preprint arXiv:2507.17294 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.14604","last_updated":"2026-07-15T00:55:50Z","snapshot_observed_at":"2026-08-07T00:53:09.787457Z","submitted_at":"2026-03-15T20:57:51Z","title":"Tactile Modality Fusion for Vision-Language-Action Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T18:13:06.907792Z"},"links":{"cited_paper":"/paper/2507.17294","citing_paper":"/paper/2603.14604"},"observation_digest":"sha256:d447815dacbeb9fd398b90fd4abc27687ff79808efc7dc5e6fba939966a6a159","observation_id":"d6494ec4-d000-4342-82fd-969f49bfc6a7","resolution":{"observed_at":"2026-08-02T18:13:06.907792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-02T18:13:06.985926Z","title":"arXiv preprint arXiv:2410.24164 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.14604","last_updated":"2026-07-15T00:55:50Z","snapshot_observed_at":"2026-08-07T00:53:09.787457Z","submitted_at":"2026-03-15T20:57:51Z","title":"Tactile Modality Fusion for Vision-Language-Action Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T18:13:06.985926Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2603.14604"},"observation_digest":"sha256:713fefa0d5fc2f22482c350e61608881066357da132110dd6a3c92369f814218","observation_id":"a0d75951-e1f7-49cd-b782-e84dc536a45a","resolution":{"observed_at":"2026-08-02T18:13:06.985926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:13:07.034820Z","title":"Psychological science15(6), 397–402 (2004)","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2603.14604","last_updated":"2026-07-15T00:55:50Z","snapshot_observed_at":"2026-08-07T00:53:09.787457Z","submitted_at":"2026-03-15T20:57:51Z","title":"Tactile Modality Fusion for Vision-Language-Action Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T18:13:07.034820Z"},"links":{"citing_paper":"/paper/2603.14604"},"observation_digest":"sha256:477838f9d312921d64e8b877de9e58ab3617893625418b31395343af3b5b4c2c","observation_id":"36c6dbcc-c8e5-4326-b572-2965663b0be4","resolution":{"observed_at":"2026-08-02T18:13:07.034820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-08-02T18:13:07.096665Z","title":"arXiv preprint arXiv:2212.06817 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.14604","last_updated":"2026-07-15T00:55:50Z","snapshot_observed_at":"2026-08-07T00:53:09.787457Z","submitted_at":"2026-03-15T20:57:51Z","title":"Tactile Modality Fusion for Vision-Language-Action Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T18:13:07.096665Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2603.14604"},"observation_digest":"sha256:48ddce59a8f6b65e934dc6295901e32f20b5e2326b8fec5516f99ae0be66ee18","observation_id":"e3b17f51-7d85-4bae-923c-7ae02da3768a","resolution":{"observed_at":"2026-08-02T18:13:07.096665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:13:07.124463Z","title":"Advances in neural information processing systems33, 1877–1901 (2020)","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2603.14604","last_updated":"2026-07-15T00:55:50Z","snapshot_observed_at":"2026-08-07T00:53:09.787457Z","submitted_at":"2026-03-15T20:57:51Z","title":"Tactile Modality Fusion for Vision-Language-Action Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T18:13:07.124463Z"},"links":{"citing_paper":"/paper/2603.14604"},"observation_digest":"sha256:bbaf66ff2c3cba3f0337c5247f3506ca9e948c9511c0fd5829a7f55ce8eadb38","observation_id":"9adab058-f014-43d7-9344-b052dadc815c","resolution":{"observed_at":"2026-08-02T18:13:07.124463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:13:07.151602Z","title":"IEEE Robotics and Automation Letters3(4), 3300–3307 (2018)","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2603.14604","last_updated":"2026-07-15T00:55:50Z","snapshot_observed_at":"2026-08-07T00:53:09.787457Z","submitted_at":"2026-03-15T20:57:51Z","title":"Tactile Modality Fusion for Vision-Language-Action Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T18:13:07.151602Z"},"links":{"citing_paper":"/paper/2603.14604"},"observation_digest":"sha256:29e463b76dd0324a70778256dc45a17dbacb11b7eaf99c9779300d593f883562","observation_id":"e4a86493-5e8d-4052-b600-8b08b057a8f6","resolution":{"observed_at":"2026-08-02T18:13:07.151602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18565","last_updated":"2023-05-29T18:58:38Z","snapshot_observed_at":"2026-08-07T07:27:51.369423Z","submitted_at":"2023-05-29T18:58:38Z","title":"PaLI-X: On Scaling up a Multilingual Vision and Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18565","snapshot_observed_at":"2026-08-02T18:13:07.224966Z","title":"arXiv preprint arXiv:2305.18565 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.14604","last_updated":"2026-07-15T00:55:50Z","snapshot_observed_at":"2026-08-07T00:53:09.787457Z","submitted_at":"2026-03-15T20:57:51Z","title":"Tactile Modality Fusion for Vision-Language-Action Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T18:13:07.224966Z"},"links":{"cited_paper":"/paper/2305.18565","citing_paper":"/paper/2603.14604"},"observation_digest":"sha256:315757b93c8d5a025394fb5515da5f310318dd3c10bf851ca22330f75676a83d","observation_id":"0ad129fb-16da-4a95-8e5c-a80c562723ce","resolution":{"observed_at":"2026-08-02T18:13:07.224966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.06794","last_updated":"2023-06-05T17:55:12Z","snapshot_observed_at":"2026-08-10T09:03:43.940864Z","submitted_at":"2022-09-14T17:24:07Z","title":"PaLI: A Jointly-Scaled Multilingual Language-Image Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.06794","snapshot_observed_at":"2026-08-02T18:13:07.308552Z","title":"arXiv preprint arXiv:2209.06794 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.14604","last_updated":"2026-07-15T00:55:50Z","snapshot_observed_at":"2026-08-07T00:53:09.787457Z","submitted_at":"2026-03-15T20:57:51Z","title":"Tactile Modality Fusion for Vision-Language-Action Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T18:13:07.308552Z"},"links":{"cited_paper":"/paper/2209.06794","citing_paper":"/paper/2603.14604"},"observation_digest":"sha256:94bcea9f87c39ae6da9a58611555b9c97280b2c9b5c0d1304ecbe8390185f8c6","observation_id":"601cb75c-89dd-4295-8929-91b68450fba3","resolution":{"observed_at":"2026-08-02T18:13:07.308552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:13:07.392605Z","title":"Information Fusion p","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.14604","last_updated":"2026-07-15T00:55:50Z","snapshot_observed_at":"2026-08-07T00:53:09.787457Z","submitted_at":"2026-03-15T20:57:51Z","title":"Tactile Modality Fusion for Vision-Language-Action Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T18:13:07.392605Z"},"links":{"citing_paper":"/paper/2603.14604"},"observation_digest":"sha256:f4dfb362af1852604364e75ea3da5dc25af2f579c4ae30d1ff84dff420f3d5f4","observation_id":"a0b3892a-9e86-44c5-a093-09db641c0bf5","resolution":{"observed_at":"2026-08-02T18:13:07.392605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:13:07.476091Z","title":"arXiv preprint arXiv:2508.08706 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.14604","last_updated":"2026-07-15T00:55:50Z","snapshot_observed_at":"2026-08-07T00:53:09.787457Z","submitted_at":"2026-03-15T20:57:51Z","title":"Tactile Modality Fusion for Vision-Language-Action Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T18:13:07.476091Z"},"links":{"citing_paper":"/paper/2603.14604"},"observation_digest":"sha256:eac07480eea9b3644d59fe7730312ae46dc75797d137896ef1abc12a07a0fdf9","observation_id":"ead208a5-67e0-4b85-9631-beacdaa80b8e","resolution":{"observed_at":"2026-08-02T18:13:07.476091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:13:07.558364Z","title":"Journal of machine learning research24(240), 1– 113 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.14604","last_updated":"2026-07-15T00:55:50Z","snapshot_observed_at":"2026-08-07T00:53:09.787457Z","submitted_at":"2026-03-15T20:57:51Z","title":"Tactile Modality Fusion for Vision-Language-Action Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T18:13:07.558364Z"},"links":{"citing_paper":"/paper/2603.14604"},"observation_digest":"sha256:5037e6e2fe3714e04177a5caa2c8e3a144d2b91722d56d458d92557a4144e6c0","observation_id":"5e8d3e96-6df9-4fa1-8718-9714c9d8d3b5","resolution":{"observed_at":"2026-08-02T18:13:07.558364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:13:07.615106Z","title":"arXiv preprint arXiv:2510.06339 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.14604","last_updated":"2026-07-15T00:55:50Z","snapshot_observed_at":"2026-08-07T00:53:09.787457Z","submitted_at":"2026-03-15T20:57:51Z","title":"Tactile Modality Fusion for Vision-Language-Action Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T18:13:07.615106Z"},"links":{"citing_paper":"/paper/2603.14604"},"observation_digest":"sha256:72453e1486e6c3ac592bb62e86f23fb571b80d21558740fe4d9dbd58b6c98a12","observation_id":"8d05bea7-43ce-4f13-872b-3f0090c21411","resolution":{"observed_at":"2026-08-02T18:13:07.615106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:13:07.706161Z","title":"In: 2021 IEEE International Conference on Robotics and Automation (ICRA)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.14604","last_updated":"2026-07-15T00:55:50Z","snapshot_observed_at":"2026-08-07T00:53:09.787457Z","submitted_at":"2026-03-15T20:57:51Z","title":"Tactile Modality Fusion for Vision-Language-Action Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T18:13:07.706161Z"},"links":{"citing_paper":"/paper/2603.14604"},"observation_digest":"sha256:a588075838a739d67d6ed4c1f39cc8e930d75538960f2096a1a402effa77e95d","observation_id":"7e6e979b-93a1-4c6b-b73a-881527bfe91b","resolution":{"observed_at":"2026-08-02T18:13:07.706161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-10T01:12:16.468283Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-02T18:13:07.778147Z","title":"Morissette et al","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2603.14604","last_updated":"2026-07-15T00:55:50Z","snapshot_observed_at":"2026-08-07T00:53:09.787457Z","submitted_at":"2026-03-15T20:57:51Z","title":"Tactile Modality Fusion for Vision-Language-Action Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T18:13:07.778147Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2603.14604"},"observation_digest":"sha256:6a34fc3168eec7adc2d14f89ec5d21628e154d67fdde18ad48577b571542ae31","observation_id":"5918619e-4726-4b61-bbda-4ab2f23ea125","resolution":{"observed_at":"2026-08-02T18:13:07.778147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-08-08T22:04:13.117781Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-08-02T18:13:07.837052Z","title":"arXiv preprint arXiv:2303.03378 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.14604","last_updated":"2026-07-15T00:55:50Z","snapshot_observed_at":"2026-08-07T00:53:09.787457Z","submitted_at":"2026-03-15T20:57:51Z","title":"Tactile Modality Fusion for Vision-Language-Action Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T18:13:07.837052Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2603.14604"},"observation_digest":"sha256:642876fdb1469247a6101f4155e09f2b46cb04b740fbe802969d86982f421f07","observation_id":"861dd294-8eba-463c-a0ed-3e00aef39b82","resolution":{"observed_at":"2026-08-02T18:13:07.837052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.07280","last_updated":"2023-03-13T16:54:11Z","snapshot_observed_at":"2026-08-09T18:23:52.580156Z","submitted_at":"2023-03-13T16:54:11Z","title":"Vision-Language Models as Success Detectors","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.07280","snapshot_observed_at":"2026-08-02T18:13:07.921806Z","title":"arXiv preprint arXiv:2303.07280 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.14604","last_updated":"2026-07-15T00:55:50Z","snapshot_observed_at":"2026-08-07T00:53:09.787457Z","submitted_at":"2026-03-15T20:57:51Z","title":"Tactile Modality Fusion for Vision-Language-Action Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T18:13:07.921806Z"},"links":{"cited_paper":"/paper/2303.07280","citing_paper":"/paper/2603.14604"},"observation_digest":"sha256:618cce59b862d663a75933326d19626a3ba4c9c14e16fd360264c1b5f06bf257","observation_id":"e305a5a0-6309-4572-a440-c6880c811375","resolution":{"observed_at":"2026-08-02T18:13:07.921806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12191","last_updated":"2025-04-01T08:17:30Z","snapshot_observed_at":"2026-08-10T03:20:10.933575Z","submitted_at":"2025-02-15T08:33:25Z","title":"AnyTouch: Learning Unified Static-Dynamic Representation across Multiple Visuo-tactile Sensors","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12191","snapshot_observed_at":"2026-08-02T18:13:08.015826Z","title":"arXiv preprint arXiv:2502.12191 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.14604","last_updated":"2026-07-15T00:55:50Z","snapshot_observed_at":"2026-08-07T00:53:09.787457Z","submitted_at":"2026-03-15T20:57:51Z","title":"Tactile Modality Fusion for Vision-Language-Action Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T18:13:08.015826Z"},"links":{"cited_paper":"/paper/2502.12191","citing_paper":"/paper/2603.14604"},"observation_digest":"sha256:780cddd8bad0e9eed87d43a28834a75875e0bfc4e950d239c952b1f933ff0932","observation_id":"40c8a758-a5a6-4bba-8d36-65869e596aaa","resolution":{"observed_at":"2026-08-02T18:13:08.015826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:13:08.055469Z","title":"arXiv preprint arXiv:2602.09617 (2026)","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2603.14604","last_updated":"2026-07-15T00:55:50Z","snapshot_observed_at":"2026-08-07T00:53:09.787457Z","submitted_at":"2026-03-15T20:57:51Z","title":"Tactile Modality Fusion for Vision-Language-Action Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T18:13:08.055469Z"},"links":{"citing_paper":"/paper/2603.14604"},"observation_digest":"sha256:980555bff6d800333ab02d6315dc142ce6c7823dc9dd36b58858696355d2cf98","observation_id":"39061e10-d237-47bc-8498-d6e8b862c3cb","resolution":{"observed_at":"2026-08-02T18:13:08.055469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:13:08.109251Z","title":"In: 2025 IEEE International Conference on Robotics and Automation (ICRA)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.14604","last_updated":"2026-07-15T00:55:50Z","snapshot_observed_at":"2026-08-07T00:53:09.787457Z","submitted_at":"2026-03-15T20:57:51Z","title":"Tactile Modality Fusion for Vision-Language-Action Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T18:13:08.109251Z"},"links":{"citing_paper":"/paper/2603.14604"},"observation_digest":"sha256:89a72495ef18e0f671f344a716597161a78db1d13e804aba096b3e3d6a7c7640","observation_id":"dca2794f-f9a9-4f69-9640-131516996e8b","resolution":{"observed_at":"2026-08-02T18:13:08.109251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19638","last_updated":"2025-03-13T01:45:38Z","snapshot_observed_at":"2026-08-07T17:44:36.639066Z","submitted_at":"2025-02-27T00:12:50Z","title":"Sensor-Invariant Tactile Representation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19638","snapshot_observed_at":"2026-08-02T18:13:08.161723Z","title":"arXiv preprint arXiv:2502.19638 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.14604","last_updated":"2026-07-15T00:55:50Z","snapshot_observed_at":"2026-08-07T00:53:09.787457Z","submitted_at":"2026-03-15T20:57:51Z","title":"Tactile Modality Fusion for Vision-Language-Action Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T18:13:08.161723Z"},"links":{"cited_paper":"/paper/2502.19638","citing_paper":"/paper/2603.14604"},"observation_digest":"sha256:6ffa681f3af836201a80512049d045be23d9c1f20370fe403d65bb872591a441","observation_id":"ba64634d-3e1d-459e-bf6a-57ba1c06ca7b","resolution":{"observed_at":"2026-08-02T18:13:08.161723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:13:08.223322Z","title":"In: 2022 International Conference on Robotics and Automation (ICRA)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.14604","last_updated":"2026-07-15T00:55:50Z","snapshot_observed_at":"2026-08-07T00:53:09.787457Z","submitted_at":"2026-03-15T20:57:51Z","title":"Tactile Modality Fusion for Vision-Language-Action Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T18:13:08.223322Z"},"links":{"citing_paper":"/paper/2603.14604"},"observation_digest":"sha256:7150a75ada0b1855cb153a43988789bc0dac8ae5ab49cc04f35ed9a152458823","observation_id":"616c25a0-efb5-4371-942a-fb6cf81455b7","resolution":{"observed_at":"2026-08-02T18:13:08.223322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.08548","last_updated":"2025-03-11T15:36:28Z","snapshot_observed_at":"2026-08-07T17:12:37.079902Z","submitted_at":"2025-03-11T15:36:28Z","title":"TLA: Tactile-Language-Action Model for Contact-Rich Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.08548","snapshot_observed_at":"2026-08-02T18:13:08.267569Z","title":"arXiv preprint arXiv:2503.08548 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.14604","last_updated":"2026-07-15T00:55:50Z","snapshot_observed_at":"2026-08-07T00:53:09.787457Z","submitted_at":"2026-03-15T20:57:51Z","title":"Tactile Modality Fusion for Vision-Language-Action Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T18:13:08.267569Z"},"links":{"cited_paper":"/paper/2503.08548","citing_paper":"/paper/2603.14604"},"observation_digest":"sha256:c9b0b06cadf0470298a2794cdbc8b21677f049ef3d212071fdbb1c02b8d08c47","observation_id":"c03427cf-0db2-4c44-8bf8-fbe1f5bee086","resolution":{"observed_at":"2026-08-02T18:13:08.267569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.15953","last_updated":"2026-05-13T00:42:26Z","snapshot_observed_at":"2026-07-06T21:44:32.853406Z","submitted_at":"2025-06-19T01:38:13Z","title":"ViTacFormer: Learning Cross-Modal Representation for Visuo-Tactile Dexterous Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.15953","snapshot_observed_at":"2026-08-02T18:13:08.352641Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.14604","last_updated":"2026-07-15T00:55:50Z","snapshot_observed_at":"2026-08-07T00:53:09.787457Z","submitted_at":"2026-03-15T20:57:51Z","title":"Tactile Modality Fusion for Vision-Language-Action Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T18:13:08.352641Z"},"links":{"cited_paper":"/paper/2506.15953","citing_paper":"/paper/2603.14604"},"observation_digest":"sha256:008e9b9a781abaeb84a1231d15b63d1ed3dc97f25390464c65943b7026656327","observation_id":"de5deb5a-7550-405d-b329-55a59f165636","resolution":{"observed_at":"2026-08-02T18:13:08.352641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24090","last_updated":"2024-10-31T16:22:23Z","snapshot_observed_at":"2026-08-09T03:48:32.028282Z","submitted_at":"2024-10-31T16:22:23Z","title":"Sparsh: Self-supervised touch representations for vision-based tactile sensing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24090","snapshot_observed_at":"2026-08-02T18:13:08.412026Z","title":"arXiv preprint arXiv:2410.24090 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.14604","last_updated":"2026-07-15T00:55:50Z","snapshot_observed_at":"2026-08-07T00:53:09.787457Z","submitted_at":"2026-03-15T20:57:51Z","title":"Tactile Modality Fusion for Vision-Language-Action Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T18:13:08.412026Z"},"links":{"cited_paper":"/paper/2410.24090","citing_paper":"/paper/2603.14604"},"observation_digest":"sha256:39ba0ff86d3dc3b5b3b970aa77b3ff89025e0599f956f280aa11c0ccdffc9066","observation_id":"c27e80c4-4980-4c2b-bb94-7182c26d975e","resolution":{"observed_at":"2026-08-02T18:13:08.412026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:13:08.454187Z","title":"In: 2018 IEEE/RSJ In- ternational Conference on Intelligent Robots and Systems (IROS)","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2603.14604","last_updated":"2026-07-15T00:55:50Z","snapshot_observed_at":"2026-08-07T00:53:09.787457Z","submitted_at":"2026-03-15T20:57:51Z","title":"Tactile Modality Fusion for Vision-Language-Action Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T18:13:08.454187Z"},"links":{"citing_paper":"/paper/2603.14604"},"observation_digest":"sha256:26af7c313bcd90507e244dabb1cb3e4ab9513cf4206768fa3fac16728574255f","observation_id":"4db7c627-f0c7-497c-88d6-25d77d59c1bf","resolution":{"observed_at":"2026-08-02T18:13:08.454187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:13:08.505791Z","title":"In: Proceedings of the IEEE/CVF winter conference on applications of computer vision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.14604","last_updated":"2026-07-15T00:55:50Z","snapshot_observed_at":"2026-08-07T00:53:09.787457Z","submitted_at":"2026-03-15T20:57:51Z","title":"Tactile Modality Fusion for Vision-Language-Action Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T18:13:08.505791Z"},"links":{"citing_paper":"/paper/2603.14604"},"observation_digest":"sha256:2b363e8187cdc1d02ae47fc081421afe02c27459d8ca923ed420bad97f25ed0b","observation_id":"933b42ad-2553-4ba7-a0c6-3e80d15b7d35","resolution":{"observed_at":"2026-08-02T18:13:08.505791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:13:08.556229Z","title":"ICLR1(2), 3 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.14604","last_updated":"2026-07-15T00:55:50Z","snapshot_observed_at":"2026-08-07T00:53:09.787457Z","submitted_at":"2026-03-15T20:57:51Z","title":"Tactile Modality Fusion for Vision-Language-Action Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T18:13:08.556229Z"},"links":{"citing_paper":"/paper/2603.14604"},"observation_digest":"sha256:7cd001a341ebe92ad0d57521f9014562ad3cc9e6eab8068b3c4b9ccffa3e72c4","observation_id":"20551140-11a6-4b6a-ba0c-f5b874ae7c6a","resolution":{"observed_at":"2026-08-02T18:13:08.556229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.09160","last_updated":"2025-07-12T06:44:37Z","snapshot_observed_at":"2026-08-07T10:59:00.776993Z","submitted_at":"2025-07-12T06:44:37Z","title":"Tactile-VLA: Unlocking Vision-Language-Action Model's Physical Knowledge for Tactile Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.09160","snapshot_observed_at":"2026-08-02T18:13:08.634601Z","title":"arXiv preprint arXiv:2507.09160 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.14604","last_updated":"2026-07-15T00:55:50Z","snapshot_observed_at":"2026-08-07T00:53:09.787457Z","submitted_at":"2026-03-15T20:57:51Z","title":"Tactile Modality Fusion for Vision-Language-Action Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T18:13:08.634601Z"},"links":{"cited_paper":"/paper/2507.09160","citing_paper":"/paper/2603.14604"},"observation_digest":"sha256:1cb85ac0c641bf83875cd66f9ff5808848634979c410827684bf96a2fdeee7cd","observation_id":"04cdd81c-52e5-4a7b-86f1-4416e321dd33","resolution":{"observed_at":"2026-08-02T18:13:08.634601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-02T18:13:08.696040Z","title":"arXiv preprint arXiv:2504.16054 (2025) TacFiLM 17","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.14604","last_updated":"2026-07-15T00:55:50Z","snapshot_observed_at":"2026-08-07T00:53:09.787457Z","submitted_at":"2026-03-15T20:57:51Z","title":"Tactile Modality Fusion for Vision-Language-Action Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T18:13:08.696040Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2603.14604"},"observation_digest":"sha256:69f7f43ef748a997a71547ba99cce2c001dd0b3a84c8e6fb38f6cd2e9de92ced","observation_id":"127b1add-ce06-4fdf-8957-37e9218ef891","resolution":{"observed_at":"2026-08-02T18:13:08.696040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:13:08.777067Z","title":"In: International conference on machine learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.14604","last_updated":"2026-07-15T00:55:50Z","snapshot_observed_at":"2026-08-07T00:53:09.787457Z","submitted_at":"2026-03-15T20:57:51Z","title":"Tactile Modality Fusion for Vision-Language-Action Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T18:13:08.777067Z"},"links":{"citing_paper":"/paper/2603.14604"},"observation_digest":"sha256:aed205e2047dd41fd2e49cc3cef824ba2a1da2876328cf55083d62a931fabf84","observation_id":"1adf34a0-24c3-4c6b-880c-682db1f84b72","resolution":{"observed_at":"2026-08-02T18:13:08.777067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:13:08.846773Z","title":"Nature Reviews Neuroscience10(5), 345–359 (2009)","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2603.14604","last_updated":"2026-07-15T00:55:50Z","snapshot_observed_at":"2026-08-07T00:53:09.787457Z","submitted_at":"2026-03-15T20:57:51Z","title":"Tactile Modality Fusion for Vision-Language-Action Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T18:13:08.846773Z"},"links":{"citing_paper":"/paper/2603.14604"},"observation_digest":"sha256:eaaff1df7f9ec59629766bb053d0ef9c3992145947f9e0b692e7a77af0053e8f","observation_id":"041d3044-be7e-492a-b04e-8447821c8e84","resolution":{"observed_at":"2026-08-02T18:13:08.846773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04693","last_updated":"2025-01-14T22:28:39Z","snapshot_observed_at":"2026-08-06T05:51:59.730600Z","submitted_at":"2025-01-08T18:57:33Z","title":"Beyond Sight: Finetuning Generalist Robot Policies with Heterogeneous Sensors via Language Grounding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04693","snapshot_observed_at":"2026-08-02T18:13:08.910882Z","title":"arXiv preprint arXiv:2501.04693 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.14604","last_updated":"2026-07-15T00:55:50Z","snapshot_observed_at":"2026-08-07T00:53:09.787457Z","submitted_at":"2026-03-15T20:57:51Z","title":"Tactile Modality Fusion for Vision-Language-Action Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T18:13:08.910882Z"},"links":{"cited_paper":"/paper/2501.04693","citing_paper":"/paper/2603.14604"},"observation_digest":"sha256:b1cb5db6a30357326498ff31e99acf385fd06b6bb072ca3a8f6b19905dee4585","observation_id":"d3cb7da0-d8c5-4875-b423-34306bcb00d1","resolution":{"observed_at":"2026-08-02T18:13:08.910882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.12766","last_updated":"2023-02-24T17:29:31Z","snapshot_observed_at":"2026-08-09T00:25:43.898202Z","submitted_at":"2023-02-24T17:29:31Z","title":"Language-Driven Representation Learning for Robotics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.12766","snapshot_observed_at":"2026-08-02T18:13:09.022758Z","title":"arXiv preprint arXiv:2302.12766 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.14604","last_updated":"2026-07-15T00:55:50Z","snapshot_observed_at":"2026-08-07T00:53:09.787457Z","submitted_at":"2026-03-15T20:57:51Z","title":"Tactile Modality Fusion for Vision-Language-Action Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T18:13:09.022758Z"},"links":{"cited_paper":"/paper/2302.12766","citing_paper":"/paper/2603.14604"},"observation_digest":"sha256:ef7d6c68901f6078e74d059a5d91a4c5516ce4deebfec478170c803ce82939aa","observation_id":"34f57c71-facf-489c-be05-ae940a3238bd","resolution":{"observed_at":"2026-08-02T18:13:09.022758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19645","last_updated":"2025-04-28T07:49:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-27T00:30:29Z","title":"Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19645","snapshot_observed_at":"2026-08-02T18:13:09.098895Z","title":"arXiv preprint arXiv:2502.19645 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.14604","last_updated":"2026-07-15T00:55:50Z","snapshot_observed_at":"2026-08-07T00:53:09.787457Z","submitted_at":"2026-03-15T20:57:51Z","title":"Tactile Modality Fusion for Vision-Language-Action Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T18:13:09.098895Z"},"links":{"cited_paper":"/paper/2502.19645","citing_paper":"/paper/2603.14604"},"observation_digest":"sha256:f39f43904563e609762c5f460a2cb3dd91166373208ed9721762772617128420","observation_id":"76d7649f-3af9-4056-b086-8dd32e1b7076","resolution":{"observed_at":"2026-08-02T18:13:09.098895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-02T18:13:09.169219Z","title":"arXiv preprint arXiv:2406.09246 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.14604","last_updated":"2026-07-15T00:55:50Z","snapshot_observed_at":"2026-08-07T00:53:09.787457Z","submitted_at":"2026-03-15T20:57:51Z","title":"Tactile Modality Fusion for Vision-Language-Action Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T18:13:09.169219Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2603.14604"},"observation_digest":"sha256:c8d4ad444fdcf13b548dc4dad0043aa954d8f856d6817487526e30ea868a0201","observation_id":"c7443929-eb81-4f5c-bad4-79ebc5fbb9c8","resolution":{"observed_at":"2026-08-02T18:13:09.169219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:13:09.212647Z","title":"IEEE Robotics and Automation Letters5(3), 3838–3845 (2020)","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2603.14604","last_updated":"2026-07-15T00:55:50Z","snapshot_observed_at":"2026-08-07T00:53:09.787457Z","submitted_at":"2026-03-15T20:57:51Z","title":"Tactile Modality Fusion for Vision-Language-Action Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T18:13:09.212647Z"},"links":{"citing_paper":"/paper/2603.14604"},"observation_digest":"sha256:9d33c6a82ae00f787d7748af098432da281d55f1baeca35203fd017255af837b","observation_id":"3f311d55-be2e-43a4-b03e-765903f3ed45","resolution":{"observed_at":"2026-08-02T18:13:09.212647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:13:09.322227Z","title":"In: 2019 International conference on robotics and automation (ICRA)","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2603.14604","last_updated":"2026-07-15T00:55:50Z","snapshot_observed_at":"2026-08-07T00:53:09.787457Z","submitted_at":"2026-03-15T20:57:51Z","title":"Tactile Modality Fusion for Vision-Language-Action Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T18:13:09.322227Z"},"links":{"citing_paper":"/paper/2603.14604"},"observation_digest":"sha256:e282a93145436000b5cf06d619202f18b03ead1e57d0515cbce5830cc03400c1","observation_id":"505a6ee5-60e7-4206-b5af-6c97a5288192","resolution":{"observed_at":"2026-08-02T18:13:09.322227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:13:09.368990Z","title":"In: 2025 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.14604","last_updated":"2026-07-15T00:55:50Z","snapshot_observed_at":"2026-08-07T00:53:09.787457Z","submitted_at":"2026-03-15T20:57:51Z","title":"Tactile Modality Fusion for Vision-Language-Action Models","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T18:13:09.368990Z"},"links":{"citing_paper":"/paper/2603.14604"},"observation_digest":"sha256:4616a864b78c36857b455e7aed5f488794d025507d20fbd66d7423402f257cf7","observation_id":"e1797b32-a9b0-4844-9166-8f8ab2585014","resolution":{"observed_at":"2026-08-02T18:13:09.368990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:13:09.424325Z","title":"In: International conference on machine learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.14604","last_updated":"2026-07-15T00:55:50Z","snapshot_observed_at":"2026-08-07T00:53:09.787457Z","submitted_at":"2026-03-15T20:57:51Z","title":"Tactile Modality Fusion for Vision-Language-Action Models","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T18:13:09.424325Z"},"links":{"citing_paper":"/paper/2603.14604"},"observation_digest":"sha256:31623da8ff0c5d2836aef16dd3f1a4f86113b65024de55b9613bf336a75f0409","observation_id":"aeb7f255-83c4-430a-b637-2e73ad2c1088","resolution":{"observed_at":"2026-08-02T18:13:09.424325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:13:09.478304Z","title":"In: International confer- ence on machine learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.14604","last_updated":"2026-07-15T00:55:50Z","snapshot_observed_at":"2026-08-07T00:53:09.787457Z","submitted_at":"2026-03-15T20:57:51Z","title":"Tactile Modality Fusion for Vision-Language-Action Models","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-02T18:13:09.478304Z"},"links":{"citing_paper":"/paper/2603.14604"},"observation_digest":"sha256:9c7082605b9c5555c4450f94dfede9a178254373b0ac484f0c4238fbf0f1eeef","observation_id":"adce82ed-f6e7-4a26-ba11-fa37f4645376","resolution":{"observed_at":"2026-08-02T18:13:09.478304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.08194","last_updated":"2025-05-13T03:02:36Z","snapshot_observed_at":"2026-08-08T00:41:05.590869Z","submitted_at":"2025-05-13T03:02:36Z","title":"CLTP: Contrastive Language-Tactile Pre-training for 3D Contact Geometry Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.08194","snapshot_observed_at":"2026-08-02T18:13:09.529978Z","title":"arXiv preprint arXiv:2505.08194 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.14604","last_updated":"2026-07-15T00:55:50Z","snapshot_observed_at":"2026-08-07T00:53:09.787457Z","submitted_at":"2026-03-15T20:57:51Z","title":"Tactile Modality Fusion for Vision-Language-Action Models","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T18:13:09.529978Z"},"links":{"cited_paper":"/paper/2505.08194","citing_paper":"/paper/2603.14604"},"observation_digest":"sha256:7fadea9a932baf4e486fd3740e82c1823246a1f8cc7304f28b412aa600efb4f7","observation_id":"e1caae98-d953-426b-ba1d-31ed564e9643","resolution":{"observed_at":"2026-08-02T18:13:09.529978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.12601","last_updated":"2022-11-18T05:57:09Z","snapshot_observed_at":"2026-08-02T11:48:59.131827Z","submitted_at":"2022-03-23T17:55:09Z","title":"R3M: A Universal Visual Representation for Robot Manipulation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.12601","snapshot_observed_at":"2026-08-02T18:13:09.607919Z","title":"arXiv preprint arXiv:2203.12601 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.14604","last_updated":"2026-07-15T00:55:50Z","snapshot_observed_at":"2026-08-07T00:53:09.787457Z","submitted_at":"2026-03-15T20:57:51Z","title":"Tactile Modality Fusion for Vision-Language-Action Models","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T18:13:09.607919Z"},"links":{"cited_paper":"/paper/2203.12601","citing_paper":"/paper/2603.14604"},"observation_digest":"sha256:9c357a6b002b4d5885d8eb3a77ea15d92d7e0ccfd287965b1141c59b9129a4bb","observation_id":"7de51efb-8644-4f82-98cf-575084e215bd","resolution":{"observed_at":"2026-08-02T18:13:09.607919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-09T18:02:17.307812Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-02T18:13:09.675980Z","title":"arXiv preprint arXiv:2304.07193 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.14604","last_updated":"2026-07-15T00:55:50Z","snapshot_observed_at":"2026-08-07T00:53:09.787457Z","submitted_at":"2026-03-15T20:57:51Z","title":"Tactile Modality Fusion for Vision-Language-Action Models","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-02T18:13:09.675980Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2603.14604"},"observation_digest":"sha256:b05a6e67fe147605bf355102a402fc2ea964f68e34451d6c430da1d286591c36","observation_id":"c829cf96-cb03-4e4f-968a-95c9367961b9","resolution":{"observed_at":"2026-08-02T18:13:09.675980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:13:09.717918Z","title":"In: 2024 IEEE International Conference on Robotics and Automation (ICRA)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.14604","last_updated":"2026-07-15T00:55:50Z","snapshot_observed_at":"2026-08-07T00:53:09.787457Z","submitted_at":"2026-03-15T20:57:51Z","title":"Tactile Modality Fusion for Vision-Language-Action Models","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-02T18:13:09.717918Z"},"links":{"citing_paper":"/paper/2603.14604"},"observation_digest":"sha256:41d69838d12f086901551b88f475905bac4bacca986a3f05497cae6dec412905","observation_id":"3c76438d-3963-47ce-ad6d-b0004ecab254","resolution":{"observed_at":"2026-08-02T18:13:09.717918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:13:09.792802Z","title":"In: Proceedings of the AAAI conference on artificial intelligence","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2603.14604","last_updated":"2026-07-15T00:55:50Z","snapshot_observed_at":"2026-08-07T00:53:09.787457Z","submitted_at":"2026-03-15T20:57:51Z","title":"Tactile Modality Fusion for Vision-Language-Action Models","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-02T18:13:09.792802Z"},"links":{"citing_paper":"/paper/2603.14604"},"observation_digest":"sha256:215955030f0ede7296f96b9db803f3d706795c24c5033dd9b7309e270d38f602","observation_id":"ef69fd43-3cac-4706-ad83-9d06de5c1209","resolution":{"observed_at":"2026-08-02T18:13:09.792802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:13:09.848489Z","title":"In: Conference on Robot Learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.14604","last_updated":"2026-07-15T00:55:50Z","snapshot_observed_at":"2026-08-07T00:53:09.787457Z","submitted_at":"2026-03-15T20:57:51Z","title":"Tactile Modality Fusion for Vision-Language-Action Models","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-02T18:13:09.848489Z"},"links":{"citing_paper":"/paper/2603.14604"},"observation_digest":"sha256:20faaeb61d250f9dbe9e5a1d83a6fe9c2060005db3dbbbba1d41018a5471bdd6","observation_id":"ded66399-8092-45b5-a5d4-5ab58bd745db","resolution":{"observed_at":"2026-08-02T18:13:09.848489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:13:09.905181Z","title":"In: International conference on machine learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.14604","last_updated":"2026-07-15T00:55:50Z","snapshot_observed_at":"2026-08-07T00:53:09.787457Z","submitted_at":"2026-03-15T20:57:51Z","title":"Tactile Modality Fusion for Vision-Language-Action Models","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-02T18:13:09.905181Z"},"links":{"citing_paper":"/paper/2603.14604"},"observation_digest":"sha256:186c660cd727837c2ae56b490a95255c63f43862774c5eea2cac7af6a82f19a6","observation_id":"2aa15305-7c81-4620-9cb7-c4fd8e002897","resolution":{"observed_at":"2026-08-02T18:13:09.905181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:13:09.965173Z","title":"In: Conference on robot learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.14604","last_updated":"2026-07-15T00:55:50Z","snapshot_observed_at":"2026-08-07T00:53:09.787457Z","submitted_at":"2026-03-15T20:57:51Z","title":"Tactile Modality Fusion for Vision-Language-Action Models","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-02T18:13:09.965173Z"},"links":{"citing_paper":"/paper/2603.14604"},"observation_digest":"sha256:c2a2710a85d15d8bc18f80a3ffc990a77723a368730c4f56b760b806785d5115","observation_id":"c63c0463-486f-4d07-afe8-796d0b118edf","resolution":{"observed_at":"2026-08-02T18:13:09.965173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16851","last_updated":"2024-10-04T01:58:06Z","snapshot_observed_at":"2026-07-06T18:36:12.298104Z","submitted_at":"2024-06-24T17:58:03Z","title":"Losing Visual Needles in Image Haystacks: Vision Language Models are Easily Distracted in Short and Long Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16851","snapshot_observed_at":"2026-08-02T18:13:10.024015Z","title":"arXiv preprint arXiv:2406.16851 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.14604","last_updated":"2026-07-15T00:55:50Z","snapshot_observed_at":"2026-08-07T00:53:09.787457Z","submitted_at":"2026-03-15T20:57:51Z","title":"Tactile Modality Fusion for Vision-Language-Action Models","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-02T18:13:10.024015Z"},"links":{"cited_paper":"/paper/2406.16851","citing_paper":"/paper/2603.14604"},"observation_digest":"sha256:2152b5fe2be86bf47c9bea610c394ffbb782d085e4ca4dc969c5f5ce0c293209","observation_id":"23669dcf-f178-4663-8333-323d850e7a7f","resolution":{"observed_at":"2026-08-02T18:13:10.024015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:13:10.082001Z","title":"The International Journal of Robotics Research40(12-14), 1385–1401 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.14604","last_updated":"2026-07-15T00:55:50Z","snapshot_observed_at":"2026-08-07T00:53:09.787457Z","submitted_at":"2026-03-15T20:57:51Z","title":"Tactile Modality Fusion for Vision-Language-Action Models","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-02T18:13:10.082001Z"},"links":{"citing_paper":"/paper/2603.14604"},"observation_digest":"sha256:3279511446936838bbca2e9f54102d4a1234b924bc04814cda70d41a9fddbc6c","observation_id":"32ac22bf-acff-4cc6-9a9a-592459ba4bbf","resolution":{"observed_at":"2026-08-02T18:13:10.082001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:13:10.157420Z","title":"In: Conference on robot learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.14604","last_updated":"2026-07-15T00:55:50Z","snapshot_observed_at":"2026-08-07T00:53:09.787457Z","submitted_at":"2026-03-15T20:57:51Z","title":"Tactile Modality Fusion for Vision-Language-Action Models","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-02T18:13:10.157420Z"},"links":{"citing_paper":"/paper/2603.14604"},"observation_digest":"sha256:7dcbe6d8bcb7ced39862a01198f3d4b190a8e7504ebf07ebc9e0db0ae45c73ba","observation_id":"885c24c1-a978-40be-85e0-aee70ce2b7bd","resolution":{"observed_at":"2026-08-02T18:13:10.157420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00905","last_updated":"2023-10-25T21:45:24Z","snapshot_observed_at":"2026-07-06T14:57:35.878347Z","submitted_at":"2023-03-02T01:55:10Z","title":"Open-World Object Manipulation using Pre-trained Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00905","snapshot_observed_at":"2026-08-02T18:13:10.246106Z","title":"arXiv preprint arXiv:2303.00905 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.14604","last_updated":"2026-07-15T00:55:50Z","snapshot_observed_at":"2026-08-07T00:53:09.787457Z","submitted_at":"2026-03-15T20:57:51Z","title":"Tactile Modality Fusion for Vision-Language-Action Models","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-02T18:13:10.246106Z"},"links":{"cited_paper":"/paper/2303.00905","citing_paper":"/paper/2603.14604"},"observation_digest":"sha256:96142dfea4dd21efd5bd1500dfe62352165803dc325ccc259c95de46689a3424","observation_id":"c80735aa-51fb-49ea-b4f0-a69e76cfb67e","resolution":{"observed_at":"2026-08-02T18:13:10.246106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12213","last_updated":"2024-05-26T19:55:26Z","snapshot_observed_at":"2026-07-06T18:16:51.116432Z","submitted_at":"2024-05-20T17:57:01Z","title":"Octo: An Open-Source Generalist Robot Policy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12213","snapshot_observed_at":"2026-08-02T18:13:10.319568Z","title":"arXiv preprint arXiv:2405.12213 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.14604","last_updated":"2026-07-15T00:55:50Z","snapshot_observed_at":"2026-08-07T00:53:09.787457Z","submitted_at":"2026-03-15T20:57:51Z","title":"Tactile Modality Fusion for Vision-Language-Action Models","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-02T18:13:10.319568Z"},"links":{"cited_paper":"/paper/2405.12213","citing_paper":"/paper/2603.14604"},"observation_digest":"sha256:c10b47e98572bf19e4518d7c9ef9244b6e23431a61e58dc24833010fe6f6421b","observation_id":"24cd187c-f8b5-4314-be61-a802fb0bf898","resolution":{"observed_at":"2026-08-02T18:13:10.319568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-02T18:13:10.399210Z","title":"arxiv 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.14604","last_updated":"2026-07-15T00:55:50Z","snapshot_observed_at":"2026-08-07T00:53:09.787457Z","submitted_at":"2026-03-15T20:57:51Z","title":"Tactile Modality Fusion for Vision-Language-Action Models","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-02T18:13:10.399210Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2603.14604"},"observation_digest":"sha256:7b83b14ccd9cdfe79a233a7b56c5380c6be512db6023a45cefd07f4fb2e0771f","observation_id":"d0b97498-a348-4d1e-8dfd-732af6bfa9c4","resolution":{"observed_at":"2026-08-02T18:13:10.399210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-02T18:13:10.481317Z","title":"arXiv preprint arXiv:2307.09288 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.14604","last_updated":"2026-07-15T00:55:50Z","snapshot_observed_at":"2026-08-07T00:53:09.787457Z","submitted_at":"2026-03-15T20:57:51Z","title":"Tactile Modality Fusion for Vision-Language-Action Models","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-02T18:13:10.481317Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2603.14604"},"observation_digest":"sha256:ec914fc572620b58ff6bd04e0f338017e051563327e428fb83650c77a0f138cc","observation_id":"57bb3016-a743-42e1-8178-cbc91e5f8ba8","resolution":{"observed_at":"2026-08-02T18:13:10.481317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:13:10.537110Z","title":"Advances in neural information pro- cessing systems30(2017)","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2603.14604","last_updated":"2026-07-15T00:55:50Z","snapshot_observed_at":"2026-08-07T00:53:09.787457Z","submitted_at":"2026-03-15T20:57:51Z","title":"Tactile Modality Fusion for Vision-Language-Action Models","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-02T18:13:10.537110Z"},"links":{"citing_paper":"/paper/2603.14604"},"observation_digest":"sha256:aafb871ff765806ffe3cd751c8c16a5d9708564ffc044ea5e6a16de2d9e93686","observation_id":"eb60596a-a6a9-4b1a-ab2e-be93d1c0dcd0","resolution":{"observed_at":"2026-08-02T18:13:10.537110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:13:10.593287Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.14604","last_updated":"2026-07-15T00:55:50Z","snapshot_observed_at":"2026-08-07T00:53:09.787457Z","submitted_at":"2026-03-15T20:57:51Z","title":"Tactile Modality Fusion for Vision-Language-Action Models","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-02T18:13:10.593287Z"},"links":{"citing_paper":"/paper/2603.14604"},"observation_digest":"sha256:15f70909ea27338ec33c869efdd18a5c1d3f5450e75904094499710c01aa1c75","observation_id":"654216c6-3e0d-420a-8b21-d7a05231b02e","resolution":{"observed_at":"2026-08-02T18:13:10.593287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:13:10.648350Z","title":"Advances in neural information processing systems35, 24824–24837 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.14604","last_updated":"2026-07-15T00:55:50Z","snapshot_observed_at":"2026-08-07T00:53:09.787457Z","submitted_at":"2026-03-15T20:57:51Z","title":"Tactile Modality Fusion for Vision-Language-Action Models","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-02T18:13:10.648350Z"},"links":{"citing_paper":"/paper/2603.14604"},"observation_digest":"sha256:a13ddadf3ae22c0f647e46470aadcaa68584bf8e4d3f26814a2cead54f45b947","observation_id":"805b1cfa-eb08-4b7b-ad36-2e07087fa9bf","resolution":{"observed_at":"2026-08-02T18:13:10.648350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.11765","last_updated":"2023-03-21T11:36:37Z","snapshot_observed_at":"2026-08-07T20:28:06.300901Z","submitted_at":"2023-03-21T11:36:37Z","title":"Cable Routing and Assembly using Tactile-driven Motion Primitives","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.11765","snapshot_observed_at":"2026-08-02T18:13:10.690047Z","title":"arXiv preprint arXiv:2303.11765 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.14604","last_updated":"2026-07-15T00:55:50Z","snapshot_observed_at":"2026-08-07T00:53:09.787457Z","submitted_at":"2026-03-15T20:57:51Z","title":"Tactile Modality Fusion for Vision-Language-Action Models","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-02T18:13:10.690047Z"},"links":{"cited_paper":"/paper/2303.11765","citing_paper":"/paper/2603.14604"},"observation_digest":"sha256:0fad96c8135d8a128a5a58cffef635da764fc3892df0b04533aac9f88719817e","observation_id":"f905c60a-f98b-4f24-b296-8c46a576bc4d","resolution":{"observed_at":"2026-08-02T18:13:10.690047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:13:10.771971Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.14604","last_updated":"2026-07-15T00:55:50Z","snapshot_observed_at":"2026-08-07T00:53:09.787457Z","submitted_at":"2026-03-15T20:57:51Z","title":"Tactile Modality Fusion for Vision-Language-Action Models","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-02T18:13:10.771971Z"},"links":{"citing_paper":"/paper/2603.14604"},"observation_digest":"sha256:f5f493dc06f2b1326a776fba4005e6e855b74359f1c86b136a132717a7582154","observation_id":"007e1999-317f-4737-ba4e-bc7ac70bc2dd","resolution":{"observed_at":"2026-08-02T18:13:10.771971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:13:10.837649Z","title":"arXiv preprint arXiv:2505.22159 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.14604","last_updated":"2026-07-15T00:55:50Z","snapshot_observed_at":"2026-08-07T00:53:09.787457Z","submitted_at":"2026-03-15T20:57:51Z","title":"Tactile Modality Fusion for Vision-Language-Action Models","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-02T18:13:10.837649Z"},"links":{"citing_paper":"/paper/2603.14604"},"observation_digest":"sha256:01bd97192b14d1f84aeeaeaf7783cb30ce8edb6ab455cfa4b98dafe8b1d62b52","observation_id":"efc1d857-1338-4e96-8a43-541ab4f035da","resolution":{"observed_at":"2026-08-02T18:13:10.837649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.02794","last_updated":"2024-06-05T01:40:36Z","snapshot_observed_at":"2026-08-07T22:53:14.214309Z","submitted_at":"2024-05-05T02:22:11Z","title":"Octopi: Object Property Reasoning with Large Tactile-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.02794","snapshot_observed_at":"2026-08-02T18:13:10.937804Z","title":"arXiv preprint arXiv:2405.02794 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.14604","last_updated":"2026-07-15T00:55:50Z","snapshot_observed_at":"2026-08-07T00:53:09.787457Z","submitted_at":"2026-03-15T20:57:51Z","title":"Tactile Modality Fusion for Vision-Language-Action Models","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-02T18:13:10.937804Z"},"links":{"cited_paper":"/paper/2405.02794","citing_paper":"/paper/2603.14604"},"observation_digest":"sha256:a97821d76a2162aa066cc576d996f63e29a2cd97568199c35797275428576749","observation_id":"70506059-6dd4-423e-8a34-b5902ce5266e","resolution":{"observed_at":"2026-08-02T18:13:10.937804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:13:11.043398Z","title":"Sensors17(12), 2762 (2017)","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2603.14604","last_updated":"2026-07-15T00:55:50Z","snapshot_observed_at":"2026-08-07T00:53:09.787457Z","submitted_at":"2026-03-15T20:57:51Z","title":"Tactile Modality Fusion for Vision-Language-Action Models","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-02T18:13:11.043398Z"},"links":{"citing_paper":"/paper/2603.14604"},"observation_digest":"sha256:d4aa64995b3eadf0a43b7fdf5343c54e184ce050769285f8e56f0b2862eb37a7","observation_id":"45bb2ade-7cf6-41e8-9b86-28f9a6eb6a40","resolution":{"observed_at":"2026-08-02T18:13:11.043398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:13:11.147689Z","title":"In: 2024 IEEE International Conference on Robotics and Automation (ICRA)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.14604","last_updated":"2026-07-15T00:55:50Z","snapshot_observed_at":"2026-08-07T00:53:09.787457Z","submitted_at":"2026-03-15T20:57:51Z","title":"Tactile Modality Fusion for Vision-Language-Action Models","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-02T18:13:11.147689Z"},"links":{"citing_paper":"/paper/2603.14604"},"observation_digest":"sha256:48cc16b7fcc83f1db91dc25fafe5f17bdaa7a1cc3166a552d4626c2321847d2c","observation_id":"160e4104-c656-4a46-a88b-1743004779b9","resolution":{"observed_at":"2026-08-02T18:13:11.147689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:13:11.249555Z","title":"In: Proceedings of the IEEE/CVF international conference on computer vision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.14604","last_updated":"2026-07-15T00:55:50Z","snapshot_observed_at":"2026-08-07T00:53:09.787457Z","submitted_at":"2026-03-15T20:57:51Z","title":"Tactile Modality Fusion for Vision-Language-Action Models","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-02T18:13:11.249555Z"},"links":{"citing_paper":"/paper/2603.14604"},"observation_digest":"sha256:226dc3465496714947c5c3b4956cc25038892a4a5f6de104ce5e52f280a9bef4","observation_id":"8dc72ecf-bcf6-4563-9508-354e09bf5898","resolution":{"observed_at":"2026-08-02T18:13:11.249555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09577","last_updated":"2025-05-14T17:29:35Z","snapshot_observed_at":"2026-08-10T12:12:15.878721Z","submitted_at":"2025-05-14T17:29:35Z","title":"VTLA: Vision-Tactile-Language-Action Model with Preference Learning for Insertion Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09577","snapshot_observed_at":"2026-08-02T18:13:11.413729Z","title":"arXiv preprint arXiv:2505.09577 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.14604","last_updated":"2026-07-15T00:55:50Z","snapshot_observed_at":"2026-08-07T00:53:09.787457Z","submitted_at":"2026-03-15T20:57:51Z","title":"Tactile Modality Fusion for Vision-Language-Action Models","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-02T18:13:11.413729Z"},"links":{"cited_paper":"/paper/2505.09577","citing_paper":"/paper/2603.14604"},"observation_digest":"sha256:4e2b63f3ef2c42dc4cb3350256a947a6466574ceb419ee2762d43dd74926b9c9","observation_id":"54ebce5b-3ef5-44da-bbed-05a604582b7d","resolution":{"observed_at":"2026-08-02T18:13:11.413729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08587","last_updated":"2023-06-19T22:28:02Z","snapshot_observed_at":"2026-08-09T05:05:53.679079Z","submitted_at":"2023-04-17T20:07:24Z","title":"Grounding Classical Task Planners via Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08587","snapshot_observed_at":"2026-08-02T18:13:11.550160Z","title":"arXiv preprint arXiv:2304.08587 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.14604","last_updated":"2026-07-15T00:55:50Z","snapshot_observed_at":"2026-08-07T00:53:09.787457Z","submitted_at":"2026-03-15T20:57:51Z","title":"Tactile Modality Fusion for Vision-Language-Action Models","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-02T18:13:11.550160Z"},"links":{"cited_paper":"/paper/2304.08587","citing_paper":"/paper/2603.14604"},"observation_digest":"sha256:975c330bdb575890e700b7258f5da3594276e0e2aa3e7637f500b4590d3929f0","observation_id":"274813c4-d68f-485c-86d6-adaa706c12bd","resolution":{"observed_at":"2026-08-02T18:13:11.550160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.20239","last_updated":"2026-05-13T12:53:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-28T04:22:47Z","title":"TouchGuide: Inference-Time Steering of Visuomotor Policies via Touch Guidance","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.20239","snapshot_observed_at":"2026-08-02T18:13:11.618026Z","title":"arXiv preprint arXiv:2601.20239 (2026)","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2603.14604","last_updated":"2026-07-15T00:55:50Z","snapshot_observed_at":"2026-08-07T00:53:09.787457Z","submitted_at":"2026-03-15T20:57:51Z","title":"Tactile Modality Fusion for Vision-Language-Action Models","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-02T18:13:11.618026Z"},"links":{"cited_paper":"/paper/2601.20239","citing_paper":"/paper/2603.14604"},"observation_digest":"sha256:df27f1d51959f1ca631b9a128f517849c0ad6f23c347bbc4d8e172ea62d02892","observation_id":"56ea649e-b5ae-4847-b257-295bb132218d","resolution":{"observed_at":"2026-08-02T18:13:11.618026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:13:11.776055Z","title":"In: 2025 IEEE International Conference on Robotics and Automation (ICRA)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.14604","last_updated":"2026-07-15T00:55:50Z","snapshot_observed_at":"2026-08-07T00:53:09.787457Z","submitted_at":"2026-03-15T20:57:51Z","title":"Tactile Modality Fusion for Vision-Language-Action Models","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-02T18:13:11.776055Z"},"links":{"citing_paper":"/paper/2603.14604"},"observation_digest":"sha256:ae84c324c0b9f52268a30a10b2c1e1615b4a07ba16008852a94e74dfe81201d8","observation_id":"e685ac13-732c-4348-8399-c7fb9c1e5eb4","resolution":{"observed_at":"2026-08-02T18:13:11.776055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.13640","last_updated":"2024-10-06T16:02:15Z","snapshot_observed_at":"2026-07-06T18:33:45.816337Z","submitted_at":"2024-06-19T15:39:27Z","title":"Transferable Tactile Transformers for Representation Learning Across Diverse Sensors and Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.13640","snapshot_observed_at":"2026-08-02T18:13:11.893666Z","title":"arXiv preprint arXiv:2406.13640 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.14604","last_updated":"2026-07-15T00:55:50Z","snapshot_observed_at":"2026-08-07T00:53:09.787457Z","submitted_at":"2026-03-15T20:57:51Z","title":"Tactile Modality Fusion for Vision-Language-Action Models","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-02T18:13:11.893666Z"},"links":{"cited_paper":"/paper/2406.13640","citing_paper":"/paper/2603.14604"},"observation_digest":"sha256:b9314212bffe4b7848300e64053d8e416cccdb053d1e21f566ec2f785d2bffee","observation_id":"a4fc770a-4ea1-4e38-ae89-9b6867973401","resolution":{"observed_at":"2026-08-02T18:13:11.893666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:13:12.014696Z","title":"In: Conference on Robot Learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.14604","last_updated":"2026-07-15T00:55:50Z","snapshot_observed_at":"2026-08-07T00:53:09.787457Z","submitted_at":"2026-03-15T20:57:51Z","title":"Tactile Modality Fusion for Vision-Language-Action Models","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-02T18:13:12.014696Z"},"links":{"citing_paper":"/paper/2603.14604"},"observation_digest":"sha256:e305e2920b17ab2a99a2db6b1f32b4082ed546310893e956291aa7d55b6247da","observation_id":"60b0970f-0bc4-4100-9a3b-05a0391c5163","resolution":{"observed_at":"2026-08-02T18:13:12.014696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2603.14604","last_updated":"2026-07-15T00:55:50Z","latest_version":2,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-07T00:53:09.787457Z","submitted_at":"2026-03-15T20:57:51Z","title":"Tactile Modality Fusion for Vision-Language-Action Models"},"reference_resolution":{"displayed":73,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":73,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":73},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 73 of 73 outbound references and 3 inbound Pith citation observations for arXiv:2603.14604."}