{"as_of":"2026-08-14T08:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bc6da8a90fafd670a9a8a14db1669ad484e1833f4b25ffb422ae4996f620b422","coverage":[{"denominator":60,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":60,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:09:26.504997Z","state":"measured"},{"denominator":65,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":65,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T08:20:49.438388Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T10:05:40.612441Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-10T20:28:52.024760Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"cited_work":{"arxiv_id":"2505.22566","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22566","snapshot_observed_at":"2026-07-01T10:05:40.612441Z","title":"Universal visuo-tactile video understanding for embodied interaction","venue":null,"work_id":"4f581584-3b0b-4c83-a144-693f44d826c4","year":2025},"citing_paper":{"arxiv_id":"2604.24681","last_updated":"2026-05-21T05:08:13Z","snapshot_observed_at":"2026-08-02T19:33:59.938088Z","submitted_at":"2026-04-27T16:42:18Z","title":"Learning Human-Intention Priors from Large-Scale Human Demonstrations for Robotic Manipulation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-08T02:51:27.662262Z"},"links":{"cited_paper":"/paper/2505.22566","citing_paper":"/paper/2604.24681"},"observation_digest":"sha256:c62c1d8104b85f12c8a57b3cd80e6e8d56f9b79956e3f2e9f6bcee0c2cf2ac3d","observation_id":"742e49d2-d20c-4ff6-bfd8-ff1b8067ab7b","resolution":{"observed_at":"2026-05-11T22:26:11.718986Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-10T20:28:52.024760Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"cited_work":{"arxiv_id":"2505.22566","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22566","snapshot_observed_at":"2026-07-01T10:05:40.612441Z","title":"Universal visuo-tactile video understanding for embodied interaction","venue":null,"work_id":"4f581584-3b0b-4c83-a144-693f44d826c4","year":2025},"citing_paper":{"arxiv_id":"2604.24681","last_updated":"2026-05-21T05:08:13Z","snapshot_observed_at":"2026-08-02T19:33:59.938088Z","submitted_at":"2026-04-27T16:42:18Z","title":"Learning Human-Intention Priors from Large-Scale Human Demonstrations for Robotic Manipulation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-22T11:16:58.104663Z"},"links":{"cited_paper":"/paper/2505.22566","citing_paper":"/paper/2604.24681"},"observation_digest":"sha256:06e724c484f395addc29bfded876ce8c6c026ff0dd376f7ea68255e03b4bc9f5","observation_id":"38e50fb9-092a-48b4-b69d-ba9e2c9a760a","resolution":{"observed_at":"2026-05-22T11:21:29.117773Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-10T20:28:52.024760Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"cited_work":{"arxiv_id":"2505.22566","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22566","snapshot_observed_at":"2026-07-01T10:05:40.612441Z","title":"Universal visuo-tactile video understanding for embodied interaction","venue":null,"work_id":"4f581584-3b0b-4c83-a144-693f44d826c4","year":2025},"citing_paper":{"arxiv_id":"2605.17336","last_updated":"2026-05-17T09:09:30Z","snapshot_observed_at":"2026-08-14T02:44:45.006110Z","submitted_at":"2026-05-17T09:09:30Z","title":"Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-20T12:52:15.138790Z"},"links":{"cited_paper":"/paper/2505.22566","citing_paper":"/paper/2605.17336"},"observation_digest":"sha256:f2b844eda62cf3fdccff8879777a3bda1401fd062f02c12ffee1005a08762154","observation_id":"0fdca6f4-85a3-4da9-adb4-c103fec5f06d","resolution":{"observed_at":"2026-05-20T12:53:17.369400Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-10T20:28:52.024760Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"cited_work":{"arxiv_id":"2505.22566","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22566","snapshot_observed_at":"2026-07-01T10:05:40.612441Z","title":"Universal visuo-tactile video understanding for embodied interaction","venue":null,"work_id":"4f581584-3b0b-4c83-a144-693f44d826c4","year":2025},"citing_paper":{"arxiv_id":"2606.31451","last_updated":"2026-06-30T10:25:46Z","snapshot_observed_at":"2026-08-02T09:59:19.263812Z","submitted_at":"2026-06-30T10:25:46Z","title":"UniTac: A Unified Multimodal Model for Cross-Sensor Tactile Understanding and Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-01T05:56:03.597839Z"},"links":{"cited_paper":"/paper/2505.22566","citing_paper":"/paper/2606.31451"},"observation_digest":"sha256:a0eb9a485e99244495e2448f8442957943b16cfd7f65032e43e6cd42f5790173","observation_id":"34d78103-deb5-4e72-84f6-8f3bac3128f1","resolution":{"observed_at":"2026-07-01T10:05:40.614055Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-10T20:28:52.024760Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22566","snapshot_observed_at":"2026-07-11T08:20:49.438388Z","title":"Universal visuo-tactile video understanding for embodied interaction,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05131","last_updated":"2026-07-06T14:17:44Z","snapshot_observed_at":"2026-08-13T04:55:23.213083Z","submitted_at":"2026-07-06T14:17:44Z","title":"TacReasoner: A Dynamic Tactile-Language Framework for Interactive Reasoning in Real-World Scenarios","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-11T08:20:49.438388Z"},"links":{"cited_paper":"/paper/2505.22566","citing_paper":"/paper/2607.05131"},"observation_digest":"sha256:cbc6e883ca7ba21e7245fc886120dff94bc957a27999ee6298c7d39458ee8c8c","observation_id":"48f125a2-bfc2-4656-84fb-a1c77d22f31a","resolution":{"observed_at":"2026-07-11T08:20:49.438388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.22566/citation-record","integrity":"/paper/2505.22566/integrity","json":"/paper/2505.22566/citation-record.json","paper":"/paper/2505.22566"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:33.677045Z","title":"A review of tactile information: Perception and action through touch","venue":null,"work_id":"85b86674-f985-400f-9e25-de18a898dbcd","year":2020},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-10T20:28:52.024760Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:19.560774Z"},"links":{"citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:fa8bc61402359d7d50a32549cecae9f675cd4bdc2e59e6d5792e87d62416421c","observation_id":"43cfddc7-1d6d-41b0-af88-f4bf9e6f1ad5","resolution":{"observed_at":"2026-08-07T13:09:33.774596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:33.429952Z","title":"Task and material properties interac- tively affect softness explorations along different dimensions","venue":null,"work_id":"5f9d2525-a305-405b-ac81-c3f0b77bc248","year":2021},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-10T20:28:52.024760Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:19.672847Z"},"links":{"citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:bacd17af3cb654933943e2ddfcab10b23b1cadbef409310813443445786d0f07","observation_id":"fbfc6331-cc9d-439c-a6d0-4d4eab314da0","resolution":{"observed_at":"2026-08-07T13:09:33.547098Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:33.218144Z","title":"Predicting perceptual haptic attributes of textured surface from tactile data based on deep cnn-lstm network","venue":null,"work_id":"276acc66-7c03-4251-aba8-0319b5ad0e7e","year":2023},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-10T20:28:52.024760Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:19.825495Z"},"links":{"citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:2c4841762278c4a9478bab4d3537d3b773288a125a54913732772ddcf6d33d6c","observation_id":"8a8dadab-e645-4958-b1e7-f92336479787","resolution":{"observed_at":"2026-08-07T13:09:33.284124Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-07T13:09:19.929844Z","title":"Qwen technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-10T20:28:52.024760Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:19.929844Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:1e569ed96d7ee7baace6fd40f0bf1a914a348f72b4910fe77d0bd392a46b3602","observation_id":"c4f5cbb6-2d5b-4f5f-8785-90ec4adb4fd0","resolution":{"observed_at":"2026-08-07T13:09:19.929844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T13:09:20.070560Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-10T20:28:52.024760Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:20.070560Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:739f125b358bfeb026e5bd57b90cafe46d5e7f9ff88913d5bd0e3045a16c6845","observation_id":"0301aa58-7e92-46ab-8142-1e633397736b","resolution":{"observed_at":"2026-08-07T13:09:20.070560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:20.167450Z","title":"High- resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-10T20:28:52.024760Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:20.167450Z"},"links":{"citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:38f766a469ba4c8265b324de9d7b854d17621eb9c7e8d37a08568cdb70b0d1a4","observation_id":"2d442cf6-3280-4c99-8959-021be48de50b","resolution":{"observed_at":"2026-08-07T13:09:20.167450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:20.291420Z","title":"Spatialvlm: Endowing vision-language models with spatial reasoning capabilities","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-10T20:28:52.024760Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:20.291420Z"},"links":{"citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:6810eaea4458c7816cc5af9b08c10f91c8bd14848ea8bc06726c0af0ed15737a","observation_id":"98429ef1-db62-4cff-bb88-2344d067e4cb","resolution":{"observed_at":"2026-08-07T13:09:20.291420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.12198","last_updated":"2025-01-05T14:10:02Z","snapshot_observed_at":"2026-08-13T06:36:15.141813Z","submitted_at":"2024-11-19T03:30:06Z","title":"CCIS-Diff: A Generative Model with Stable Diffusion Prior for Controlled Colonoscopy Image Synthesis","version":2},"cited_work":{"arxiv_id":"2411.12198","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.12198","snapshot_observed_at":"2026-08-07T13:09:27.068801Z","title":"CCIS-Diff: A Generative Model with Stable Diffusion Prior for Controlled Colonoscopy Image Synthesis","venue":"cs.CV","work_id":"3a957890-0439-4290-a6ee-332dd68b38a0","year":2024},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-10T20:28:52.024760Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:20.431420Z"},"links":{"cited_paper":"/paper/2411.12198","citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:84938b80137bf96287dc5f9379d933554728b48f9a20cd0ac3eb121b9f531fa3","observation_id":"e1106966-9d92-452e-9005-3dcd31fb4d2c","resolution":{"observed_at":"2026-08-07T13:09:27.119977Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:32.948153Z","title":"When vision meets touch: A contemporary review for visuotactile sensors from the signal processing perspective","venue":null,"work_id":"d277d1c5-ed93-407b-b953-90ce228960b6","year":2024},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-10T20:28:52.024760Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:20.545737Z"},"links":{"citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:4d252c6814c5291f3ae3b4471a166945028a689241deb7c77fc49de4eba8c91f","observation_id":"c811a921-8343-401f-ae5f-591f7be8ffad","resolution":{"observed_at":"2026-08-07T13:09:33.073625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:32.705803Z","title":"Gelsight: High-resolution robot tactile sensors for estimating geometry and force","venue":null,"work_id":"c46f7c21-9b91-42e6-bb26-4d49bac57ebc","year":2017},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-10T20:28:52.024760Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:20.676655Z"},"links":{"citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:5b2906d0572e86da3c9ce231bbf29d01f1b0e386b493b51e8199f2cbea9ac488","observation_id":"1a6ffca7-6dd9-4dc7-9421-2c0cd24964fb","resolution":{"observed_at":"2026-08-07T13:09:32.833076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:32.401288Z","title":"Digit: A novel design for a low-cost compact high-resolution tactile sensor with application to in-hand manipulation","venue":null,"work_id":"d3e2f2ee-3721-4dae-bc8b-f7921292f21d","year":2020},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-10T20:28:52.024760Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:20.786246Z"},"links":{"citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:273b98332eeb44d6cfc56fecdd55026be5c9a7cb395f98e7e6b6955ebf006183","observation_id":"dfea851b-8f91-4e67-a99d-ace2f346f1a7","resolution":{"observed_at":"2026-08-07T13:09:32.535134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.06211","last_updated":"2022-02-13T05:14:22Z","snapshot_observed_at":"2026-08-13T16:42:21.727468Z","submitted_at":"2022-02-13T05:14:22Z","title":"Tac3D: A Novel Vision-based Tactile Sensor for Measuring Forces Distribution and Estimating Friction Coefficient Distribution","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.06211","snapshot_observed_at":"2026-08-07T13:09:20.888419Z","title":"Tac3d: A novel vision-based tactile sensor for measuring forces distribution and estimating friction coefficient distribution","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-10T20:28:52.024760Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:20.888419Z"},"links":{"cited_paper":"/paper/2202.06211","citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:52732687b9114fa73a8768916c17e3d39162475f3560b746341159eae1f75916","observation_id":"acebc66d-26bc-4d24-abc6-ef6bd4c66b39","resolution":{"observed_at":"2026-08-07T13:09:20.888419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:32.126289Z","title":"Anytouch: Learning unified static-dynamic representation across multiple visuo-tactile sensors","venue":null,"work_id":"343afcb3-8ca5-4b3e-a2fc-39c62c5c8f73","year":2025},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-10T20:28:52.024760Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:21.005344Z"},"links":{"citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:de1802ad3f12283516374be345cf1c04889fc1deb6be0e3c3d455e6602ef8d0a","observation_id":"76ef809c-43e9-4f30-8cf1-93e8632aa829","resolution":{"observed_at":"2026-08-07T13:09:32.238115Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:31.880423Z","title":"Transferable tactile transformers for representation learning across diverse sensors and tasks","venue":null,"work_id":"538c988d-673a-4f52-8815-67d7c2e55495","year":2024},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-10T20:28:52.024760Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:21.115468Z"},"links":{"citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:8ceab7f6ab1397cb7222e8a7a65ed650376576d0b62e386f11167c8b4071e27c","observation_id":"624d1181-696b-404c-ab7e-f6392e065556","resolution":{"observed_at":"2026-08-07T13:09:31.979642Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.02794","last_updated":"2024-06-05T01:40:36Z","snapshot_observed_at":"2026-08-13T00:14:44.203333Z","submitted_at":"2024-05-05T02:22:11Z","title":"Octopi: Object Property Reasoning with Large Tactile-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.02794","snapshot_observed_at":"2026-08-07T13:09:21.199940Z","title":"Octopi: Object property reasoning with large tactile-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-10T20:28:52.024760Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:21.199940Z"},"links":{"cited_paper":"/paper/2405.02794","citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:919e5f48114ded8c9d9452ad63258897e75f0314d24062bcd589c47d4a010c83","observation_id":"793c2a97-ea4c-4375-88da-a04937c09976","resolution":{"observed_at":"2026-08-07T13:09:21.199940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:31.559784Z","title":"A touch, vision, and language dataset for multimodal alignment","venue":null,"work_id":"16a1627a-2a3f-4478-babf-5a500557b6ad","year":2024},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-10T20:28:52.024760Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:21.303672Z"},"links":{"citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:429cc674548fbe745257840566eda75f09f9f026710470df77ca009d6e19f1a9","observation_id":"cdda796b-c152-44fa-914f-0ee8ff653e78","resolution":{"observed_at":"2026-08-07T13:09:31.655885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:21.437900Z","title":"Binding touch to everything: Learn- ing unified multimodal tactile representations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-10T20:28:52.024760Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:21.437900Z"},"links":{"citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:f18e6f9d53cdc06189fb914e5e2ea3a98bd691e0461dce6604f90a2ca4eb19df","observation_id":"f7fbd7ce-31e4-40ec-bb6b-37ec7f3bed1b","resolution":{"observed_at":"2026-08-07T13:09:21.437900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:31.375587Z","title":"Sparsh: Self-supervised touch representations for vision-based tactile sensing","venue":null,"work_id":"0aecbea0-a0b0-47f3-bc69-d06e9f8edfcf","year":2024},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-10T20:28:52.024760Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:21.550534Z"},"links":{"citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:35ee8f19ba8dec18006f4a7e19b6474314c94b19b247b9a3e65d98991c5c83ae","observation_id":"7ea52084-156f-4997-a910-f59c5759fb43","resolution":{"observed_at":"2026-08-07T13:09:31.436273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:31.086896Z","title":"Visuo- tactile affordances for cloth manipulation with local control","venue":null,"work_id":"08165663-89c7-4bc0-a952-eb9b22060490","year":2023},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-10T20:28:52.024760Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:21.673000Z"},"links":{"citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:d0a077d9f8ee9dada086ec432f5b75daf61dff5e5e2a04555c6260da3e6a6c8d","observation_id":"ebbfd123-0d6e-4b15-a32c-6d0014f2f269","resolution":{"observed_at":"2026-08-07T13:09:31.215381Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11537","last_updated":"2024-08-21T11:32:09Z","snapshot_observed_at":"2026-08-12T23:00:03.394044Z","submitted_at":"2024-08-21T11:32:09Z","title":"A Survey of Embodied Learning for Object-Centric Robotic Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11537","snapshot_observed_at":"2026-08-07T13:09:21.815777Z","title":"A survey of embodied learning for object-centric robotic manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-10T20:28:52.024760Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:21.815777Z"},"links":{"cited_paper":"/paper/2408.11537","citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:a2ab05aa43375dacb0faf363c853f2d655f822254cfebe0f786f4d23155030ca","observation_id":"cbec3edb-3dd7-4112-afbc-bf4784575848","resolution":{"observed_at":"2026-08-07T13:09:21.815777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:30.850220Z","title":"Touch and go: learning from human-collected vision and touch","venue":null,"work_id":"48c64253-cef9-4f80-9559-69c4ca4a8b01","year":2022},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-10T20:28:52.024760Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:21.941510Z"},"links":{"citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:baa261cced162311f9f587d7325334d1f06a241579fb2adc4e389011e083d06e","observation_id":"208acdd1-c51d-49ff-aee7-c0666b5a9c53","resolution":{"observed_at":"2026-08-07T13:09:30.953063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:30.583099Z","title":"Objectfolder: A dataset of objects with implicit visual, auditory, and tactile representations","venue":null,"work_id":"d194ce3c-1fd6-4efe-be8b-ac61758af5de","year":2021},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-10T20:28:52.024760Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:22.066880Z"},"links":{"citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:3f4673c5b6aa82b9c90191948c09b4d300e128b6a4cc93910cd81bc544a8365a","observation_id":"392610d5-dcb9-4574-992d-ee451a827144","resolution":{"observed_at":"2026-08-07T13:09:30.696731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:30.410033Z","title":"Objectfolder 2.0: A multisensory object dataset for sim2real transfer","venue":null,"work_id":"8b0d7355-d379-454b-a165-53128bb1524e","year":2022},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-10T20:28:52.024760Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:22.198067Z"},"links":{"citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:a8644b59eaec71f89ecd4dd5fe34f91d69163c9d31d279b8853c5083939e5606","observation_id":"0d1a6651-3972-4388-a3d7-4f43fee1f54d","resolution":{"observed_at":"2026-08-07T13:09:30.516242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:30.235034Z","title":"See, hear, and feel: Smart sensory fusion for robotic manipulation","venue":null,"work_id":"7aa61773-15f2-4643-9fa6-8c0ac790f0de","year":2023},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-10T20:28:52.024760Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:22.334747Z"},"links":{"citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:1f0cfa77eb1412afc80fd43931a54b570a54e2145cbc7498c9339eb8a6678903","observation_id":"6dacc2bd-93f8-45eb-9a08-28d9e34f710e","resolution":{"observed_at":"2026-08-07T13:09:30.352472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:29.994056Z","title":"Active clothing material perception using tactile sensing and deep learning","venue":null,"work_id":"783860d0-743e-4839-9855-168965434a0e","year":2018},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-10T20:28:52.024760Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:22.466478Z"},"links":{"citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:fee62f5215e62273b2c4bc1f22446bf34407ac983f31d8557e4f859a56a644ca","observation_id":"2901758c-fe3c-4126-b33d-0b0937768079","resolution":{"observed_at":"2026-08-07T13:09:30.101643Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.13042","last_updated":"2023-07-31T17:47:27Z","snapshot_observed_at":"2026-08-13T14:18:52.401478Z","submitted_at":"2022-09-26T21:50:39Z","title":"Self-Supervised Visuo-Tactile Pretraining to Locate and Follow Garment Features","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.13042","snapshot_observed_at":"2026-08-07T13:09:22.601918Z","title":"Self-supervised visuo-tactile pretraining to locate and follow garment features","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-10T20:28:52.024760Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:22.601918Z"},"links":{"cited_paper":"/paper/2209.13042","citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:dbdbd41edc65913cf27c6636bfba237bb146c387240c2cd729be80d7ea7d74ca","observation_id":"8c16cee2-1899-4b26-ad14-2bd330bd1bca","resolution":{"observed_at":"2026-08-07T13:09:22.601918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:22.755242Z","title":"Videomae: Masked autoencoders are data-efficient learners for self-supervised video pre-training","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-10T20:28:52.024760Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:22.755242Z"},"links":{"citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:eeeab5d5c2132dfea165bc876e1192204a5c9275a790f40a7dfc9ba629fc8a77","observation_id":"beac2993-c198-4208-8264-2b4af7e285c2","resolution":{"observed_at":"2026-08-07T13:09:22.755242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:29.719457Z","title":"Videomae v2: Scaling video masked autoencoders with dual masking","venue":null,"work_id":"d9162be0-9454-485b-94e1-e5bf4072e907","year":2023},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-10T20:28:52.024760Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:22.850972Z"},"links":{"citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:eec7a21286944fd7a587a987fe7d95295ccd239508172b9bd8b3f1d97bf70049","observation_id":"eab5930d-261a-4dc9-a0c9-682cbba1406e","resolution":{"observed_at":"2026-08-07T13:09:29.809973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:29.473226Z","title":"Sigma: Sinkhorn-guided masked video modeling","venue":null,"work_id":"ab47530a-6ec6-4179-ad94-7176d1f1447c","year":2024},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-10T20:28:52.024760Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:22.991207Z"},"links":{"citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:c939ed743ceb23ee0c459c8bf01d0e47f04398d1a610c869e10d5e9c315d4fb3","observation_id":"cdc1cd11-5c75-4fe2-b7cf-614719443e24","resolution":{"observed_at":"2026-08-07T13:09:29.582233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:29.256146Z","title":"Mgmae: Motion guided masking for video masked autoencoding","venue":null,"work_id":"6d848873-1c8e-4701-9b44-c2b51013bdbe","year":2023},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-10T20:28:52.024760Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:23.156250Z"},"links":{"citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:bd26d50baab297ac8ec7c4f76e7ffd0c54ca56cd9d679bf81d333dbfb749f8d2","observation_id":"2f57f20a-4a5a-4dbb-8f77-630bc069549c","resolution":{"observed_at":"2026-08-07T13:09:29.355424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12332","last_updated":"2025-03-16T03:01:07Z","snapshot_observed_at":"2026-08-13T01:24:38.890995Z","submitted_at":"2025-03-16T03:01:07Z","title":"VideoMAP: Toward Scalable Mamba-based Video Autoregressive Pretraining","version":1},"cited_work":{"arxiv_id":"2503.12332","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.12332","snapshot_observed_at":"2026-08-07T13:09:26.853314Z","title":"VideoMAP: Toward Scalable Mamba-based Video Autoregressive Pretraining","venue":"cs.CV","work_id":"ccc4a5d8-f7d1-46bd-9606-1d718bfbaf24","year":2025},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-10T20:28:52.024760Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:23.238850Z"},"links":{"cited_paper":"/paper/2503.12332","citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:e43359b8695fd932b2dddf0db65a7e232a4b6e6f0da851ff8192ae9fa92d07f7","observation_id":"8890e7dc-b217-4dbd-9e61-553736bbc3c4","resolution":{"observed_at":"2026-08-07T13:09:26.914536Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:29.043751Z","title":"Videomac: Video masked autoencoders meet convnets","venue":null,"work_id":"26098f9f-1866-4bb4-a472-0d6315c14771","year":2024},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-10T20:28:52.024760Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:23.337796Z"},"links":{"citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:197e69a4d4ac525b7f59347e601271550a4dded2511a9d1ea2f331ff74d95beb","observation_id":"9cbbb563-ba2a-4b99-a2b9-4a5c98629509","resolution":{"observed_at":"2026-08-07T13:09:29.125395Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:23.432848Z","title":"Hugginggpt: Solving ai tasks with chatgpt and its friends in hugging face","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-10T20:28:52.024760Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:23.432848Z"},"links":{"citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:a5f05bf7c01881a0c85e0735f7d2be84f7a68864225c8deaa568b7f042de5714","observation_id":"6118caa9-3120-4001-9b1f-e5fe9de1fba9","resolution":{"observed_at":"2026-08-07T13:09:23.432848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:23.595338Z","title":"Vipergpt: Visual inference via python execution for reasoning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-10T20:28:52.024760Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:23.595338Z"},"links":{"citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:9bb4abb42691fb587893d89e7074dbfc05f05acbc887e845788d2578200b4ad0","observation_id":"9995e569-a2b3-4ea4-9e92-b43426a67bcd","resolution":{"observed_at":"2026-08-07T13:09:23.595338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:23.681350Z","title":"Gpt4tools: Teaching large language model to use tools via self-instruction.Advances in Neural Information Processing Systems, 36:71995–72007, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-10T20:28:52.024760Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:23.681350Z"},"links":{"citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:3c196448f898f98e530c29d923474ca01147cb345183606b6a4a3713160a5ef0","observation_id":"a3013d9a-5e2f-4baa-895f-36b61cf644e3","resolution":{"observed_at":"2026-08-07T13:09:23.681350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:23.786995Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-10T20:28:52.024760Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:23.786995Z"},"links":{"citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:73020d914e242968d2116fedf6c0f9c26a933545bea249714d94de431d92bbed","observation_id":"97709027-603c-493b-a6dc-e93839b22fad","resolution":{"observed_at":"2026-08-07T13:09:23.786995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:28.768391Z","title":"Minigpt-4: Enhanc- ing vision-language understanding with advanced large language models","venue":null,"work_id":"694d4392-3d57-4cc3-8fe3-3f9c241b0cce","year":2024},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-10T20:28:52.024760Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:23.865887Z"},"links":{"citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:184fead9581bda314e8df6dddd440e587a8b2f2e82f328ee2aaae4f331d1955b","observation_id":"352771ac-e717-4add-8dd5-0cdf78a2e61e","resolution":{"observed_at":"2026-08-07T13:09:28.868777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:23.964185Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-10T20:28:52.024760Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:23.964185Z"},"links":{"citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:c31a35b3faefeb3faafaa7b8431d1caa6baeec24329d4a4ae9d7058679bced9f","observation_id":"97ba6137-fecf-4e2f-b213-67f56a72c03b","resolution":{"observed_at":"2026-08-07T13:09:23.964185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:24.036960Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-10T20:28:52.024760Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:24.036960Z"},"links":{"citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:712492d16ba67e0502e6699ff22a123799c0b70ce1ceb1a947d6b18bed1dfd3d","observation_id":"078e2ba6-a78d-4edd-a9b7-f6b6dd95d72f","resolution":{"observed_at":"2026-08-07T13:09:24.036960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:24.134433Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-10T20:28:52.024760Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:24.134433Z"},"links":{"citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:89f6ba88f863ab830b067b6e5b40d6de80ceda4121c918e50c42746f291b765c","observation_id":"d76a937d-66db-41a6-9a14-10efc16017b2","resolution":{"observed_at":"2026-08-07T13:09:24.134433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13106","last_updated":"2025-06-03T03:33:14Z","snapshot_observed_at":"2026-08-13T11:53:19.464291Z","submitted_at":"2025-01-22T18:59:46Z","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13106","snapshot_observed_at":"2026-08-07T13:09:24.251376Z","title":"Videollama 3: Frontier multimodal foundation models for image and video understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-10T20:28:52.024760Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:24.251376Z"},"links":{"cited_paper":"/paper/2501.13106","citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:bea7da14161f86258ba0a314261ece012f03df817fd5cddab892187387c719b6","observation_id":"4d471dd7-0154-42c7-9e64-3e2961686ada","resolution":{"observed_at":"2026-08-07T13:09:24.251376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-08-12T22:47:34.452271Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-07T13:09:24.344367Z","title":"Llama-omni: Seamless speech interaction with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-10T20:28:52.024760Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:24.344367Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:c66b09acfe0e69a595f3be529741564428d8adb04a082a721eb9bf7b55bd3c22","observation_id":"d3b73640-6507-408d-a905-1fce1cd35252","resolution":{"observed_at":"2026-08-07T13:09:24.344367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07864","last_updated":"2025-03-01T08:57:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-10T12:33:46Z","title":"RDT-1B: a Diffusion Foundation Model for Bimanual Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07864","snapshot_observed_at":"2026-08-07T13:09:24.408542Z","title":"Rdt-1b: a diffusion foundation model for bimanual manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-10T20:28:52.024760Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:24.408542Z"},"links":{"cited_paper":"/paper/2410.07864","citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:1d08f0435edf19bb14193ca71a132565f09645b58e9832c916f58254baadf616","observation_id":"50fa4dfe-7599-43b1-b803-b66e80ffddb1","resolution":{"observed_at":"2026-08-07T13:09:24.408542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04693","last_updated":"2025-01-14T22:28:39Z","snapshot_observed_at":"2026-08-10T21:24:12.888548Z","submitted_at":"2025-01-08T18:57:33Z","title":"Beyond Sight: Finetuning Generalist Robot Policies with Heterogeneous Sensors via Language Grounding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04693","snapshot_observed_at":"2026-08-07T13:09:24.502357Z","title":"Beyond sight: Finetuning generalist robot policies with heterogeneous sensors via language grounding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-10T20:28:52.024760Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:24.502357Z"},"links":{"cited_paper":"/paper/2501.04693","citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:60fbbb619ab68387885d0820721db7930820b39922e41d4152e6f092bfd0ee10","observation_id":"a3f3347f-591d-4657-a834-23fbaa070590","resolution":{"observed_at":"2026-08-07T13:09:24.502357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.08269","last_updated":"2024-09-12T17:58:07Z","snapshot_observed_at":"2026-08-12T22:46:03.316822Z","submitted_at":"2024-09-12T17:58:07Z","title":"Touch2Touch: Cross-Modal Tactile Generation for Object Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.08269","snapshot_observed_at":"2026-08-07T13:09:24.596314Z","title":"Touch2touch: Cross-modal tactile generation for object manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-10T20:28:52.024760Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:24.596314Z"},"links":{"cited_paper":"/paper/2409.08269","citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:b9ebfd3d85093596eb8e2819d3a2c8c0acf785021049397cf40ab72d705c873b","observation_id":"4426ec64-3622-445e-ae22-47279bff05cd","resolution":{"observed_at":"2026-08-07T13:09:24.596314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:28.500906Z","title":"Cubic spline interpolation","venue":null,"work_id":"4ecb9532-b28a-44a2-aaa9-142825694a1b","year":1998},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-10T20:28:52.024760Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:24.715771Z"},"links":{"citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:35e2c259d6e40cc7f1cb19b7b99732cf6203fcb5426cb168f2973e7236d326ee","observation_id":"931b65ea-f382-4776-81ba-6b669b203d5d","resolution":{"observed_at":"2026-08-07T13:09:28.617259Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:28.197384Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":"60a56782-3b20-4d91-b924-b08312057da8","year":2020},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-10T20:28:52.024760Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:24.840567Z"},"links":{"citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:361bf800687e6059b9a33eaa19c90f906a22bc9f49f8c830922e1a5003a650f7","observation_id":"d3d1544c-7f2d-4937-94c2-cc7062024bc7","resolution":{"observed_at":"2026-08-07T13:09:28.313082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.08415","last_updated":"2023-06-06T01:53:32Z","snapshot_observed_at":"2026-08-13T19:48:28.322536Z","submitted_at":"2016-06-27T19:20:40Z","title":"Gaussian Error Linear Units (GELUs)","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.08415","snapshot_observed_at":"2026-08-07T13:09:24.983127Z","title":"Gaussian error linear units (gelus)","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-10T20:28:52.024760Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:24.983127Z"},"links":{"cited_paper":"/paper/1606.08415","citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:0d0854f207234ca4cff1855d2b9ccd974520a6650cc5e06f591d83826f3c23e8","observation_id":"efad683c-0329-41d4-8300-4b83db121f71","resolution":{"observed_at":"2026-08-07T13:09:24.983127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:25.062498Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-10T20:28:52.024760Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:25.062498Z"},"links":{"citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:de76dc66509a39d08b09b165db6145cc6df245ff969e498185d92f01ec43e2c8","observation_id":"6b0cadcd-cdd2-481d-b2d0-2be2fd96087a","resolution":{"observed_at":"2026-08-07T13:09:25.062498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:27.980524Z","title":"Gaussian mixture models","venue":null,"work_id":"151dc832-6ad5-426c-a42b-fb24dceac0c3","year":2009},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-10T20:28:52.024760Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:25.153871Z"},"links":{"citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:bc88e75b6ceb19781048dfdb989d31032b2e28ce8d0eef75580965651893cab3","observation_id":"d9c45fc7-ed47-49be-9795-9d6c2fc851f6","resolution":{"observed_at":"2026-08-07T13:09:28.079862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:25.284624Z","title":"Raft: Recurrent all-pairs field transforms for optical flow","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-10T20:28:52.024760Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:25.284624Z"},"links":{"citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:856abbd064cf89688571c77093ecea75bb189d9da60d3f2400d36df228e38775","observation_id":"e15719c8-7422-4632-91e9-557f79f72825","resolution":{"observed_at":"2026-08-07T13:09:25.284624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:27.751850Z","title":"Forward and backward warping for optical flow-based frame interpolation","venue":null,"work_id":"2fd5cec1-c340-4bce-89cf-5ba7ac1a35c8","year":2022},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-10T20:28:52.024760Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:25.397975Z"},"links":{"citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:10a8bbe38f0d6eb16ca6bccd79b7bf7cd653dd6a8d29a838dacd14602451a00a","observation_id":"e6a60081-4ffb-4412-b2f8-1304ccf66c42","resolution":{"observed_at":"2026-08-07T13:09:27.860591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:27.484189Z","title":"Extrapolation-based video retargeting with backward warping using an image-to-warping vector generation network","venue":null,"work_id":"829f37f5-9776-42bc-99a5-486ba22d173e","year":2020},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-10T20:28:52.024760Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:25.529812Z"},"links":{"citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:2e8a5ef16d225b942c083275aca67bc866efd54d20b5b045684321ab4ccae9fb","observation_id":"d6bd2af6-b91d-445a-b71f-16d16cb38fe9","resolution":{"observed_at":"2026-08-07T13:09:27.612526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:25.692625Z","title":"Cross-entropy loss functions: Theoretical analysis and applications","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-10T20:28:52.024760Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:25.692625Z"},"links":{"citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:22d492a94521985394afcd0e98a570655884f2332709c60fde753c3f01e7602e","observation_id":"362bd598-074d-4d98-8f7c-4449b1589cb9","resolution":{"observed_at":"2026-08-07T13:09:25.692625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T13:09:25.820834Z","title":"Gpt-4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-10T20:28:52.024760Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:25.820834Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:d833355705a43ee885ab67300d12f9821033def4034e4f6afa81788ad1217b4c","observation_id":"b16cc7da-a388-4856-8a25-5582d5a000fd","resolution":{"observed_at":"2026-08-07T13:09:25.820834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:27.267910Z","title":"gemini-2.5-pro-preview-05-06","venue":null,"work_id":"49137ae9-6424-4a49-8bfa-06e24f0ee5e3","year":2025},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-10T20:28:52.024760Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:25.923745Z"},"links":{"citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:50d6038cd972816c3f2e069738b899fe81de4c7d36437b4c4c92e5e5f000fa49","observation_id":"a304cf9d-0f65-4eef-af4e-93345d8f906c","resolution":{"observed_at":"2026-08-07T13:09:27.360930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T13:09:26.070117Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-10T20:28:52.024760Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:26.070117Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:ff2a7f0dca26d19115ba1a0546626a59cc6f2b742983269526cfc3baa861d373","observation_id":"f3a13097-92b7-47d9-b443-a76e1e1f8917","resolution":{"observed_at":"2026-08-07T13:09:26.070117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-08-07T13:09:26.216112Z","title":"Video instruction tuning with synthetic data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-10T20:28:52.024760Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:26.216112Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:884064b90fafce5d813d97fb09a0bd3c364b8d03a4aadd3e748624e678f6fdef","observation_id":"120b31ac-4054-4861-882b-b452c3ddd294","resolution":{"observed_at":"2026-08-07T13:09:26.216112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T13:09:26.367593Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-10T20:28:52.024760Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:26.367593Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:6bbc3a9fa613000f2be28ee483d4493b51dbb6fed749b16a2c3cb2b1f8c58fff","observation_id":"c51cfa79-1d7a-46af-bebb-b92b42132eb1","resolution":{"observed_at":"2026-08-07T13:09:26.367593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T13:09:26.504997Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-10T20:28:52.024760Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:26.504997Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:5fee8171e6bd2554d92975d91bc686937b2be20153104450a2891f77e06634dd","observation_id":"ee21c921-e493-4641-8370-9e04b885dc58","resolution":{"observed_at":"2026-08-07T13:09:26.504997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T20:28:52.024760Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction"},"reference_resolution":{"displayed":60,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":2,"verified_fuzzy":27},"total_outbound_references":60},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 60 of 60 outbound references and 5 inbound Pith citation observations for arXiv:2505.22566."}