{"as_of":"2026-08-10T13:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:28277cbd27fa389e84523a7c61f1fbe8768aa30188e7e6996a55b1969fc03bc3","coverage":[{"denominator":67,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":67,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T22:47:34.476382Z","state":"measured"},{"denominator":67,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":67,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.20795/citation-record","integrity":"/paper/2506.20795/integrity","json":"/paper/2506.20795/citation-record.json","paper":"/paper/2506.20795"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:35.704259Z","title":"Tracking body and hands for gesture recognition: NATOPS aircraft handling signals database,","venue":null,"work_id":"1777cca8-43a1-4695-bf66-3ca8a9ab0561","year":2011},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-09T22:12:28.186498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.116119Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:9a2ed19eee8b7e0ee42e618417df5a7962ad2cc7c2e429d17d0f761b2a6ac29e","observation_id":"0977bb5c-e24f-49fa-9e11-2e0c24e2999a","resolution":{"observed_at":"2026-08-06T22:47:35.709166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:35.671574Z","title":"Visual recognition of traffic police gestures with convo- lutional pose machine and handcrafted features,","venue":null,"work_id":"136e692b-1383-406b-b6eb-b67c16fd33fd","year":2020},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-09T22:12:28.186498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.123214Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:25b57cd28494a83a2c433f5943c3c85b42fd0bbe15c8e85854f6127a2cddd32b","observation_id":"66f33768-a71e-4d02-a2d6-70156ab532f4","resolution":{"observed_at":"2026-08-06T22:47:35.688198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:35.645554Z","title":"Chinese traffic police gesture recognition based on graph convolutional network in natural scene,","venue":null,"work_id":"3b3ef916-a57c-4b4f-8826-b5915e664832","year":2021},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-09T22:12:28.186498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.128641Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:bfaa49331245d0d9036150399a2d2266dffdd90b2fa182784d1e426233e91c2b","observation_id":"ae249163-6d36-47fc-b4bf-441cd4781d13","resolution":{"observed_at":"2026-08-06T22:47:35.655428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:35.614241Z","title":"Traffic control gesture recognition for au- tonomous vehicles,","venue":null,"work_id":"ce2ba459-a307-441b-a344-9df910e87a59","year":2020},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-09T22:12:28.186498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.134162Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:649a6ac83a013788bb8f848cc0904278509cef6210b0cc75a1a2c9c6e6c41277","observation_id":"158512e3-8fc1-4d27-ac7b-1257dbec263a","resolution":{"observed_at":"2026-08-06T22:47:35.628544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:35.589057Z","title":"Learning deep and compact models for gesture recognition,","venue":null,"work_id":"b7fda9de-3e2d-4303-b541-1b9d6a955b94","year":2017},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-09T22:12:28.186498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.139393Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:b33f5dbf66ae177e6cabdae2fc5f749bd33e06549211583572ea47bee3a53519","observation_id":"31fc76d5-79b9-4df4-aa7e-d8b86a212ffa","resolution":{"observed_at":"2026-08-06T22:47:35.598438Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:35.562362Z","title":"HGR-ViT: Hand gesture recognition with vision transformer,","venue":null,"work_id":"6bccb682-e825-4d85-ae0e-b3763a57c176","year":2023},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-09T22:12:28.186498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.145053Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:c753af6ea15aa3de76962fb96fa1c3df4a749d215d23fc736b5b94a03a406a17","observation_id":"4fa5628a-f2c3-40fa-8f26-33cc845ebed0","resolution":{"observed_at":"2026-08-06T22:47:35.572660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:35.540526Z","title":"A transformer-based network for dynamic hand gesture recognition,","venue":null,"work_id":"f806a6fb-3d59-4a79-8ef7-b37bbded72a5","year":2020},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-09T22:12:28.186498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.150425Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:fd3d3cae999064e90ae249e27e2ff090c266964122b7a97820d4c64fe6f1f5ea","observation_id":"bbe65676-4035-4905-be46-0d598d564cd7","resolution":{"observed_at":"2026-08-06T22:47:35.549144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:35.521214Z","title":"Dynamic gesture recognition based on LSTM-CNN,","venue":null,"work_id":"45abb168-a174-46dc-beb2-89698a196641","year":2018},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-09T22:12:28.186498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.156161Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:2816e5c31bf3e7028b854f446059deea3ae4a359575da70e68d59f2b68964087","observation_id":"f9da4b82-c700-4d74-a0c3-11ea6ee0adcf","resolution":{"observed_at":"2026-08-06T22:47:35.528268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:35.500946Z","title":"Body gesture recognition to control a social mobile robot,","venue":null,"work_id":"6cee9104-bd27-4853-aa99-658ddb77a528","year":2023},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-09T22:12:28.186498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.160933Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:a8c42146d4f787dc441216ac37aca9742ea7abd499be471417dbcea2ce113bf0","observation_id":"6ee1551e-9677-4c1f-829f-251deccfa48f","resolution":{"observed_at":"2026-08-06T22:47:35.508697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:35.481618Z","title":"A fast-response dynamic-static parallel attention GCN network for body–hand gesture recognition in HRI,","venue":null,"work_id":"f3838ed9-be7f-42ed-9533-228fbe4ad7a4","year":2023},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-09T22:12:28.186498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.165582Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:ce4b6cf64e2af8e7a4deec8663b16585cb77f4638369d7b1d53e97980e3c35a8","observation_id":"33a5e70e-475b-4cd6-996c-d8b2ce51e5c7","resolution":{"observed_at":"2026-08-06T22:47:35.487709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:35.464478Z","title":"MeTRAbs: Metric-scale truncation-robust heatmaps for absolute 3D human pose estimation,","venue":null,"work_id":"d2a520ef-d27f-41c9-a1eb-3f398cf5ec2b","year":2021},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-09T22:12:28.186498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.171013Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:3b3e47755479718f73b6f0a9a3319c7d5e55af2045c167d9038ed007c4ff84b3","observation_id":"1496d3c6-eb62-4f28-bf2e-119cc4707a0d","resolution":{"observed_at":"2026-08-06T22:47:35.469933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:35.429688Z","title":"DINOv2: Learning robust visual features without supervision,","venue":null,"work_id":"aaedfa5d-9b34-4669-9181-fafc7e52a866","year":2024},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-09T22:12:28.186498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.180532Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:f2664be45ebc3ac69d82406fa50246a22a7d0bfa9882d4b93022ebdbcf269c29","observation_id":"5215498f-55ee-45c6-8bc8-0ca073f1558f","resolution":{"observed_at":"2026-08-06T22:47:35.434782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:35.413667Z","title":"The Gemini 2.0 model family,","venue":null,"work_id":"9dd1b348-03f7-4cc8-9354-ffdebdf722c2","year":2025},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-09T22:12:28.186498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.185998Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:b3b3de4f915d6d57821e9289ddf5c9b07efb052e5a8ae230cb6021ca96a6cb7c","observation_id":"d09ba8f9-2503-455c-8ca7-0be1b883778a","resolution":{"observed_at":"2026-08-06T22:47:35.418357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:35.397100Z","title":"GPT-4: OpenAI’s language model,","venue":null,"work_id":"8f886cf2-da33-4110-9dca-28b213ed4d91","year":2025},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-09T22:12:28.186498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.191173Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:66b2533584bf5f8a167b6149a499de8ccb24d4071c6e77f95bb999d33d18e42f","observation_id":"0eb3cd97-1fd5-43d9-a818-17d344f602c9","resolution":{"observed_at":"2026-08-06T22:47:35.401586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.03770","last_updated":"2024-05-06T18:09:48Z","snapshot_observed_at":"2026-08-08T03:33:14.622766Z","submitted_at":"2024-05-06T18:09:48Z","title":"Foundation Models for Video Understanding: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.03770","snapshot_observed_at":"2026-08-06T22:47:34.195792Z","title":"Foundation models for video understanding: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-09T22:12:28.186498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.195792Z"},"links":{"cited_paper":"/paper/2405.03770","citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:600b2679f382ca21d996c475e201efa5e041f93e9465c8594b2676fdb6c48ff4","observation_id":"d9c5ec05-8374-4726-822d-161b0b5cbc8d","resolution":{"observed_at":"2026-08-06T22:47:34.195792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:35.381865Z","title":"VideoGLUE: Video general understanding eval- uation of foundation models,","venue":null,"work_id":"23ddf118-8d8b-4ba4-b070-584ff635bb3a","year":2024},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-09T22:12:28.186498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.200607Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:710e0bf3da2968fccbf2170c9a7271f63473c4b7e0024da6e7818ccc7bb1a1c5","observation_id":"347b33eb-322d-46d9-bd16-228401e838c0","resolution":{"observed_at":"2026-08-06T22:47:35.386609Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:35.366393Z","title":"Hierarchically decomposed graph convolutional networks for skeleton-based action recognition,","venue":null,"work_id":"a1190d99-f89d-4260-8548-c3cddb25d256","year":2023},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-09T22:12:28.186498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.205567Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:7dc9796c16ba0e8fbeb1f96b46782d24d7eab8f6f38deffc70cb1f0d22b7843d","observation_id":"dcb18920-72e7-4d01-8267-634b9f231402","resolution":{"observed_at":"2026-08-06T22:47:35.371377Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-06T22:47:34.210136Z","title":"Gemini: A family of highly capable multimodal mod- els,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-09T22:12:28.186498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.210136Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:28cbb36da0e8fcdfdbd5c5dbd3b27965c1d231d04eafd519bb2bd89320fd0da1","observation_id":"b74372b2-9cdd-4198-865b-03ea26734a8c","resolution":{"observed_at":"2026-08-06T22:47:34.210136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:35.351637Z","title":"Gesture recognition: A survey,","venue":null,"work_id":"b96abd3b-1e53-4a7e-8543-7dcc59f27ab3","year":2007},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-09T22:12:28.186498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.214957Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:33d84d813c1a6b857cebcf0db88ea2efdbb16c329586a76b35cdc5325c24e6fd","observation_id":"86d67e9c-5883-440f-b3bc-5ecac193994d","resolution":{"observed_at":"2026-08-06T22:47:35.356152Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:35.336985Z","title":"Survey on hand gesture recognition from visual input,","venue":null,"work_id":"53d2ef7b-9981-4ca9-beb8-f932df170523","year":2025},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-09T22:12:28.186498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.220089Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:6dd0418d08cf8a4dba99950cefefa5f00c12e0ca054ba2bb1d555df37757e8f8","observation_id":"eacd6685-8483-4597-99fe-4a68966568a0","resolution":{"observed_at":"2026-08-06T22:47:35.341443Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:35.321979Z","title":"Computer vision-based hand gesture recognition for human-robot interaction: A review,","venue":null,"work_id":"db94d4bc-fea9-4294-a781-d44791f70ced","year":2024},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-09T22:12:28.186498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.224610Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:4f553c492f5c1604e6d508558896f865ca04c006c3a1e05a765d81bb8f084249","observation_id":"7e2911a4-eaf8-45e4-9f88-22540789d3a5","resolution":{"observed_at":"2026-08-06T22:47:35.326795Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:35.306660Z","title":"Robust dynamic gesture recognition at ultra-long distances,","venue":null,"work_id":"0a8c742b-e965-400a-ad76-bae60200728a","year":2024},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-09T22:12:28.186498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.230419Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:334d35efa3d608158b91fc0e46fde98a9bc7ad57afeb76f0eded9e0ddbcb74d5","observation_id":"8f661806-8e1b-40ac-b7b0-c3bfbba05190","resolution":{"observed_at":"2026-08-06T22:47:35.311370Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:35.289825Z","title":"UA V-GESTURE: A dataset for UA V control and gesture recognition,","venue":null,"work_id":"3aaf8b7b-e9fa-4493-a76f-539fc86220e2","year":2018},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-09T22:12:28.186498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.236928Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:51404051e4b6d513dc46f69191afad8b4d8e02ca6de9dd17d3224827be95bfc0","observation_id":"664f1231-e18b-4ac9-9e4b-c0c4d8f3fd73","resolution":{"observed_at":"2026-08-06T22:47:35.295687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:35.273947Z","title":"An overview of hand gesture languages for autonomous UA V handling,","venue":null,"work_id":"0efdcc2b-ec73-4720-9ebd-91ff86df40f3","year":2021},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-09T22:12:28.186498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.241668Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:40ee855ec44678b2303c2c7c0e4ae2cbe6aba46346e1280f0ee466801d729ea4","observation_id":"be199989-a71c-4b23-96de-2199859f8480","resolution":{"observed_at":"2026-08-06T22:47:35.278652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:35.258711Z","title":"Synthetic-to-real domain adaptation for action recognition: A dataset and baseline performances,","venue":null,"work_id":"1d484b9a-9fe9-4e28-b2c8-67df56b24937","year":2023},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-09T22:12:28.186498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.246871Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:1efbc37bc8e43f6e2f423e8b89b8598510bdf90f942419ff905e383d27c7b285","observation_id":"b33a1ad4-2546-4a8b-b705-be44c9e42d34","resolution":{"observed_at":"2026-08-06T22:47:35.263562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:35.243371Z","title":"Real-time multi-modal hu- man–robot collaboration using gestures and speech,","venue":null,"work_id":"024fb0e2-ca4d-4280-8c0a-3af39268e9ea","year":2022},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-09T22:12:28.186498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.251598Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:98ee652950cf63e2e7502753152c8bebd2f03c63b6f84e7b771e8209fd7a6514","observation_id":"c1ffb636-c25d-4916-9f0b-a729c0afb206","resolution":{"observed_at":"2026-08-06T22:47:35.248672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:35.228229Z","title":"Vision-based hand gesture recognition for human- robot collaboration: A survey,","venue":null,"work_id":"648b4ded-58f6-4aca-ba9d-1f4b7eedf077","year":2019},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-09T22:12:28.186498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.257266Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:813735e1f919402ad29fa76f9d3fa4110d6240f742c47056b23a362e494017a8","observation_id":"9a615138-cec4-444e-bba4-f4eada77bb21","resolution":{"observed_at":"2026-08-06T22:47:35.233176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:35.213417Z","title":"A human-centered approach to robot gesture based communication within collaborative working processes,","venue":null,"work_id":"297f15f1-6fad-45a8-883f-4bc16cd749df","year":2011},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-09T22:12:28.186498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.262973Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:09e0b618408a8070fd12f4734d84f768e4aa9f005b9a72d84a74d0a9b30f5ff2","observation_id":"450207d8-ac34-4a1d-9a40-1e4d1d70da84","resolution":{"observed_at":"2026-08-06T22:47:35.217984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:35.198413Z","title":"FollowMe: Person following and gesture recognition with a quadrocopter,","venue":null,"work_id":"cca1879a-acdf-44ee-a82a-cec876b701e9","year":2013},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-09T22:12:28.186498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.268038Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:e5b2e32a5db877e3fbdced056e7d8b0c60104c4f755434de8448bb420a796531","observation_id":"9b76d27a-6b23-46b4-b707-bdd892de1dfd","resolution":{"observed_at":"2026-08-06T22:47:35.203076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:35.183412Z","title":"Innovative collabora- tive method for interaction between a human operator and robotic manipulator using pointing gestures,","venue":null,"work_id":"ccf42819-022c-43e7-a88e-366a667a803d","year":2022},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-09T22:12:28.186498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.273173Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:09f18c3db78d90f4a2114b9a9132aa2b39de47da2cad48f08e8b0eb6a7394187","observation_id":"484d3b1c-fe4c-4f57-90e3-92b0d2c43b0d","resolution":{"observed_at":"2026-08-06T22:47:35.188228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:35.167446Z","title":"Gesture recognition for human-robot collab- oration: A review,","venue":null,"work_id":"1d3c46f9-0c2f-42d4-b7d0-22c89e1cd5c6","year":2018},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-09T22:12:28.186498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.278338Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:03256a80e2a05fc628d5347e2c5237af7e880c4731145a29ae8dfbc4379ab37d","observation_id":"d94bc3d9-533d-4b0a-b54d-c82810c87d07","resolution":{"observed_at":"2026-08-06T22:47:35.172444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:35.151515Z","title":"Application of human activity/action recognition: A review,","venue":null,"work_id":"1ded02a7-cd7b-4ac5-9294-92d7dd9c1770","year":2025},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-09T22:12:28.186498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.283412Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:f0d5e81e61b87643fb7042f6a799b09d96f65371175cc9e23d27b30bc759cbce","observation_id":"c7c678dc-bfc5-46c9-a1e2-cf44bff74945","resolution":{"observed_at":"2026-08-06T22:47:35.156090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:35.136615Z","title":"A survey on vision-based human action recognition,","venue":null,"work_id":"463f4234-9a49-42b9-819f-29e9de6f3dce","year":2010},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-09T22:12:28.186498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.288538Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:b780c7c0354e32f844722605059355123e8107806f30132cb65bda1352abc211","observation_id":"4feace59-7424-43a4-bb02-7e2abd8f8d0e","resolution":{"observed_at":"2026-08-06T22:47:35.141108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:35.121285Z","title":"Review of dynamic gesture recognition,","venue":null,"work_id":"6ecf7d71-a80b-466c-915e-fe2d74617cda","year":2021},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-09T22:12:28.186498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.293463Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:ac427f1c2d6fafafd50195a29167b325be8f1f9f66cb202b41e1acf57f3c7ad7","observation_id":"71a1ccaa-aa8b-40e4-9077-2e0f03d0d14d","resolution":{"observed_at":"2026-08-06T22:47:35.125979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:35.106199Z","title":"Recent advances of monocular 2D and 3D human pose estimation: A deep learning perspective,","venue":null,"work_id":"c31d7c5f-a793-46d6-9ae7-2a17e7652587","year":2022},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-09T22:12:28.186498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.298490Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:cbff2e194ea75f163049c29825cbfb1f639891b3925ba2806a0595500667faff","observation_id":"f3b2c91b-4fb0-423e-a6c2-25af3919e41f","resolution":{"observed_at":"2026-08-06T22:47:35.111329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.11631","last_updated":"2025-09-12T03:36:02Z","snapshot_observed_at":"2026-08-06T09:11:28.073489Z","submitted_at":"2023-04-23T12:10:36Z","title":"TSGCNeXt: Dynamic-Static Multi-Graph Convolution for Efficient Skeleton-Based Action Recognition with Long-term Learning Potential","version":2},"cited_work":{"arxiv_id":"2304.11631","doi":null,"metadata_source":"pith","pith_arxiv_id":"2304.11631","snapshot_observed_at":"2026-08-06T22:47:34.567357Z","title":"TSGCNeXt: Dynamic-Static Multi-Graph Convolution for Efficient Skeleton-Based Action Recognition with Long-term Learning Potential","venue":"cs.CV","work_id":"223b4dab-2303-4c88-acc3-7320b1bf5299","year":2023},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-09T22:12:28.186498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.303574Z"},"links":{"cited_paper":"/paper/2304.11631","citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:f40129271df963baa216f366def2bbe7a14619b650ca1f876bbbc70e7a9fb1e9","observation_id":"e9b2ca8b-8173-4f79-862c-afa716837c95","resolution":{"observed_at":"2026-08-06T22:47:34.575065Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:35.090818Z","title":"Language knowledge-assisted in topology construction for skeleton-based action recognition,","venue":null,"work_id":"c962a6b0-a8b6-454d-b964-45c78c935eaf","year":2023},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-09T22:12:28.186498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.309673Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:dbadf635034ce1ce16acad21262b7fabbecc2ce83b42c08194f514e3fca42bc1","observation_id":"b637ffe5-3968-4e69-8420-96a331fe8d65","resolution":{"observed_at":"2026-08-06T22:47:35.095267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:35.074331Z","title":"ViPLO: Vision transformer based pose-conditioned self-loop graph for human-object interaction detection,","venue":null,"work_id":"e03d64ee-9951-4dfd-91dd-f8108c1feacc","year":2023},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-09T22:12:28.186498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.314531Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:ee745068c57fbed26c11b0763531cbf95220277b8f9f1f7286db20437846ad03","observation_id":"10a3a20a-ab40-4ec4-bf79-2471350287f9","resolution":{"observed_at":"2026-08-06T22:47:35.079588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:35.059415Z","title":"SkeleTR: Towards skeleton-based action recogni- tion in the wild,","venue":null,"work_id":"a4d1e6d7-9db3-419d-a69c-feafbb0ea012","year":2023},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-09T22:12:28.186498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.319102Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:e56bc1d13d166538724ed0d76ea9b64b2a49f730ea1388baa3afdfe2f8543b08","observation_id":"5c16073d-a9ea-433a-8d72-901bef64f425","resolution":{"observed_at":"2026-08-06T22:47:35.064019Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:35.044522Z","title":"SkeletonMAE: Graph-based masked autoencoder for skeleton sequence pre-training,","venue":null,"work_id":"9d443ec9-80cf-45de-bece-8758d5427df5","year":2023},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-09T22:12:28.186498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.323421Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:b9a94300baf9e17a611bcffc6ed0d06b37050b9accb5ea11c6608f5c4bd1155d","observation_id":"a8b748bc-5640-400e-887f-596d71a1d7ac","resolution":{"observed_at":"2026-08-06T22:47:35.049206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:35.026275Z","title":"MotionGPT: Human motion as a foreign language,","venue":null,"work_id":"cf5a45d9-fd37-4be3-8888-1be5f35e5b3f","year":2024},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-09T22:12:28.186498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.328303Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:be3cb601957e996f1b5306b78c796640cafe7c9b4c85138a59c89b4ab0846016","observation_id":"fbc2e1a0-8d1f-4add-bac4-23d464de3bf6","resolution":{"observed_at":"2026-08-06T22:47:35.032955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21747","last_updated":"2026-06-08T02:14:45Z","snapshot_observed_at":"2026-08-09T10:12:49.943251Z","submitted_at":"2024-10-29T05:25:34Z","title":"MotionGPT-2: A General-Purpose Motion-Language Model for Motion Generation and Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21747","snapshot_observed_at":"2026-08-06T22:47:34.333588Z","title":"MotionGPT-2: A general-purpose motion-language model for motion generation and understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-09T22:12:28.186498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.333588Z"},"links":{"cited_paper":"/paper/2410.21747","citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:260d8cbaf8007f73dbdfad02250956878c26540ef968a54242a8bddf86c5c97c","observation_id":"7642b5bc-145e-42e0-868b-d97f136f5bf3","resolution":{"observed_at":"2026-08-06T22:47:34.333588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:35.010158Z","title":"Spatial temporal graph convolutional networks for skeleton-based action recognition,","venue":null,"work_id":"131aad09-059a-4bc3-9c25-4ba4a4259e4f","year":2018},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-09T22:12:28.186498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.338903Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:43f21bb17a98b2b876cf0dda65a0bf7635c28ed84b00b52035106adbc794624f","observation_id":"069cdd13-5cd2-4aff-9f27-abe37f255a06","resolution":{"observed_at":"2026-08-06T22:47:35.014932Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:34.993544Z","title":"Learning 3D human pose estimation from dozens of datasets using a geometry-aware autoencoder to bridge between skeleton formats,","venue":null,"work_id":"a49ab37a-8e9b-4c1f-bd8e-5a4c79ff4224","year":2023},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-09T22:12:28.186498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.343794Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:b43995c6cf2b87c4c1054c3aaf37e4605ac9e2f4b0a2ce86380a6c0680b6d0e4","observation_id":"e6b5e9e6-cf07-4ddc-88f8-f92648392fe6","resolution":{"observed_at":"2026-08-06T22:47:34.998701Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:34.977486Z","title":"Systematic comparison of projection methods for monocular 3D human pose estimation on fisheye images,","venue":null,"work_id":"5bbd4bd5-34b0-4552-bc7a-15c7ffbf67a9","year":2025},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-09T22:12:28.186498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.348854Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:2640e20d4bfb3cd5503ef29f8f5a350563ed971f3828add3180c097365218af2","observation_id":"b8e11ffb-4353-423b-af67-833eb7cbf646","resolution":{"observed_at":"2026-08-06T22:47:34.982177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:34.962870Z","title":"A proposed set of communicative gestures for human robot interaction and an RGB image-based gesture recognizer implemented in ROS,","venue":null,"work_id":"6ade3720-8cbc-4ca3-aae6-12b52750a4a0","year":2022},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-09T22:12:28.186498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.354122Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:a92ae08f325ca828664f8729a7c9e4f2451fedb41edf5ab3e4400943c485fde9","observation_id":"ac32afb2-59f7-47b2-afb8-4e4c2b41ef03","resolution":{"observed_at":"2026-08-06T22:47:34.967616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:34.947408Z","title":"Skeleton-based action and gesture recognition for human-robot collaboration,","venue":null,"work_id":"a2d67919-d8a8-43e7-863e-775c10d15a78","year":2023},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-09T22:12:28.186498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.359113Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:16564560c117d344c891fc79319895bc166fe943f9462866f42c12115e4772c3","observation_id":"3abb77d3-388f-4912-9009-bd78ffebcb8d","resolution":{"observed_at":"2026-08-06T22:47:34.952193Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:34.932890Z","title":"Recognizing actions by shape- motion prototype trees,","venue":null,"work_id":"cb9faea7-e5dd-4972-ba63-e3fa6d2e4856","year":2009},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-09T22:12:28.186498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.364376Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:3e384c7dd7f9270970801824deee0daf072202e7469a92591f4464ae3ae9a60e","observation_id":"8e122873-a551-476d-b58c-ecc45ff5b8e2","resolution":{"observed_at":"2026-08-06T22:47:34.937353Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:34.916535Z","title":"Fast gesture recognition with multiple stream discrete HMMs on 3D skeletons,","venue":null,"work_id":"ceef1b74-ac28-43cd-b919-4c91a65b06bd","year":2016},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-09T22:12:28.186498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.369733Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:d20ccbc31da95f80f45ba822dbea96b851649392d2f2e13a35dbbdaa3ce3029f","observation_id":"a8975777-5710-4c32-ae6e-6383083a1213","resolution":{"observed_at":"2026-08-06T22:47:34.922092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:34.900136Z","title":"A full-body gesture database for automatic gesture recognition,","venue":null,"work_id":"a667c292-dba1-4d0e-891f-34c6fe4b1158","year":2006},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-09T22:12:28.186498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.375542Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:0cdda1e4c3a5760cd1d7287c83d67798dc2f2de410ab6cf40f2f7163769b4661","observation_id":"cb828371-08cd-4aad-a15e-7e3b16941824","resolution":{"observed_at":"2026-08-06T22:47:34.904945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:34.884087Z","title":"Towards controlling mobile robot using upper human body gesture based on convolutional neural network,","venue":null,"work_id":"a306aeee-9ae1-4b39-b3e3-7f398d195503","year":2023},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-09T22:12:28.186498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.380576Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:adbe13231964db4caac642d421a4e20dc46968d904856c30c4817871463aafd8","observation_id":"c42f95e3-2662-418e-8acf-6a2368d1c3ee","resolution":{"observed_at":"2026-08-06T22:47:34.888881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:34.867900Z","title":"Self-feedback DETR for temporal action detection,","venue":null,"work_id":"e9fc7fd7-82e6-41e1-9f9a-6eca40c88519","year":2023},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-09T22:12:28.186498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.385734Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:70e1be63538cd5dfd23c3ac6b5403546090cbb91908d6d3ea12f741ea1d7438c","observation_id":"4bac6635-313a-420c-b474-1e9a1dc1d760","resolution":{"observed_at":"2026-08-06T22:47:34.873280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:34.851350Z","title":"Cross-modal learning with 3D deformable attention for action recognition,","venue":null,"work_id":"71786201-b0ea-4b2f-af13-3cf45c228cd9","year":2023},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-09T22:12:28.186498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.391589Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:da266d021b23e419bf64bd119f78e7d6a6c81e8b181cc9166c984aa3cc9c60da","observation_id":"4c2051cb-67cb-49cb-9391-fa93773ad4e2","resolution":{"observed_at":"2026-08-06T22:47:34.856474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:34.835050Z","title":"Zero-shot action recogni- tion in videos: A survey,","venue":null,"work_id":"b0ffd0d9-e6cd-41dd-8992-677c033cf7c7","year":2021},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-09T22:12:28.186498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.396256Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:2060c0a89a2158e05b15f0070ab9333a954e178e39ac1f95413c17573692e400","observation_id":"87a6f8ba-3dc3-46bf-b81c-96e4308f2a61","resolution":{"observed_at":"2026-08-06T22:47:34.839879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:34.817193Z","title":"Foundation model and temporal priors-guided trans- ductive few-shot action recognition,","venue":null,"work_id":"aedbb7a9-c370-45c3-9518-c9afabbef214","year":2025},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-09T22:12:28.186498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.400974Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:682ddc08cc05e6039642f0a276ddf90e4cd6dce3317382cdbe3b40d8f86f8926","observation_id":"ea6f2901-632f-430f-8abf-77ddc6242010","resolution":{"observed_at":"2026-08-06T22:47:34.822677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10125","last_updated":"2023-10-16T07:08:39Z","snapshot_observed_at":"2026-07-06T16:33:34.184498Z","submitted_at":"2023-10-16T07:08:39Z","title":"Few-shot Action Recognition with Captioning Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10125","snapshot_observed_at":"2026-08-06T22:47:34.406553Z","title":"Few-shot action recognition with captioning foundation models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-09T22:12:28.186498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.406553Z"},"links":{"cited_paper":"/paper/2310.10125","citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:a57de987c5e77382d0461a250add37869561e688cffdb8f7ffac77153aa636fb","observation_id":"979f49a6-982a-44ab-87c1-065bde4323a8","resolution":{"observed_at":"2026-08-06T22:47:34.406553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:34.799759Z","title":"An evaluation of large pre-trained models for gesture recognition using synthetic videos,","venue":null,"work_id":"d9875588-edba-4886-af7a-4f68841b7390","year":2024},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-09T22:12:28.186498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.412765Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:f1932f4b2775eb3dbed83e4a9bc142dbbec33551e701e9587a7893834331245d","observation_id":"0ebb0d85-1253-4463-b274-983251aadb4f","resolution":{"observed_at":"2026-08-06T22:47:34.804575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:34.783080Z","title":"motpy – simple multi object tracking library,","venue":null,"work_id":"03870b05-1991-470e-81b6-609bf7adb915","year":2021},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-09T22:12:28.186498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.418521Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:a61c5a838cfce8e18734b14ec89a2e249ceaad364cbac1fb66cc908ce473bfa2","observation_id":"2fd1c87e-3555-49bb-9d1f-95391ffaca98","resolution":{"observed_at":"2026-08-06T22:47:34.788556Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:34.766985Z","title":"NTU RGB+D 120: A large-scale benchmark for 3D human activity understanding,","venue":null,"work_id":"09461a22-f8af-40af-95ed-f8a1f1b12be9","year":2020},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-09T22:12:28.186498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.425194Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:1cca982edb313201968452aac39001d0065e088c8acd4b37bd5b23d9b6b45c2c","observation_id":"a3403f9f-f524-4b28-94de-1591048e5b99","resolution":{"observed_at":"2026-08-06T22:47:34.771845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:34.749788Z","title":"DeGCN: Deformable graph convolutional net- works for skeleton-based action recognition,","venue":null,"work_id":"67e8464f-96fa-4749-a0d6-4335ed41465d","year":2024},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-09T22:12:28.186498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.430999Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:378b00d54eefa97fac449939875ce52e0796df929376cff6f30eebc45b4e2b36","observation_id":"b673f224-615e-4016-9b0a-825f683ac416","resolution":{"observed_at":"2026-08-06T22:47:34.755000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:34.726242Z","title":"An image is worth 16x16 words: Transform- ers for image recognition at scale,","venue":null,"work_id":"7be03d24-ad11-44e2-8c90-195ba3012c36","year":2021},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-09T22:12:28.186498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.436642Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:b10af526fbbcc26b4b15266bcac83845949552f74e28715e6e017cd4c1c1fc2e","observation_id":"95486799-7c33-4432-8444-9ef4b158f1a7","resolution":{"observed_at":"2026-08-06T22:47:34.732595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:34.706532Z","title":"A comprehensive review of YOLO architectures in computer vision: From YOLOv1 to YOLOv8 and YOLO-NAS,","venue":null,"work_id":"8c00a478-76a5-478b-ab64-a33a7159a0d1","year":2023},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-09T22:12:28.186498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.443251Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:5ee30efe143b62fdc899e299c782f398fd05991e40da51f0d03808435b03a54a","observation_id":"ce3c6c03-a770-4e3b-8098-eeece54c8379","resolution":{"observed_at":"2026-08-06T22:47:34.712481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:34.689616Z","title":"Mask R-CNN,","venue":null,"work_id":"319ba2d8-66a4-4c4c-874f-b31055c39779","year":2017},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-09T22:12:28.186498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.449123Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:5ef47a3b71dbdc20c4e88243e5cbf15e21150809d3a2dbbf7b45a15ddb48970e","observation_id":"41549042-a334-4da0-a101-2209ee975848","resolution":{"observed_at":"2026-08-06T22:47:34.694767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:35.447682Z","title":"Revisiting feature prediction for learning visual representations from video,","venue":null,"work_id":"21e036c2-d163-40b8-ada3-cf2737cd85d2","year":2024},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-09T22:12:28.186498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.455154Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:84d9437837ce87cc1c1ab8516b16d6d506f34c866bac28c15ce58e01e85d5689","observation_id":"4130f14f-5326-4a80-9fb3-3acf11f9cfa1","resolution":{"observed_at":"2026-08-06T22:47:35.452383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:34.670057Z","title":"Video-MME: The first-ever comprehensive evaluation benchmark of multi-modal LLMs in video analysis,","venue":null,"work_id":"3678a20b-a05c-4c70-88da-5596e5b69d69","year":2025},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-09T22:12:28.186498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.464140Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:53c7fd32aa9ba3ab129af1e9787b8e561a40f42fb0a725160cc9f196dca33003","observation_id":"56cbf492-f6af-4605-940f-70fb17cc15d1","resolution":{"observed_at":"2026-08-06T22:47:34.676310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:34.649422Z","title":"Mistral 7B,","venue":null,"work_id":"58fc656f-1376-4fb6-a1df-01231db6c612","year":2023},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-09T22:12:28.186498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.470001Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:484b1475ac4f265900c04c8357911878950828ac4d23799b45e64ead52cdc73f","observation_id":"7a37d2ec-08ec-4894-8c94-9cd885153725","resolution":{"observed_at":"2026-08-06T22:47:34.654857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:34.631500Z","title":"3D human pose estimation in video with temporal convolutions and semi-supervised training,","venue":null,"work_id":"2a37a611-9ce6-4d28-9875-4b4bc6bd59e3","year":2019},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-09T22:12:28.186498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.476382Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:cd6662797d80a2a03bd12345cd6cf7c6680fc7dfff0f11e986080c01f5ae1d42","observation_id":"c56fc7a1-a5e0-41ba-ab39-f401ab6dd02e","resolution":{"observed_at":"2026-08-06T22:47:34.636984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T22:12:28.186498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?"},"reference_resolution":{"displayed":67,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":4,"verified_exact":1,"verified_fuzzy":62},"total_outbound_references":67},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 67 of 67 outbound references and 0 inbound Pith citation observations for arXiv:2506.20795."}