{"as_of":"2026-08-10T13:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3e436a246209194c81809a956c3ee3f2e3024561afca785d0c30576a184e2440","coverage":[{"denominator":69,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":69,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:31:09.024782Z","state":"measured"},{"denominator":69,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":69,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.13897/citation-record","integrity":"/paper/2506.13897/integrity","json":"/paper/2506.13897/citation-record.json","paper":"/paper/2506.13897"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:16.839825Z","title":"Simultaneous real-time human fall detection and reidentification based on multisensors data","venue":null,"work_id":"d07b5b51-bc1e-4bb2-bf7f-0a1705efa8f3","year":2022},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-10T12:09:19.386600Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.745519Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:83364715e81b7ca19d61d8c800577c015e54b840d72215de7d4543a6afea36dc","observation_id":"e40b5885-8f90-4c8e-ae2e-04ffd770125f","resolution":{"observed_at":"2026-08-07T00:31:16.917355Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:16.676249Z","title":"A cross- dataset study for text-based 3d human motion retrieval","venue":null,"work_id":"9deabb2b-22a0-4b00-98f8-cb8ac9b9a169","year":1932},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-10T12:09:19.386600Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.749961Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:0e209a428fe889e9d47e91c3bf0176d41b3964f56b532060fad09cede0044bb0","observation_id":"cb1b9546-9b5f-42f2-bd44-c7ea1a761fcd","resolution":{"observed_at":"2026-08-07T00:31:16.726798Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:08.753498Z","title":"Is space-time attention all you need for video understanding? In ICML, page 4, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-10T12:09:19.386600Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.753498Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:c2780097bdea07343b03686664e5a94e4199c3efdf47f7ba4dbc4568922112ad","observation_id":"ccb862aa-7aeb-407c-8312-f5261f48da61","resolution":{"observed_at":"2026-08-07T00:31:08.753498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:16.493926Z","title":"Vitag: Online wifi fine time measurements aided vision-motion identity association in multi-person environ- ments","venue":null,"work_id":"17edaf0e-c3cf-4d34-b638-47b2cd0c49e3","year":2022},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-10T12:09:19.386600Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.757425Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:66ede8af40af2e68665e2065f5e2ef7d4a2f202d28585720895656efc2b290a1","observation_id":"7857f5a2-0ed6-49e6-b3ad-390dea2ad75e","resolution":{"observed_at":"2026-08-07T00:31:16.578801Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:08.761542Z","title":"Quo vadis, action recognition? a new model and the kinetics dataset","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-10T12:09:19.386600Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.761542Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:ea0db865fa1226826bea46333517abc1c7edba6fb3ebb3e8b1077cac5054050d","observation_id":"f6d5f471-2dbc-4cff-86c0-a9342e308acf","resolution":{"observed_at":"2026-08-07T00:31:08.761542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:08.765338Z","title":"A simple framework for contrastive learning of visual representations","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-10T12:09:19.386600Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.765338Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:61fc89a50d76d94a5c1a67d36aa1d730d82f895028b1fe52a683b3c33d9eef60","observation_id":"317164f3-ea84-4cd7-a9fc-3c9c16bff0c7","resolution":{"observed_at":"2026-08-07T00:31:08.765338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.09444","last_updated":"2025-06-04T14:03:14Z","snapshot_observed_at":"2026-08-10T04:19:49.557942Z","submitted_at":"2024-09-14T14:11:45Z","title":"KAN-HyperpointNet for Point Cloud Sequence-Based 3D Human Action Recognition","version":2},"cited_work":{"arxiv_id":"2409.09444","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.09444","snapshot_observed_at":"2026-08-07T00:31:09.197145Z","title":"KAN-HyperpointNet for Point Cloud Sequence-Based 3D Human Action Recognition","venue":"cs.CV","work_id":"e7617033-24ec-4d1d-bde7-f208ac080d47","year":2024},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-10T12:09:19.386600Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.770398Z"},"links":{"cited_paper":"/paper/2409.09444","citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:e2c9f6c89da80fd6fb13c01395e5d6c41539ea6b8645c0e078ec5e411f270f9e","observation_id":"9893f43e-4aec-4b0d-bf65-849823a9fdde","resolution":{"observed_at":"2026-08-07T00:31:09.232273Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17777","last_updated":"2025-03-21T10:51:22Z","snapshot_observed_at":"2026-08-03T04:15:44.371388Z","submitted_at":"2024-07-25T05:10:48Z","title":"Babel: A Scalable Pre-trained Model for Multi-Modal Sensing via Expandable Modality Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.17777","snapshot_observed_at":"2026-08-07T00:31:08.775111Z","title":"Advancing multi-modal sens- ing through expandable modality alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-10T12:09:19.386600Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.775111Z"},"links":{"cited_paper":"/paper/2407.17777","citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:13822711cdf530f327ddef76763edcc28064224da4ccc57db8cfd187a368a9f4","observation_id":"b994d7e2-0285-4f50-b2c9-e18055e6677a","resolution":{"observed_at":"2026-08-07T00:31:08.775111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:08.779587Z","title":"Bert: Pre-training of deep bidirectional trans- formers for language understanding","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-10T12:09:19.386600Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.779587Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:dc00b5786619c7739a5be45f0553304289c6fcc472054cc8e33be0c34cc7dd00","observation_id":"4e14b556-94af-4947-94f4-6c9613900153","resolution":{"observed_at":"2026-08-07T00:31:08.779587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:16.300121Z","title":"Point 4d trans- former networks for spatio-temporal modeling in point cloud videos","venue":null,"work_id":"e0360fc1-121a-4efa-8bfa-351bde43db99","year":null},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-10T12:09:19.386600Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.783290Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:b84982130ac3d2d1e2b0b70802313ddd3ee2dc5e4e92ce8731f99d96864d4eb1","observation_id":"11d1f515-adef-44ea-a6f8-1d7ebb777918","resolution":{"observed_at":"2026-08-07T00:31:16.384357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:16.158997Z","title":"Pstnet: Point spatio-temporal convolution on point cloud sequences","venue":null,"work_id":"d9536183-bb23-4402-9928-9fbaf7712b63","year":2021},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-10T12:09:19.386600Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.787631Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:f2f0eaa637f5497da23625ff5f1693bbd8915beb5371f9864a36eaba617ea9f6","observation_id":"3639fdab-a366-4a27-9302-589313b63c21","resolution":{"observed_at":"2026-08-07T00:31:16.209325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:15.976824Z","title":"Deep hierarchical representation of point cloud videos via spatio-temporal decomposition","venue":null,"work_id":"ccabad07-967a-45d0-a295-94c7005347df","year":null},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-10T12:09:19.386600Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.791793Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:76059de0a2a2e3a1819d96c520e2541f4bc84455a309337b9caa40a49958c5d3","observation_id":"ea2838ba-706d-49d6-8b41-eff9ea2f5c48","resolution":{"observed_at":"2026-08-07T00:31:16.065265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:15.761398Z","title":"Point spatio- temporal transformer networks for point cloud video mod- eling","venue":null,"work_id":"15bf3e6c-2f22-4a59-a86a-c1cc3648c050","year":2022},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-10T12:09:19.386600Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.795650Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:0e9f3e761896b74fb7419ace4cccbbe17f42d0350b9bc5932f7e13bc9cac6478","observation_id":"c0e91862-063d-4389-9d14-7da0f486430c","resolution":{"observed_at":"2026-08-07T00:31:15.889533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:15.621440Z","title":"Slowfast networks for video recognition","venue":null,"work_id":"862cc05e-247c-40ab-b0e7-eb3a06faa553","year":2019},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-10T12:09:19.386600Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.799223Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:99f09be24fc42a8c091e9c2848dec0291169aaeff35c0b30e9e22910d3459c4f","observation_id":"f7d346b0-3960-4b4c-a8b6-2bfbd4649711","resolution":{"observed_at":"2026-08-07T00:31:15.702694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:15.465972Z","title":"Imagebind: One embedding space to bind them all","venue":null,"work_id":"9a0a8218-07d9-4e59-9c63-5bb6318ac177","year":2023},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-10T12:09:19.386600Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.802994Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:153cfbd083f9a7d2ba5291ddec4ea8e1ced5ee8296ae8264249a9e61fb406593","observation_id":"98e1ccaa-1ae5-4b61-9c71-ba9ca51b8cf8","resolution":{"observed_at":"2026-08-07T00:31:15.538115Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:15.360081Z","title":"Generating diverse and natural 3d human motions from text","venue":null,"work_id":"dadb28ea-523d-4588-aa1f-cbd97ea2e1d2","year":2022},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-10T12:09:19.386600Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.806915Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:0d076e262967592de865ce544dc8f4a43b44a3d1fb4abaaeca7fb414e842bc2e","observation_id":"471f20fc-b2c4-45fd-bae3-351aa9ef2da0","resolution":{"observed_at":"2026-08-07T00:31:15.409615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:15.223473Z","title":"Separating the” chirp” from the” chat”: Self-supervised visual grounding of sound and language","venue":null,"work_id":"df6764ee-0ec9-4033-93f2-21c27ba927d0","year":2024},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-10T12:09:19.386600Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.810412Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:a4ed418ba96ecd2ac1f31186eff5ea498b62789dc9f14ebfcd35cdc0266ba66e","observation_id":"176ec9fb-7a16-489e-92d8-6114e597e6e8","resolution":{"observed_at":"2026-08-07T00:31:15.274867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:15.068774Z","title":"Masked motion prediction with semantic contrast for point cloud sequence learning","venue":null,"work_id":"7e8fe5d2-707f-4319-acc2-0f95afff55fb","year":2024},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-10T12:09:19.386600Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.816042Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:14fbae551d7d2d5561519352bf1e74eecccdd87b059bf7556c4ae72b29e74f67","observation_id":"972b00cd-e693-4015-8170-6330b22c24aa","resolution":{"observed_at":"2026-08-07T00:31:15.146605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:14.912475Z","title":"Long short-term memory","venue":null,"work_id":"9d0e994c-1486-41ca-a3d4-290222707870","year":1997},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-10T12:09:19.386600Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.819626Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:bcf519f718512e006b7a0f7c3a9eeefa53aeed4d959d3de8a8c59df52766213f","observation_id":"25764052-192c-4c02-9668-ba8ddf8acdf6","resolution":{"observed_at":"2026-08-07T00:31:14.988206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:14.759280Z","title":"Wifi and vision-integrated fingerprint for smartphone-based self-localization in public indoor scenes","venue":null,"work_id":"dfd0751a-9001-48b0-b6e8-fbfb1e4ccd62","year":2020},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-10T12:09:19.386600Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.823235Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:b35996dcc1d517bc05fcbd595243d434497e9d96b6a958e1bd32346e75e4d039","observation_id":"430c6257-3d1c-4f7a-947c-186503ae3914","resolution":{"observed_at":"2026-08-07T00:31:14.841811Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:14.622701Z","title":"Deep iner- tial poser: Learning to reconstruct human pose from sparse inertial measurements in real time","venue":null,"work_id":"6706d21a-2eda-474c-bc57-a7955420d4e5","year":2018},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-10T12:09:19.386600Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.826710Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:d5433e0088190189f308e8428621e2d4a36c8bb3b87e007f302c9e3c0448ee2d","observation_id":"d949d751-7c6d-4df1-b3f7-c820a2d32667","resolution":{"observed_at":"2026-08-07T00:31:14.682984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-07T00:31:08.831075Z","title":"Adam: A method for stochastic optimization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-10T12:09:19.386600Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.831075Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:4ba9a44315d9b411566c8eee153ab282ba31ce1a2131cb2eb696e35ba7f0f54d","observation_id":"3d5fcfc7-8abd-44f1-9e18-81514c18d16d","resolution":{"observed_at":"2026-08-07T00:31:08.831075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:14.523456Z","title":"Coopera- tive learning of audio and video models from self-supervised synchronization","venue":null,"work_id":"cb11e830-6487-4c7b-8a26-79e343cf3c99","year":2018},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-10T12:09:19.386600Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.836753Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:5107311967d776b45464ce3d2e5218e104ea2fc7340140a1710b343aa57f61df","observation_id":"25ed570d-eb36-4629-86e5-eab2672e0a65","resolution":{"observed_at":"2026-08-07T00:31:14.573457Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:14.403858Z","title":"Li- darcap: Long-range marker-less 3d human motion capture with lidar point clouds","venue":null,"work_id":"dc363a56-da97-412f-8184-471fa13680cf","year":2022},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-10T12:09:19.386600Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.840736Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:17038f9dbae47314086cf034f4531c50b8bb5c910c6988bc0715dc18a6ced6a3","observation_id":"7e2d25af-f34c-4a89-a12f-c1e661940c4b","resolution":{"observed_at":"2026-08-07T00:31:14.469948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.04676","last_updated":"2022-02-08T16:36:12Z","snapshot_observed_at":"2026-08-04T03:00:58.368363Z","submitted_at":"2022-01-12T20:02:32Z","title":"UniFormer: Unified Transformer for Efficient Spatiotemporal Representation Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.04676","snapshot_observed_at":"2026-08-07T00:31:08.844410Z","title":"Uniformer: Unified transformer for efficient spatiotemporal representation learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-10T12:09:19.386600Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.844410Z"},"links":{"cited_paper":"/paper/2201.04676","citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:004f0cb8d13f22507bcbc8d850d2064a0fd1e860d2acbe66e0ecd98dcf3d1b2b","observation_id":"4fe86579-9172-4095-bf33-09a8c94ee86e","resolution":{"observed_at":"2026-08-07T00:31:08.844410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:14.274163Z","title":"Ai choreographer: Music conditioned 3d dance generation with aist++","venue":null,"work_id":"3b76bd56-dc49-4753-9de2-4e07bcf8a8e1","year":2021},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-10T12:09:19.386600Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.848814Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:c0a9d7742482e9b0e24aa7f0be40af55580401d66358338e03b2d169f32ceee9","observation_id":"54d393a1-e991-40cc-ab2e-8a80705c9c40","resolution":{"observed_at":"2026-08-07T00:31:14.330184Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:14.200030Z","title":"Action recognition based on a bag of 3d points","venue":null,"work_id":"81d56a78-59eb-426a-accd-0e349a3bba57","year":2010},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-10T12:09:19.386600Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.852450Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:8721d43b3c4fcc9035f43b0d78e297686fd5d0905a6e6ced46cb5c7e323f0ba6","observation_id":"388fb97f-ebb6-4315-825f-6ad44bcb4b56","resolution":{"observed_at":"2026-08-07T00:31:14.230699Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:14.073804Z","title":"En- hancing person identification for smart cities: Fusion of video surveillance and wearable device data based on ma- chine learning","venue":null,"work_id":"7676ac39-cb94-4767-891c-38d5f99c2d8e","year":2024},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-10T12:09:19.386600Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.856458Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:09c39b8b015ffa450050030e58705c023db8ee93c216a82e5c831e333d1a35d3","observation_id":"bdac9ea9-e02b-4498-bd4a-31645b9e196c","resolution":{"observed_at":"2026-08-07T00:31:14.127651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:13.971944Z","title":"Hm- pear: A dataset for human pose estimation and action recog- nition","venue":null,"work_id":"405bccf6-4b5b-4c80-bfd6-c625a2028320","year":2024},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-10T12:09:19.386600Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.860337Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:a3e46d9f4510b0727ce043ba4c6c558125b63775c6dd5bb423d053864f9bfe79","observation_id":"3bf09b9f-2b26-4fd8-8f42-fc999411e5ac","resolution":{"observed_at":"2026-08-07T00:31:14.035557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:13.881253Z","title":"Ntu rgb+d 120: A large- scale benchmark for 3d human activity understanding","venue":null,"work_id":"17cd882b-787e-4fa0-984b-aecbd922d944","year":2020},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-10T12:09:19.386600Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.864134Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:d0184bf553bc1d8eeebea199b52f59c1eb9d3b43074405c2d6e2e2e3360da743","observation_id":"b1e4050d-2620-46ab-9ac8-77005921729c","resolution":{"observed_at":"2026-08-07T00:31:13.906173Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14338","last_updated":"2025-02-27T02:34:16Z","snapshot_observed_at":"2026-08-09T18:30:50.564737Z","submitted_at":"2024-05-23T09:08:09Z","title":"MAMBA4D: Efficient Long-Sequence Point Cloud Video Understanding with Disentangled Spatial-Temporal State Space Models","version":3},"cited_work":{"arxiv_id":"2405.14338","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.14338","snapshot_observed_at":"2026-08-07T00:31:09.118254Z","title":"MAMBA4D: Efficient Long-Sequence Point Cloud Video Understanding with Disentangled Spatial-Temporal State Space Models","venue":"cs.CV","work_id":"5f449edb-f970-42fb-a863-1a3fcd0d942e","year":2024},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-10T12:09:19.386600Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.867539Z"},"links":{"cited_paper":"/paper/2405.14338","citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:f5cccf27e0334f469ceea5bcc1945e3e01dcac694067da3162d738240c616fe4","observation_id":"91aeb408-0e6d-46e5-ae50-4e735c24bf48","resolution":{"observed_at":"2026-08-07T00:31:09.135085Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:13.750378Z","title":"Meteor- net: Deep learning on dynamic 3d point cloud sequences","venue":null,"work_id":"19a12437-cfbc-42f6-afd8-d4bf4592014f","year":2019},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-10T12:09:19.386600Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.872585Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:6690b1255701d3156f569d56a48f8e5219a12e8f56297e678898cde2050e8ac2","observation_id":"f4da2ec3-786e-4f47-8f54-f81a0472209b","resolution":{"observed_at":"2026-08-07T00:31:13.815197Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:13.628433Z","title":"Leaf: Learning frames for 4d point cloud sequence un- derstanding","venue":null,"work_id":"50650741-28e7-4af4-ba4f-c1c15855a58d","year":2023},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-10T12:09:19.386600Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.876508Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:7ad8a68104ae0a7b32150aafebfe18649f92a8370adb5900821661f157e076b5","observation_id":"16919bed-1ad0-4da7-bdcb-1e94e247394d","resolution":{"observed_at":"2026-08-07T00:31:13.691254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:08.880755Z","title":"Smpl: A skinned multi- person linear model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-10T12:09:19.386600Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.880755Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:7ac408bbb5c629d5f982af6e61c245bc1e2911b96687600514190b54c18caf35","observation_id":"f413bed6-0d9d-4763-b1d1-a7b08319a49c","resolution":{"observed_at":"2026-08-07T00:31:08.880755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:13.478905Z","title":"Cross- modal contrastive pre-training for few-shot skeleton action recognition","venue":null,"work_id":"f5005bc7-1c1d-4f3f-b7a6-5b830badf29e","year":2024},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-10T12:09:19.386600Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.885251Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:e9df17eec04320c2da9c2056a315ab1a9da1ce2a83cc0b08ed751064c610fa39","observation_id":"c21cf3f7-0599-4ebe-8f74-984d17d7fc68","resolution":{"observed_at":"2026-08-07T00:31:13.560080Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:13.368196Z","title":"Troje, Ger- ard Pons-Moll, and Michael J","venue":null,"work_id":"dfcf7504-a828-48f1-9a94-155d1c1fd7ff","year":2019},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-10T12:09:19.386600Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.889185Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:7b0ab203e6665b8c7bb352bb57e15694ab73fe08c5ff1e7533b54d6ea67eff98","observation_id":"bb8e5ad6-9ac2-410e-8aef-c2bcb568aa2c","resolution":{"observed_at":"2026-08-07T00:31:13.410458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:13.234436Z","title":"Who goes there? exploiting silhouettes and wearable signals for subject identification in multi-person environments","venue":null,"work_id":"3bb4643b-e84b-4ea4-b237-6bb9535328e5","year":2019},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-10T12:09:19.386600Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.893337Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:fe2a1e0cf006eec0499b77a50f9cb91e4dd12a153133fb71868773de78e97884","observation_id":"8b8092cf-8acc-49ed-8632-1824152f945e","resolution":{"observed_at":"2026-08-07T00:31:13.304107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:13.023772Z","title":"Person re-id by fusion of video silhouettes and wearable signals for home monitoring appli- cations","venue":null,"work_id":"1dbc5b20-fa58-464a-adf0-8bd3443ce1df","year":2020},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-10T12:09:19.386600Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.896816Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:a90afc009c5f1a5b40fea61614e5cf5affebc19292053369d80b4b89f296e36c","observation_id":"29f9ce24-39da-409c-97a1-73e9032fb30b","resolution":{"observed_at":"2026-08-07T00:31:13.110013Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:12.874698Z","title":"Imu2clip: Language-grounded motion sensor translation with multi- modal contrastive learning","venue":null,"work_id":"a9368593-435b-41ba-a885-95f9ce9445a2","year":2023},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-10T12:09:19.386600Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.901052Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:6bb476e1d5be4822894d216cba0bc04e00a77a0dc3ca91bb7a3e0f01c3c503ff","observation_id":"855475b5-cd27-49f0-9b92-a31eebaa2e19","resolution":{"observed_at":"2026-08-07T00:31:12.931028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:12.729105Z","title":"Person tracking by fusing pos- ture data from uav video and wearable sensors.IEEE Sensors Journal, 22(24):24150–24160, 2022","venue":null,"work_id":"bc397cc1-6fe5-482c-92d8-3e7e396e2aab","year":2022},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-10T12:09:19.386600Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.905441Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:bc84b6f57978c11f6b3a6ef8a55e2136d2f27ae475d88a5071deab75b837967f","observation_id":"182efc78-bb05-458e-8db7-3a73b936b476","resolution":{"observed_at":"2026-08-07T00:31:12.782062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-07-06T06:49:24.960992Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-07T00:31:08.909243Z","title":"Repre- sentation learning with contrastive predictive coding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-10T12:09:19.386600Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.909243Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:1c511b4b674206d4dc42778f997ef4e0b0613635ca47ded5cc501f56766bde6a","observation_id":"e3cd2888-a3cf-4882-9be9-7adad9f8d7e4","resolution":{"observed_at":"2026-08-07T00:31:08.909243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-09T18:02:17.307812Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-07T00:31:08.913260Z","title":"Dinov2: Learning robust visual features without supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-10T12:09:19.386600Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.913260Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:b8a51658d4d2c754858d90c2e165d10a8b8441bcc8aabfe087d5369d0b27858b","observation_id":"b53cc4b3-b2b0-49bd-aed4-1f0ceb62e16e","resolution":{"observed_at":"2026-08-07T00:31:08.913260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:12.570676Z","title":"Action- conditioned 3d human motion synthesis with transformer vae","venue":null,"work_id":"d64eb18a-76a4-4066-a81c-54e8ec7eaa00","year":2021},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-10T12:09:19.386600Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.917169Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:b9f44712592cd3902454fa784f5f12262117e2ca6ce13069ccdb75a5b06a60d7","observation_id":"9843b6ac-3117-4951-a806-26c5c1cbb022","resolution":{"observed_at":"2026-08-07T00:31:12.636838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:12.450080Z","title":"Tmr: Text-to-motion retrieval using contrastive 3d human motion synthesis","venue":null,"work_id":"eb4c47e3-30df-47d8-9997-2088646d906b","year":2023},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-10T12:09:19.386600Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.920728Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:cb766b230ca06a42693d8a47448dc65fdbc3f0686319fa8108c819c5518dba8e","observation_id":"802c7b84-a169-4247-9658-eda5b2b45bdd","resolution":{"observed_at":"2026-08-07T00:31:12.496680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:12.305372Z","title":"Punnakkal, Arjun Chandrasekaran, Nikos Athanasiou, Alejandra Quiros-Ramirez, and Michael J","venue":null,"work_id":"22980ea2-9fb1-4673-83aa-379aab08065d","year":2021},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-10T12:09:19.386600Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.924836Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:d6e3a13d47438e5d6779cba72938ea44bef8612598ee21076cb1d8fd5e0ec8d5","observation_id":"ce9d47ee-431b-47db-9214-643b9b00837a","resolution":{"observed_at":"2026-08-07T00:31:12.378433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:12.146171Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":"1169dc1f-723a-4ab8-bb56-801be39e6d56","year":2021},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-10T12:09:19.386600Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.928710Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:9f21212dbc52ea02f29e04c516e753cb993d4cb0d60daab15ee6492dcc685d18","observation_id":"a41b6222-5da6-4c7d-b269-c6625e049938","resolution":{"observed_at":"2026-08-07T00:31:12.227504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-07T00:31:08.933258Z","title":"Sam 2: Segment anything in images and videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-10T12:09:19.386600Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.933258Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:56fe49c624285fff4d1dc23432cd8bf4310d7c4f2116b005e35f276cfb8d6e92","observation_id":"8fa55423-ef43-42f1-9917-3d543fd23bae","resolution":{"observed_at":"2026-08-07T00:31:08.933258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:11.997325Z","title":"Lidar-aid inertial poser: Large-scale human motion capture by sparse inertial and lidar sensors","venue":null,"work_id":"204ae7aa-d32e-432b-9989-e9b7db1c1cd6","year":2023},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-10T12:09:19.386600Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.937089Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:177e638003254cccaa07ece1dc3fc481a539268a5c295a0429919ba89ee26f95","observation_id":"d287306d-e8d7-4160-97ca-6fb274da0f01","resolution":{"observed_at":"2026-08-07T00:31:12.055781Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-04T02:05:40.539691Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-07T00:31:08.940795Z","title":"An overview of gradient descent optimiza- tion algorithms","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-10T12:09:19.386600Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.940795Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:87ade4a53a041bee43d9187b1b3bb36bfe58778827c6355cb55f47b2f3c24fef","observation_id":"a3c33b8f-facc-4c9a-95b9-c42faf3019ed","resolution":{"observed_at":"2026-08-07T00:31:08.940795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:11.794207Z","title":"Ntu rgb+d: A large scale dataset for 3d human activity anal- ysis","venue":null,"work_id":"90c81e08-696c-4523-aac8-3b2b45594a36","year":2016},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-10T12:09:19.386600Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.944830Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:5589253268e97dc114f83a8b3735ca13b640ed8e7e3a5fc2a6965f5529a1f078","observation_id":"bda392e8-e92d-46ce-bff4-fdc1b1b5729c","resolution":{"observed_at":"2026-08-07T00:31:11.902001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:11.613701Z","title":"Masked spatio-temporal structure prediction for self- supervised learning on point cloud videos","venue":null,"work_id":"f1775a6e-55f1-4e1e-8abb-0c3dcdfbf0bd","year":2023},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-10T12:09:19.386600Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.948192Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:bcf1cceae8ec4270915962a773eaad1fa8065abc21f58aca67905bbf23d1b7cb","observation_id":"e957ef1f-3b81-4cb7-9d4a-2087db73a841","resolution":{"observed_at":"2026-08-07T00:31:11.723285Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:11.467492Z","title":"Pointcmp: Contrastive mask prediction for self-supervised learning on point cloud videos","venue":null,"work_id":"795d0795-b363-4603-a11b-258212ab9276","year":2023},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-10T12:09:19.386600Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.951850Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:260c6092737776d9cf93b097ca40ece77abd37dd4ab7c76ab797d863f8bb653c","observation_id":"a768ba02-9176-40da-a329-7b51aa24e330","resolution":{"observed_at":"2026-08-07T00:31:11.546078Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:11.296536Z","title":"Point contrastive predic- tion with semantic clustering for self-supervised learning on point cloud videos","venue":null,"work_id":"ec11d1c1-4f71-463c-9797-eb35678654a0","year":null},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-10T12:09:19.386600Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.955388Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:8f3c30f0d47e21f750e9477a38b095d91fa2d8049beb1ee64509d3869e6c32ec","observation_id":"aabc64b4-3e2f-4c10-8889-a0d1f198a6ce","resolution":{"observed_at":"2026-08-07T00:31:11.390322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:11.085919Z","title":"Motionclip: Exposing human motion generation to clip space","venue":null,"work_id":"0968a603-43c2-49b8-9503-27ae38c736bc","year":2022},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-10T12:09:19.386600Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.958995Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:63d58f8dc885c67ca913c55808259a3bc5c8f019b7fd3293cc09939df5e0a161","observation_id":"a7dc5e15-7ce6-40fa-8bdb-470d57807ef2","resolution":{"observed_at":"2026-08-07T00:31:11.201864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:10.877236Z","title":"Total capture: 3d human pose estimation fusing video and inertial sensors","venue":null,"work_id":"5fb0e582-0221-4fdf-9a60-71995f7f40ed","year":2017},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-10T12:09:19.386600Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.962562Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:fe3d9b23a68735fcee543cf78a08c99ba9a180bb4d825c04eff28a5fa862d127","observation_id":"8b5255a2-40d1-4526-9321-56307ca30e2b","resolution":{"observed_at":"2026-08-07T00:31:10.965041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:08.967112Z","title":"Visualizing data using t-sne","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-10T12:09:19.386600Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.967112Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:b1514d167272920cf3dc9d1c0011bf4f9ab3fb48307dd850af8d2db0be3c79db","observation_id":"ed5b9829-d6a4-45e4-b75a-6f11d877449a","resolution":{"observed_at":"2026-08-07T00:31:08.967112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:10.658675Z","title":"Recovering accurate 3d human pose in the wild using imus and a moving camera","venue":null,"work_id":"2115347c-8ee2-4a4d-8b50-aec4661e421c","year":2018},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-10T12:09:19.386600Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.971365Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:629a1f40a9715cdce95385b2a641e44361dbaf0bd6c159473696a197c8d063c4","observation_id":"3ae3d5f4-37a7-423d-9517-1e5cab01630f","resolution":{"observed_at":"2026-08-07T00:31:10.755122Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:10.483534Z","title":"Self-supervised 4d spatio-temporal feature learning via order prediction of sequential point cloud clips","venue":null,"work_id":"8019a9f3-eb7d-4d1e-b674-397222302176","year":2021},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-10T12:09:19.386600Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.974914Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:f3a67a60bcb5d0851807f810b9ac4c27f218c08d228a4d14855b2b9bc99cf207","observation_id":"05c0eb15-50a9-46b2-a542-faadb188872d","resolution":{"observed_at":"2026-08-07T00:31:10.561759Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:10.312181Z","title":"Pvnext: Rethinking network design and temporal motion for point cloud video recognition","venue":null,"work_id":"e60c0abf-b9f0-4332-b8c7-548b67d4a149","year":null},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-10T12:09:19.386600Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.978422Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:96cf9bb942f394de54b61d44fe3294a1b06b65e77a472f13948b83315b66a162","observation_id":"b35cdd34-dac4-4469-8af1-3b6a596fbf6b","resolution":{"observed_at":"2026-08-07T00:31:10.394401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:10.144448Z","title":"Point primitive transformer for long-term 4d point cloud video understanding","venue":null,"work_id":"62f10915-c260-4e5d-a9dc-8b136525bc85","year":2022},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-10T12:09:19.386600Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.982398Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:cd8febb6b972c40ddb51d460330519c9206d042b4f00eb343f98e4a7ca1d3d3c","observation_id":"7ba69fe9-0809-4a95-adb7-44735acaef33","resolution":{"observed_at":"2026-08-07T00:31:10.222205Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:09.950608Z","title":"Human-centric scene understanding for 3d large-scale scenarios","venue":null,"work_id":"37b8612c-0e9f-4fca-a39b-408970f288a5","year":2023},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-10T12:09:19.386600Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.986030Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:c3120431f9f3167069d39f9cd1f69306df7aae0ee04702547608d47177325503","observation_id":"7a512346-9433-45ec-94d8-7aefa1e106eb","resolution":{"observed_at":"2026-08-07T00:31:10.028929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:09.751249Z","title":"Mm-fi: Multi-modal non-intrusive 4d human dataset for versatile wireless sensing","venue":null,"work_id":"bb5d21cf-8f86-4951-99a2-6954dbba723e","year":2023},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-10T12:09:19.386600Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.989682Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:98f08889a502eb9426a3ce94fdf90ab5b86a84a112338e4251aae5afe7285bf2","observation_id":"e0f74892-80a7-4148-9250-9907b255ed79","resolution":{"observed_at":"2026-08-07T00:31:09.866753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:09.623835Z","title":"Tri- modal motion retrieval by learning a joint embedding space","venue":null,"work_id":"57248059-02b8-4a82-97cc-81b59e64fd73","year":2024},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-10T12:09:19.386600Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.993531Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:81bfa1f935a9f280ce46d6c82507389a0bbbfac2384f2b7a3aa90bfde687a196","observation_id":"7dabb82c-ae7d-4ca4-a85a-3be905d6798f","resolution":{"observed_at":"2026-08-07T00:31:09.692831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:09.501897Z","title":"Complete-to-partial 4d distillation for self-supervised point cloud sequence representation learning","venue":null,"work_id":"d4ae8009-6aa2-4e27-8fc9-bcc2731701d8","year":2023},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-10T12:09:19.386600Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.997412Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:dcb12495027202b255196a918354a06db77ff506692575e96c612b1a97cfb822","observation_id":"0b8af141-797f-4669-96ea-0936fe7809c4","resolution":{"observed_at":"2026-08-07T00:31:09.551420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:09.444398Z","title":"No pain, big gain: clas- sify dynamic point cloud sequences with static models by fitting feature-level space-time surfaces","venue":null,"work_id":"b9a63258-9a0a-49e8-ab25-1f0cc4a90376","year":2022},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-10T12:09:19.386600Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:09.001121Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:8eb58814e36cba0e1159d34be715048f4a54e37bb0bfb29998d76e6e6e302527","observation_id":"4e4bc05d-e3ae-47e6-ba25-fcb4919286b6","resolution":{"observed_at":"2026-08-07T00:31:09.461845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:09.417869Z","title":"dataset/sequencecategory/posesequence poses.npz","venue":null,"work_id":"fcdd70ed-f077-4728-9d90-f5cfa8c988da","year":null},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-10T12:09:19.386600Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:09.005187Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:7090b44d8103c4b088c1b72c05841ab96c8763b0b6e5ba4b8b764fc84d8f6323","observation_id":"3b1d518f-c12d-44d7-b421-df5e920c5981","resolution":{"observed_at":"2026-08-07T00:31:09.430191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:09.386217Z","title":null,"venue":null,"work_id":"6db44483-ab68-4f5f-845d-cf9db84e369a","year":null},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-10T12:09:19.386600Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:09.016794Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:ca15ecc2469bc133ed48e243cbd93eaf9cba674a7bfaa2b32b74c13941ad50e2","observation_id":"becb311d-8192-47c7-a5bd-6d35bc762cb3","resolution":{"observed_at":"2026-08-07T00:31:09.402965Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:09.342479Z","title":null,"venue":null,"work_id":"d59e5b7b-315b-4f6b-9523-0303c9379231","year":null},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-10T12:09:19.386600Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:09.020566Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:37fc485c0f1d9dfc88f0baacac1af6e80ce358de737c643da0a654ae71431173","observation_id":"060f64db-90a9-471b-809c-b2cc8c3e5a01","resolution":{"observed_at":"2026-08-07T00:31:09.367406Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:09.271035Z","title":"We ablate linear/non-linear probing and freezing or fine-tuning each model when train- ing for HAR on LIPD-Babel-v2","venue":null,"work_id":"95c0d29a-1f07-4c5e-bf6b-3c0744bfd558","year":null},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-10T12:09:19.386600Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:09.024782Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:e4af0ca294c9551f470ae3fca0fa7ffac2b3609c81336c296f109e0a77c2805c","observation_id":"efb3a3ce-382e-4079-9186-b321acf8b553","resolution":{"observed_at":"2026-08-07T00:31:09.291940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T12:09:19.386600Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding"},"reference_resolution":{"displayed":69,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":15,"verified_exact":2,"verified_fuzzy":52},"total_outbound_references":69},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 69 of 69 outbound references and 0 inbound Pith citation observations for arXiv:2506.13897."}