{"as_of":"2026-08-17T14:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0cf892f61517f60f9b4cde84736b5e6495a412ce612e25b54dbe8dd588b1f26b","coverage":[{"denominator":299,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T16:32:15.242242Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.13066/citation-record","integrity":"/paper/2501.13066/integrity","json":"/paper/2501.13066/citation-record.json","paper":"/paper/2501.13066"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:14.850201Z","title":"Human action recognition from various data modalities: A review","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-17T08:44:23.508409Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:14.850201Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:b8d9131bba5904a074b5a8623c3415df00110b29b000a157520e7b9266a7e2c6","observation_id":"8c15445e-ebad-4833-bdd4-10c89ad6aa10","resolution":{"observed_at":"2026-08-10T16:32:14.850201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:14.854842Z","title":"Human action recognition: A taxonomy-based survey, updates, and opportunities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-17T08:44:23.508409Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:14.854842Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:171b52ec46f4c3e578da10c8a85a85d545c0cc103dc1357340ea2b1dd85090c8","observation_id":"a13fe694-d23b-4116-9ca5-49ea4f07e70b","resolution":{"observed_at":"2026-08-10T16:32:14.854842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:14.859098Z","title":"Graph convolutional neural network for human action recognition: A comprehensive survey","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-17T08:44:23.508409Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:14.859098Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:61fd733e1717f3d0110400ea6d4b21491581e2e9e62eb1f384cf0c9b9a674ccc","observation_id":"66c6d2c6-dbdc-4a47-b983-a01da0be0c8d","resolution":{"observed_at":"2026-08-10T16:32:14.859098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.05700","last_updated":"2022-09-13T02:57:05Z","snapshot_observed_at":"2026-08-16T16:33:00.014933Z","submitted_at":"2022-09-13T02:57:05Z","title":"Vision Transformers for Action Recognition: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.05700","snapshot_observed_at":"2026-08-10T16:32:14.863347Z","title":"Vision transformers for action recognition: A survey","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-17T08:44:23.508409Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:14.863347Z"},"links":{"cited_paper":"/paper/2209.05700","citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:6d4d831cb2470d15bb3329eb93b546f080ac4e32bf003fd7a6b5f6ea90c8494a","observation_id":"5d5b2177-be27-4d62-8b11-cbfd377b1f9a","resolution":{"observed_at":"2026-08-10T16:32:14.863347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:14.867580Z","title":"A survey on video-based human action recognition: recent updates, datasets, challenges, and applications","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-17T08:44:23.508409Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:14.867580Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:0726e4d8151d28f7252cfafab5d1c6d5a9ffa102588d38f6c1b47aadffee8dc3","observation_id":"479c7116-314a-476d-867f-c8a8da9c614e","resolution":{"observed_at":"2026-08-10T16:32:14.867580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:14.871883Z","title":"Human activity recognition: A survey.Procedia Computer Science, 155:698–703, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-17T08:44:23.508409Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:14.871883Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:d2ddef2e598ffb3a9058890cbd2ea93a40d7379b9a4a2ffc64ec48a04dae68c6","observation_id":"78ee2d7b-764f-4e8b-b57b-5780f1c3aa2c","resolution":{"observed_at":"2026-08-10T16:32:14.871883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:14.876446Z","title":"Human action recognition and prediction: A survey.International Journal of Computer Vision, 130(5):1366–1401, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-17T08:44:23.508409Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:14.876446Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:5b1c62659432ec30b1c9d91476cb385cefa7ca78cd297d33bbcbd78f5bb41862","observation_id":"6917e805-4b0a-4006-a092-6dcf68f8d7ef","resolution":{"observed_at":"2026-08-10T16:32:14.876446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:14.880120Z","title":"A survey on intelligent human action recognition techniques","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-17T08:44:23.508409Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:14.880120Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:d3a33a8550b9911faa80696e25ae7d875c3c3427516888e1b84509c4886173ce","observation_id":"0366efc3-70c7-4718-986e-7acc0da9201c","resolution":{"observed_at":"2026-08-10T16:32:14.880120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.06567","last_updated":"2020-12-11T18:54:08Z","snapshot_observed_at":"2026-08-17T13:19:55.906101Z","submitted_at":"2020-12-11T18:54:08Z","title":"A Comprehensive Study of Deep Video Action Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.06567","snapshot_observed_at":"2026-08-10T16:32:14.884011Z","title":"A comprehensive study of deep video action recognition","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-17T08:44:23.508409Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:14.884011Z"},"links":{"cited_paper":"/paper/2012.06567","citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:be310799649d3ec3f0156dc74f78d7f8eec7e7957530e5766875998ca9595340","observation_id":"05b208c8-697a-4256-8236-10283c538c9c","resolution":{"observed_at":"2026-08-10T16:32:14.884011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:14.888025Z","title":"Imagenet classification with deep convolutional neural networks","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-17T08:44:23.508409Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:14.888025Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:ed71216dd0fae3c65a100f6983e60283ea90a39ae92e52767fcb578602cf4a98","observation_id":"3426b91a-7763-4b6b-9630-3119e03956e7","resolution":{"observed_at":"2026-08-10T16:32:14.888025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:14.891931Z","title":"Action recognition and detection by combining motion and appearance features","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-17T08:44:23.508409Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:14.891931Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:22495e355e9fe86ea249d0c6e8e0246fe605832eae36b3618bcea144fc237784","observation_id":"d642e703-75a6-44f9-a482-ff18301a9083","resolution":{"observed_at":"2026-08-10T16:32:14.891931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:14.895511Z","title":"Large-scale video classification with convolutional neural networks","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-17T08:44:23.508409Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:14.895511Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:5723687d5eaeba95ccb72c0ff392c631d34c94482b03432ec5694d6102a17f78","observation_id":"0d6fa790-ef6f-44f3-8fbd-5496615b2d4a","resolution":{"observed_at":"2026-08-10T16:32:14.895511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:14.899340Z","title":"A key volume mining deep framework for action recognition","venue":null,"work_id":null,"year":1991},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-17T08:44:23.508409Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:14.899340Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:5d75ac475daa64e384a5e109b255d7fdc43a83be5a321bbe4b8dd48bfb8e93e2","observation_id":"6fab0d31-d091-416e-8863-d352bd1d472d","resolution":{"observed_at":"2026-08-10T16:32:14.899340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:14.903390Z","title":"Temporal action localization in untrimmed videos via multi-stage cnns","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-17T08:44:23.508409Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:14.903390Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:9acd3a4a559f8b46a7c9f61f9096dab6722b8aebba4fe979086e4ac51b29104d","observation_id":"64ef1cfa-f349-4d6f-bc51-492472d50df5","resolution":{"observed_at":"2026-08-10T16:32:14.903390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:14.908337Z","title":"A review of human activity recognition methods","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-17T08:44:23.508409Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:14.908337Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:0f38d6ae09df9a4f991a5640448a3b75db59367a7baa90b09a0b7fe071b89135","observation_id":"fcc737f4-3366-47dc-858b-3e38464faf03","resolution":{"observed_at":"2026-08-10T16:32:14.908337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:14.912839Z","title":"Analysis and predictive modeling of body language behavior in dyadic interactions from multimodal interlocutor cues","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-17T08:44:23.508409Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:14.912839Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:f612ce5c99ccb4bd04b14c72b2a6dac8a98a08658ff6d627cc149b53535f2773","observation_id":"4945c4f2-0005-4c73-b941-12311219acba","resolution":{"observed_at":"2026-08-10T16:32:14.912839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:14.917463Z","title":"Motion part regularization: Improving action recognition via trajectory selection","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-17T08:44:23.508409Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:14.917463Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:a9c9acb8f95db346a9c351e793728d48dd0aca7816a9cf14b253b994b1cdddfd","observation_id":"087be92c-e920-42e9-9081-1901c7723764","resolution":{"observed_at":"2026-08-10T16:32:14.917463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:14.921183Z","title":"Structured learning of human interactions in tv shows","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-17T08:44:23.508409Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:14.921183Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:a1bd611e1da456ce164a70feb6705e88bdc9581b80122452d280f0a5f4d955dd","observation_id":"371113fd-e29a-4237-8e86-270b83dbe46b","resolution":{"observed_at":"2026-08-10T16:32:14.921183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:14.924943Z","title":"Part-based motion descriptor image for human action recognition","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-17T08:44:23.508409Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:14.924943Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:2644ec46309d37b3e81fcfaa74afe033de3f7f5103edee5ef7051737f1166c7a","observation_id":"55a421b4-c4c2-4f98-8c52-cc2a23c1e7fe","resolution":{"observed_at":"2026-08-10T16:32:14.924943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:14.928608Z","title":"Don’t classify ratings of affect; rank them! IEEE transactions on affective computing, 5(3):314–326, 2014","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-17T08:44:23.508409Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:14.928608Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:640a1ba75340c84eca360d4db6c7ce2bde2d688ac3ea53669a68ee883002b5a5","observation_id":"aae1d369-b02c-4fe1-aa3e-f33b916893d7","resolution":{"observed_at":"2026-08-10T16:32:14.928608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:14.932345Z","title":"Discriminative latent models for recognizing contextual group activities","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-17T08:44:23.508409Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:14.932345Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:94e4591d57c2c893f6840b1051846791860a0b0d36c77df636341f834610d163","observation_id":"d30a3074-760f-459f-9ef5-51e0b0734380","resolution":{"observed_at":"2026-08-10T16:32:14.932345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:14.935721Z","title":"Generating Tennis Player by the Predicting Movement Using 2D Pose Estimation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-17T08:44:23.508409Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:14.935721Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:b0ebb207340a7844025c335de324a1011b3c500abd10cc187705ce8b70578f6b","observation_id":"b295e110-6db5-4da2-9be8-91c9f36bbe34","resolution":{"observed_at":"2026-08-10T16:32:14.935721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:14.939557Z","title":"Pose2trajectory: Using transformers on body pose to predict tennis player’s trajectory","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-17T08:44:23.508409Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:14.939557Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:56e8821e318cd69c1cddffad62ff9f930b7de1112bbaec096e75dc9a7a956411","observation_id":"1858db22-acee-4b39-88df-137e82979a03","resolution":{"observed_at":"2026-08-10T16:32:14.939557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:14.943416Z","title":"Deep learning based advanced spatio-temporal extraction model in medical sports rehabilitation for motion analysis and data processing","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-17T08:44:23.508409Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:14.943416Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:75b59d8dee4730bc4a81fc45896b004613b1e4175d26f9fd6cf74738895851ba","observation_id":"fbe54013-d32b-41b5-b21a-9415c7ca8240","resolution":{"observed_at":"2026-08-10T16:32:14.943416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:14.947632Z","title":"Two-stream convolutional networks for action recognition in videos","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-17T08:44:23.508409Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:14.947632Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:9a39beeeba5e38e890a6d0a4116b0b581ac31784c25c057ce94137c61668a169","observation_id":"9b06392b-6ed6-4e36-a097-df644d024462","resolution":{"observed_at":"2026-08-10T16:32:14.947632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:14.951279Z","title":"Going deeper with two-stream ConvNets for action recognition in video surveillance","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-17T08:44:23.508409Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:14.951279Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:8ca51dfac1774234ccefbdbefb2aaf1ca80a12bbb879759a9353f359b6742928","observation_id":"a1967d74-4640-439a-8c88-f94d3f61faab","resolution":{"observed_at":"2026-08-10T16:32:14.951279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:14.954932Z","title":"Distinct two-stream convolutional networks for human action recognition in videos using segment-based temporal modeling","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-17T08:44:23.508409Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:14.954932Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:a7add5cf9fd9225aa53f4955156cd08d93dff9debeff1af199542904c59629d8","observation_id":"e13fc381-7186-4000-95bd-c5331c6585bc","resolution":{"observed_at":"2026-08-10T16:32:14.954932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:14.958793Z","title":"Action Recognition Based on Two-Stream Convolutional Networks With Long-Short-Term Spatiotemporal Features","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-17T08:44:23.508409Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:14.958793Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:08ccfbdcc2c9c3b4a454102518dd114b9d52d794db242b74a066f09fde26b02f","observation_id":"2d4b7008-bf4b-4772-beaf-ff7b79708a4f","resolution":{"observed_at":"2026-08-10T16:32:14.958793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:14.962413Z","title":"Learning Long-Term Temporal Features With Deep Neural Networks for Human Action Recognition","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-17T08:44:23.508409Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:14.962413Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:49e9f12ce04cb0e03e8d53fb8d3536f04e51b31a79f6be415d1ba97855242f6a","observation_id":"502220b6-612b-4375-96e5-67d5bb333cb4","resolution":{"observed_at":"2026-08-10T16:32:14.962413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:14.966026Z","title":"Human action recognition using two-stream attention based LSTM networks","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-17T08:44:23.508409Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:14.966026Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:0043eeba131212f73a234aee699d86959105798ec70703a2b84a8dd90eee3827","observation_id":"07f23f85-2c8a-4f6d-97ca-f57dc377b6f4","resolution":{"observed_at":"2026-08-10T16:32:14.966026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:14.970032Z","title":"Human Action Recognition Based on Improved Two- Stream Convolution Network","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-17T08:44:23.508409Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:14.970032Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:40668cfc9c20a27e7251e818408a1305909eecd608d875d8d265750e3c47710f","observation_id":"1eba7d48-2abf-413a-825e-c011ba8ee981","resolution":{"observed_at":"2026-08-10T16:32:14.970032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:14.973641Z","title":"Toward Efficient Action Recognition: Principal Backpropagation for Training Two-Stream Networks","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-17T08:44:23.508409Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:14.973641Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:ecb09b87aa9c142958897e0f7df6de135e9f1a5ff6ce22473382060dab0239c5","observation_id":"f0d95b6c-80d1-4a13-ae1b-3b8e371b013f","resolution":{"observed_at":"2026-08-10T16:32:14.973641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:14.977216Z","title":"Two-stream flow-guided convolutional attention networks for action recognition","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-17T08:44:23.508409Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:14.977216Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:9e0c9f3b7fe1fabe0deafd8492b2d37c2f28e0f18dec616d030625f3600900cb","observation_id":"38ab6f59-91b5-4aa2-b39f-4e0eb0b9a290","resolution":{"observed_at":"2026-08-10T16:32:14.977216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:14.980804Z","title":"Convolutional two-stream network fusion for video action recognition","venue":null,"work_id":null,"year":1933},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-17T08:44:23.508409Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:14.980804Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:ee14e68dc142f8bdabd73cddf2d503f8ff83523da03775ff0a202eb50191dac9","observation_id":"221b8831-5c80-4475-9dcb-9632412071a2","resolution":{"observed_at":"2026-08-10T16:32:14.980804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:14.984455Z","title":"Unsupervised motion representation enhanced network for action recognition","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-17T08:44:23.508409Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:14.984455Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:a85f14b275162c8aa860059128c65f3cb194df7c398121cbe35d704a17fa3932","observation_id":"48651237-e08c-4f71-9970-9dc77096cca3","resolution":{"observed_at":"2026-08-10T16:32:14.984455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:14.987883Z","title":"Two stream lstm: A deep fusion framework for human action recognition","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-17T08:44:23.508409Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:14.987883Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:1b61703c7d7d6b36061bbb47243b7ba8efe78fff463bda075e79dd08ba535de6","observation_id":"96c8dd36-40ae-4a23-9a8b-421f86f56f1e","resolution":{"observed_at":"2026-08-10T16:32:14.987883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:14.991247Z","title":"Learning from temporal gradient for semi-supervised action recognition","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-17T08:44:23.508409Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:14.991247Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:126a57e1193ba5976eb8da578bec206a5127a1f19d50b64dca964bd74f6966af","observation_id":"8285d86e-add2-405b-b861-be1ec74d7c1a","resolution":{"observed_at":"2026-08-10T16:32:14.991247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:14.994983Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-17T08:44:23.508409Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:14.994983Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:786b24300019a17c938887add5cb80b266f69ab6e107e39baf06133b79d65feb","observation_id":"fd5ac46e-ed3f-426d-8013-18cd7b608837","resolution":{"observed_at":"2026-08-10T16:32:14.994983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:14.999375Z","title":"Batch normalization: Accelerating deep network training by reducing internal covariate shift","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-17T08:44:23.508409Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:14.999375Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:d965f41b6d81b0b9b96cf93cfe6d38c1dad4570a597abc17ef45f208fec26978","observation_id":"694442f2-9be6-4136-988b-5b90f9671ce0","resolution":{"observed_at":"2026-08-10T16:32:14.999375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1409.1556","last_updated":"2015-04-10T16:25:04Z","snapshot_observed_at":"2026-08-14T23:20:42.336514Z","submitted_at":"2014-09-04T19:48:04Z","title":"Very Deep Convolutional Networks for Large-Scale Image Recognition","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1409.1556","snapshot_observed_at":"2026-08-10T16:32:15.003120Z","title":"Very deep convolutional networks for large-scale image recognition","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-17T08:44:23.508409Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.003120Z"},"links":{"cited_paper":"/paper/1409.1556","citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:2628b31a7384cb6aa0bc694e92c7b992b31b09016fecdf9f1a7070a078f7613a","observation_id":"1265e5fe-e630-4a1e-a629-64576f35bbb3","resolution":{"observed_at":"2026-08-10T16:32:15.003120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:15.007504Z","title":"Hearst, Susan T Dumais, Edgar Osuna, John Platt, and Bernhard Scholkopf","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-17T08:44:23.508409Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.007504Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:759ba81be5c26b333dba4f81d2fa41edcd311493688f5c40926b800a10e334cc","observation_id":"3cdbb72b-9ff7-4d06-a9dc-d272f20a5660","resolution":{"observed_at":"2026-08-10T16:32:15.007504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:15.011841Z","title":"A novel recurrent hybrid network for feature fusion in action recognition","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-17T08:44:23.508409Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.011841Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:d32de12742c986a1ffa68867e0ae1aa3aa993162c9776920ff4ee3ffd3e01c45","observation_id":"006914c4-5c71-4e06-98b3-0f0e8e360a98","resolution":{"observed_at":"2026-08-10T16:32:15.011841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:15.016042Z","title":"Going deeper with convolutions","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-17T08:44:23.508409Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.016042Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:91e8a8668d211a25529012564ed9250d4746ee8f81d6eca70d8222c6b08db272","observation_id":"af855d72-9b56-4d77-9fbe-bdbae898665c","resolution":{"observed_at":"2026-08-10T16:32:15.016042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:15.019888Z","title":"Temporal segment networks: Towards good practices for deep action recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-17T08:44:23.508409Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.019888Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:4c41add5b4596c2a1508ac603ada07b69311c2d8a56a6ccdaca2d70d9b0aa3de","observation_id":"cf109c2b-8d55-44b2-a1cd-8e730af1ab6b","resolution":{"observed_at":"2026-08-10T16:32:15.019888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:15.023638Z","title":"Fsformer: Fast-slow transformer for video action recognition","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-17T08:44:23.508409Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.023638Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:de79e88eabd83bf888b181f498851682073006c27007930b2637b86ec026755f","observation_id":"1c1832da-91d1-4aac-9d24-62e0fbc1b576","resolution":{"observed_at":"2026-08-10T16:32:15.023638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:15.027755Z","title":"Slowfast networks for video recognition","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-17T08:44:23.508409Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.027755Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:b3e818c6a67cdd501f3492e729601df721e8824e5500407dcaa7050cf04ed13f","observation_id":"b3b56d9b-b085-4195-b9ab-69d6f1293329","resolution":{"observed_at":"2026-08-10T16:32:15.027755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:15.031865Z","title":"A novel two-stream transformer-based framework for multi-modality human action recognition","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-17T08:44:23.508409Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.031865Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:d47144c80f6b7f2f515680a820529e95675e2736e5d7e717c31428502ac694a8","observation_id":"f9ec939b-9de7-45fd-8e89-bc633495c5b0","resolution":{"observed_at":"2026-08-10T16:32:15.031865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:15.035728Z","title":"Learning long-term temporal features with deep neural networks for human action recognition","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-17T08:44:23.508409Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.035728Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:683208756d1dba7e93f9899e3e0b080ffd887082470b55e040d64beb006b33f2","observation_id":"9a08ad0e-d9bf-4859-ba8f-f158b5efead7","resolution":{"observed_at":"2026-08-10T16:32:15.035728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-16T09:25:53.087782Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-10T16:32:15.039488Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-17T08:44:23.508409Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.039488Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:e1915619ddd16b3e2e1a16597d8a2cc9e613f6b7c740991f22f1dd5ee326971b","observation_id":"6d01600f-87bd-4479-8c35-90b246ad66f7","resolution":{"observed_at":"2026-08-10T16:32:15.039488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:15.043853Z","title":"Neocognitron: A self-organizing neural network model for a mechanism of pattern recognition unaffected by shift in position","venue":null,"work_id":null,"year":1980},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-17T08:44:23.508409Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.043853Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:0983e403cb39609383fd59b19835870acb1fb3ce15d7289f9918e4e3e677ca02","observation_id":"fb3b8262-ffe0-4af6-81b8-3f48aa417569","resolution":{"observed_at":"2026-08-10T16:32:15.043853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:15.048361Z","title":"3d convolutional neural networks for human action recognition","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-17T08:44:23.508409Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.048361Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:116b02f69fcddb165999cc47433dba6adc4639be4732874387e7c80d23beb18c","observation_id":"e80126a2-9528-4338-987a-be4295d4e8f1","resolution":{"observed_at":"2026-08-10T16:32:15.048361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:15.052471Z","title":"Detecting human actions in surveillance videos","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-17T08:44:23.508409Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.052471Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:7bfbd66a79a9982adaabe5b36f47d8f9de9985ea0278d33fe1082dcfbac458c1","observation_id":"d6bce175-18bf-45b5-a7ab-cbf2b78b5b37","resolution":{"observed_at":"2026-08-10T16:32:15.052471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:15.056562Z","title":"Recognizing human actions: a local svm approach","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-17T08:44:23.508409Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.056562Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:755447ae5fe83f77453f7709f0ac57af1c23b64e6602e8dc4175e9320be037d0","observation_id":"71b1a12d-9431-48f3-a9a7-d59a673b8d56","resolution":{"observed_at":"2026-08-10T16:32:15.056562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:15.060823Z","title":"Learning spatiotemporal features with 3d convolutional networks","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-17T08:44:23.508409Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.060823Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:4aceb2cd402fb70bcad338293f47b38124c1b609efc39f173c0c348d71ebebbd","observation_id":"2f6481ab-83e8-41dc-afa9-6b58878a45f8","resolution":{"observed_at":"2026-08-10T16:32:15.060823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:15.064345Z","title":"Quo vadis, action recognition? a new model and the kinetics dataset","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-17T08:44:23.508409Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.064345Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:0b3007681974f270697cbf4e52a86939de876a2f873da8ce863156f8911f21cd","observation_id":"1de64ce2-6268-48e2-8403-8a317a1d8403","resolution":{"observed_at":"2026-08-10T16:32:15.064345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:15.068157Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-17T08:44:23.508409Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.068157Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:ed741a2faa015b8585ec73aeb705e255efaf8b1c2fb821d84616137987a7bdbb","observation_id":"d91cd113-c562-42fa-b6b6-4a06b64731a1","resolution":{"observed_at":"2026-08-10T16:32:15.068157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:15.071707Z","title":"Learning spatio-temporal representation with pseudo-3d residual networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-17T08:44:23.508409Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.071707Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:622033b5f54b94483a73c265d2c383b4f626831941a924feef36b3fb34afd43c","observation_id":"8a584ac0-34d8-4f09-8d6e-7813b3c1f0a0","resolution":{"observed_at":"2026-08-10T16:32:15.071707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:15.075286Z","title":"Non-local neural networks","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-17T08:44:23.508409Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.075286Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:69f4de445c791ac828e0cdb1f661a0ac32e39b60d1b788449b6e074cd1dd99e2","observation_id":"bef72ae3-ffbf-43e9-a4f3-ad767060b4d4","resolution":{"observed_at":"2026-08-10T16:32:15.075286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:15.079111Z","title":"Eco: Efficient convolutional network for online video understanding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-17T08:44:23.508409Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.079111Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:506f955d54d7790ba26e5ce7f7e0e88d05f37bd51adcac5253b3d575f1389f99","observation_id":"4baf12b3-8907-4e4a-aefc-197ee96ede2d","resolution":{"observed_at":"2026-08-10T16:32:15.079111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:15.082844Z","title":"X3d: Expanding architectures for efficient video recognition","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-17T08:44:23.508409Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.082844Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:29681235a3f59b2a97b394293f24c4e3b71f5813fc169a274800c13c8962f9f2","observation_id":"579ac752-e06b-4b37-84da-a88145ce26a7","resolution":{"observed_at":"2026-08-10T16:32:15.082844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:15.086493Z","title":"3d deformable convolution temporal reasoning network for action recognition","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-17T08:44:23.508409Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.086493Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:01a959f778a60b8ebb029ff858a66d700977bd05546026d7cf8b48bd68bbb499","observation_id":"93f70f25-f493-47e7-8742-25661656c2eb","resolution":{"observed_at":"2026-08-10T16:32:15.086493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:15.090141Z","title":"The graph neural network model","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-17T08:44:23.508409Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.090141Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:043a8569e38d077e1383426356d841329c9645d16c31fe29db45f5a184226bed","observation_id":"ada102a0-6947-449c-9254-648448165d59","resolution":{"observed_at":"2026-08-10T16:32:15.090141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:15.093990Z","title":"Adaptive graph convolutional neural networks","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-17T08:44:23.508409Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.093990Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:8126ddec8a01aa01d85669ca0a29074dc537de96606b07b993dd3700a86e46c3","observation_id":"b36196d6-8df2-4d98-8e9a-8da46f8f7e21","resolution":{"observed_at":"2026-08-10T16:32:15.093990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.02907","last_updated":"2017-02-22T09:55:36Z","snapshot_observed_at":"2026-08-17T10:49:36.026134Z","submitted_at":"2016-09-09T19:48:41Z","title":"Semi-Supervised Classification with Graph Convolutional Networks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.02907","snapshot_observed_at":"2026-08-10T16:32:15.097624Z","title":"Semi-supervised classification with graph convolutional networks","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-17T08:44:23.508409Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.097624Z"},"links":{"cited_paper":"/paper/1609.02907","citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:e0ed217ac9d2642f9cb5acbf7d39350d1c381df9c6532242afd73ba804f23539","observation_id":"3d076cca-0844-4c66-9a44-ba8c3b29d3e4","resolution":{"observed_at":"2026-08-10T16:32:15.097624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1710.10903","last_updated":"2018-02-04T19:13:29Z","snapshot_observed_at":"2026-08-13T22:35:40.714745Z","submitted_at":"2017-10-30T12:41:12Z","title":"Graph Attention Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.10903","snapshot_observed_at":"2026-08-10T16:32:15.101775Z","title":"Graph attention networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-17T08:44:23.508409Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.101775Z"},"links":{"cited_paper":"/paper/1710.10903","citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:79e01f4be1341424d525c310b2a4f9dddad860f9f646c606b77d48cadc5f8fad","observation_id":"0f257fa7-73fd-43c3-a176-b07371473bcf","resolution":{"observed_at":"2026-08-10T16:32:15.101775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.00826","last_updated":"2019-02-22T19:15:54Z","snapshot_observed_at":"2026-08-13T05:06:48.606308Z","submitted_at":"2018-10-01T17:11:31Z","title":"How Powerful are Graph Neural Networks?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.00826","snapshot_observed_at":"2026-08-10T16:32:15.105490Z","title":"How powerful are graph neural networks? arXiv preprint arXiv:1810.00826, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-17T08:44:23.508409Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.105490Z"},"links":{"cited_paper":"/paper/1810.00826","citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:d67698c2afd0c6d977afe335de740aac4e6fc12a748388ee9389d26ef90998ed","observation_id":"aaa1ebb9-f365-4d2b-b6a6-1006ee31def1","resolution":{"observed_at":"2026-08-10T16:32:15.105490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:15.109337Z","title":"Graphsage-based traffic speed forecasting for segment network with sparse data","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-17T08:44:23.508409Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.109337Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:a4e02982f86605d6b13c6b90aa3a9256716281dda59a71b7b78afb1d3f107594","observation_id":"765ff082-652d-49e5-9b07-c089e014e2e5","resolution":{"observed_at":"2026-08-10T16:32:15.109337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.07896","last_updated":"2023-02-28T21:57:49Z","snapshot_observed_at":"2026-08-16T16:32:01.908038Z","submitted_at":"2022-09-16T12:41:43Z","title":"3D VSG: Long-term Semantic Scene Change Prediction through 3D Variable Scene Graphs","version":2},"cited_work":{"arxiv_id":"2209.07896","doi":null,"metadata_source":"pith","pith_arxiv_id":"2209.07896","snapshot_observed_at":"2026-08-10T16:32:16.557133Z","title":"3D VSG: Long-term Semantic Scene Change Prediction through 3D Variable Scene Graphs","venue":"cs.RO","work_id":"df67eabe-78e8-419d-abfc-8b918664030e","year":2022},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-17T08:44:23.508409Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.112983Z"},"links":{"cited_paper":"/paper/2209.07896","citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:419f5b51acef0c618fdcf5d992bed7879bc2915125cf9b536e063e50fd860bd0","observation_id":"c416f37d-4b20-4134-b48d-74c1d4890055","resolution":{"observed_at":"2026-08-10T16:32:16.562401Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:15.116747Z","title":"Learning graph convolutional network for skeleton- based human action recognition by neural searching","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-17T08:44:23.508409Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.116747Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:cbe7561a4a8495494b6852e92eb1dde16220ca4cf51f9da7fb1fa75a4cca46d3","observation_id":"62d9fd25-fae7-42cf-a081-998fcbf7d941","resolution":{"observed_at":"2026-08-10T16:32:15.116747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:15.120214Z","title":"Spatial temporal graph convolutional networks for skeleton-based action recognition","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-17T08:44:23.508409Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.120214Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:e1fcaf799973767e56088d68831299afa832cfb19c023dbf5001d44f8441bf72","observation_id":"3d4c2723-e0e5-4cf8-b7f2-a6058cd4ffa0","resolution":{"observed_at":"2026-08-10T16:32:15.120214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:15.124020Z","title":"Actional-structural graph convolu- tional networks for skeleton-based action recognition","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-17T08:44:23.508409Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.124020Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:a6494120ad7725f34967171948939a5b8c17670deea173ac165905f87675f097","observation_id":"bff6d5b4-dd8e-4a8c-a10c-05e5d235dcb3","resolution":{"observed_at":"2026-08-10T16:32:15.124020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:15.127809Z","title":"Disentangling and unifying graph convolutions for skeleton-based action recognition","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-17T08:44:23.508409Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.127809Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:580c45f3595574be19451c1ff3011746ec2f2c455d1f81e6a03fcb9acf977cfb","observation_id":"e7bd302f-a110-4977-8f66-852dd5470c1b","resolution":{"observed_at":"2026-08-10T16:32:15.127809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:15.131655Z","title":"An attention enhanced graph convolutional lstm network for skeleton-based action recognition","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-17T08:44:23.508409Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.131655Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:3dab242774240a3a1aad94674ac8ae90a976943d50738ba4d1c7737a9691f5d6","observation_id":"248fc9ad-7359-4067-8b00-bcedc947eae5","resolution":{"observed_at":"2026-08-10T16:32:15.131655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:15.135274Z","title":"Skeleton-based action recognition by part-aware graph convolutional networks","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-17T08:44:23.508409Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.135274Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:a42d5fef9e37888aa59f4653adb5d784d598b167802a8b0d5bd2c05a17b2f51e","observation_id":"8f2514ef-dc10-48cf-93c2-03e7c74b08d3","resolution":{"observed_at":"2026-08-10T16:32:15.135274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.05318","last_updated":"2023-09-06T02:29:01Z","snapshot_observed_at":"2026-08-16T16:39:59.556371Z","submitted_at":"2022-08-10T12:55:56Z","title":"Generative Action Description Prompts for Skeleton-based Action Recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.05318","snapshot_observed_at":"2026-08-10T16:32:15.139131Z","title":"Language supervised training for skeleton-based action recognition","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-17T08:44:23.508409Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.139131Z"},"links":{"cited_paper":"/paper/2208.05318","citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:7da955b5bed3b09f6684cf80faa321191fddc6a6a98d8fd0cd276c172c389e01","observation_id":"2d5de48a-0d42-4012-afa5-830a4402c6fa","resolution":{"observed_at":"2026-08-10T16:32:15.139131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.12398","last_updated":"2023-05-21T08:29:16Z","snapshot_observed_at":"2026-08-16T15:31:23.580371Z","submitted_at":"2023-05-21T08:29:16Z","title":"Language Knowledge-Assisted Representation Learning for Skeleton-Based Action Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.12398","snapshot_observed_at":"2026-08-10T16:32:15.143322Z","title":"Language knowledge-assisted representation learning for skeleton-based action recognition","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-17T08:44:23.508409Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.143322Z"},"links":{"cited_paper":"/paper/2305.12398","citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:da3eb212bae4d772e810b37aa74c1e55de1ead58ee9b376713c6bdc95f4c54f7","observation_id":"ad5f850f-3562-44a8-a039-f80e1070ad4e","resolution":{"observed_at":"2026-08-10T16:32:15.143322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.10741","last_updated":"2023-07-19T09:15:05Z","snapshot_observed_at":"2026-08-16T16:37:31.745484Z","submitted_at":"2022-08-23T05:27:32Z","title":"Hierarchically Decomposed Graph Convolutional Networks for Skeleton-Based Action Recognition","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.10741","snapshot_observed_at":"2026-08-10T16:32:15.146978Z","title":"Hierarchically decomposed graph convolutional networks for skeleton-based action recognition","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-17T08:44:23.508409Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.146978Z"},"links":{"cited_paper":"/paper/2208.10741","citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:5771c80525d40323d21dc1f5ba8db70307b74249e678645c3478ded24be8d59f","observation_id":"c4b226da-5d2c-4f12-a16f-6ddeae3d9520","resolution":{"observed_at":"2026-08-10T16:32:15.146978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.05895","last_updated":"2022-10-12T03:17:37Z","snapshot_observed_at":"2026-08-16T16:24:57.948735Z","submitted_at":"2022-10-12T03:17:37Z","title":"DG-STGCN: Dynamic Spatial-Temporal Modeling for Skeleton-based Action Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.05895","snapshot_observed_at":"2026-08-10T16:32:15.151043Z","title":"Dg-stgcn: Dynamic spatial-temporal modeling for skeleton-based action recognition","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-17T08:44:23.508409Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.151043Z"},"links":{"cited_paper":"/paper/2210.05895","citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:28fe0b3f3a74ff98b1b116d38bf0aa7a350711aa02b462a16e007cbc6a5653f7","observation_id":"4f29cd74-197f-4878-b05a-508a10b31fc4","resolution":{"observed_at":"2026-08-10T16:32:15.151043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:15.155752Z","title":"Infogcn: Representation learning for human skeleton-based action recognition","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-17T08:44:23.508409Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.155752Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:a277787b4042604682d7a7a27fe7e59fa291b014f9e5f3e7a8489e5e829965c9","observation_id":"a906fd36-919d-45c8-b820-a93873abf7f7","resolution":{"observed_at":"2026-08-10T16:32:15.155752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.10900","last_updated":"2023-06-10T10:32:06Z","snapshot_observed_at":"2026-08-16T16:00:05.760121Z","submitted_at":"2023-01-26T02:09:16Z","title":"Graph Contrastive Learning for Skeleton-based Action Recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.10900","snapshot_observed_at":"2026-08-10T16:32:15.159437Z","title":"Graph contrastive learning for skeleton-based action recognition","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-17T08:44:23.508409Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.159437Z"},"links":{"cited_paper":"/paper/2301.10900","citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:6fcc0f35d5fcec0a776bdad5e3cf60a1bc716f2544195a17240540fb616a0133","observation_id":"e82b7616-ffe9-4188-9c8f-6b20cb44fbc4","resolution":{"observed_at":"2026-08-10T16:32:15.159437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:15.163569Z","title":"Spatial–temporal dynamic graph attention network for skeleton-based action recognition","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-17T08:44:23.508409Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.163569Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:d5441e0fd5bf572bddd0e787b5ec0e3ae4945ff2590928514f4f8091a8294ac5","observation_id":"fd96fbdc-22a7-4529-b41c-6db41bb9200e","resolution":{"observed_at":"2026-08-10T16:32:15.163569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.05775","last_updated":"2022-08-11T12:12:07Z","snapshot_observed_at":"2026-08-16T16:39:46.580310Z","submitted_at":"2022-08-11T12:12:07Z","title":"PSUMNet: Unified Modality Part Streams are All You Need for Efficient Pose-based Action Recognition","version":1},"cited_work":{"arxiv_id":"2208.05775","doi":null,"metadata_source":"pith","pith_arxiv_id":"2208.05775","snapshot_observed_at":"2026-08-10T16:32:16.476210Z","title":"PSUMNet: Unified Modality Part Streams are All You Need for Efficient Pose-based Action Recognition","venue":"cs.CV","work_id":"38de0a22-cf9b-4dd0-94b1-9b2af824f07e","year":2022},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-17T08:44:23.508409Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.168515Z"},"links":{"cited_paper":"/paper/2208.05775","citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:4c5d1b3d31ca02a6cb3f2ac35e83f2ae86fd4b60fb904c3bc23d9358233a23d7","observation_id":"60f0e876-972f-4828-96c6-42529abad5ec","resolution":{"observed_at":"2026-08-10T16:32:16.480987Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:15.173491Z","title":"Learning discriminative representations for skeleton-based action recognition","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-17T08:44:23.508409Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.173491Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:25490299847a2b2c65f2a60aa4e88302be5b1d105ff614c21090e43e1164d03f","observation_id":"0ba568af-5747-4338-b709-975896206bf8","resolution":{"observed_at":"2026-08-10T16:32:15.173491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.08599","last_updated":"2022-09-13T06:25:23Z","snapshot_observed_at":"2026-08-17T08:09:42.349833Z","submitted_at":"2022-08-18T02:34:46Z","title":"Spatial Temporal Graph Attention Network for Skeleton-Based Action Recognition","version":2},"cited_work":{"arxiv_id":"2208.08599","doi":null,"metadata_source":"pith","pith_arxiv_id":"2208.08599","snapshot_observed_at":"2026-08-10T16:32:16.458437Z","title":"Spatial Temporal Graph Attention Network for Skeleton-Based Action Recognition","venue":"cs.CV","work_id":"ccdeaccc-d67c-4d6c-bd54-1629c1dc8a1f","year":2022},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-17T08:44:23.508409Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.177860Z"},"links":{"cited_paper":"/paper/2208.08599","citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:e6b0a1fb3158596a7a375b0e3cac246c59c554225fb0e5b17d03fd4ebd2e5954","observation_id":"0e416f82-b135-43ab-8a6d-51e06889471b","resolution":{"observed_at":"2026-08-10T16:32:16.462788Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.15936","last_updated":"2022-08-08T12:41:25Z","snapshot_observed_at":"2026-08-16T16:56:16.142470Z","submitted_at":"2022-05-31T16:28:30Z","title":"Skeleton-based Action Recognition via Temporal-Channel Aggregation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.15936","snapshot_observed_at":"2026-08-10T16:32:15.181938Z","title":"Skeleton-based action recognition via temporal-channel aggregation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-17T08:44:23.508409Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.181938Z"},"links":{"cited_paper":"/paper/2205.15936","citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:f6a4681e6985eadea30da7af21f55ee1e79d5fb3be8ed6f6b75fcacb536914dd","observation_id":"2398489a-4e61-475e-be77-ec8cff098111","resolution":{"observed_at":"2026-08-10T16:32:15.181938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:15.186014Z","title":"Temporal decoupling graph convolutional network for skeleton-based gesture recognition","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-17T08:44:23.508409Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.186014Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:e34d13247a121968dc282ca7b61881282e9374669834f0a811ccc07cc5b3b914","observation_id":"d0d1a087-645a-4c7f-a5c4-62e7530dfb5b","resolution":{"observed_at":"2026-08-10T16:32:15.186014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:15.190126Z","title":"Mict: Mixed 3d/2d convolutional tube for human action recognition","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-17T08:44:23.508409Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.190126Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:d431e39f197af3cb1be678a567d958ef563cc03a54e03dbd96708b39ee61f8f1","observation_id":"e6831011-386b-4b99-a6fd-42e69dc200fc","resolution":{"observed_at":"2026-08-10T16:32:15.190126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:15.194144Z","title":"Stacked spatio-temporal graph convolutional networks for action segmentation","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-17T08:44:23.508409Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.194144Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:dd639b74192898f11bb9720b553cfcda6484a06b7bbbeef3e8351c2fe8c51773","observation_id":"d39f7466-2cf2-459e-8c9d-c8d167a82202","resolution":{"observed_at":"2026-08-10T16:32:15.194144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:15.197892Z","title":"Dynamic multiscale graph neural networks for 3d skeleton based human motion prediction","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-17T08:44:23.508409Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.197892Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:cb183ced6b9179b74f71b487cfc036e1bdf253a81f30ce4dba575ecbd48edb00","observation_id":"5b847834-a033-4b6b-ba05-f1e3102e32b7","resolution":{"observed_at":"2026-08-10T16:32:15.197892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:15.201721Z","title":"Two-stream adaptive graph convolutional networks for skeleton-based action recognition","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-17T08:44:23.508409Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.201721Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:d0f306f8530157b9dcd8ab8b949523b3f688589391598664d9c333f200c4cbf8","observation_id":"a547197a-5645-47ab-8e96-2e65be51661e","resolution":{"observed_at":"2026-08-10T16:32:15.201721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:15.205236Z","title":"Edge and node graph convolutional neural network for human action recognition","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-17T08:44:23.508409Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.205236Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:b4ce181e512796d44116296ae99c8b4123cda880cd136c3a2a981aa74e0838f7","observation_id":"112a946d-30c1-4441-9d57-ea42cbf36a87","resolution":{"observed_at":"2026-08-10T16:32:15.205236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:15.209228Z","title":"Improving action recognition with the graph- neural-network-based interaction reasoning","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-17T08:44:23.508409Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.209228Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:6a6a45060520293bd6197b6a47e83374c6324805062accff9bc09c81373b5dcb","observation_id":"11e0ebf2-7481-47ae-b79f-d8ed655c63a8","resolution":{"observed_at":"2026-08-10T16:32:15.209228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:15.213250Z","title":"Skeleton-based action recognition with directed graph neural networks","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-17T08:44:23.508409Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.213250Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:2b92a35512712c73a5fabd19fa8bee3e915eb72359a8fa5525ca2fb990b12fb6","observation_id":"fd505abf-befb-4710-b842-e342ad9d22a8","resolution":{"observed_at":"2026-08-10T16:32:15.213250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:15.217050Z","title":"Graph interaction networks for relation transfer in human activity videos","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-17T08:44:23.508409Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.217050Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:53023a50f6fb73418ee3061ae7404cffd1ae22c057bf2ed40c4542933e6e322f","observation_id":"cca27e29-ae2f-467e-8ccd-c08b6449250e","resolution":{"observed_at":"2026-08-10T16:32:15.217050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:15.220946Z","title":"I know the relationships: Zero-shot action recognition via two-stream graph convolutional networks and knowledge graphs","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-17T08:44:23.508409Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.220946Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:421d6bda18a1fce6b3712d50f00a34db9df46873eaa25c5185c8e44d14a9d90f","observation_id":"7365904b-3a40-4a3e-867f-8dbbdaa28e33","resolution":{"observed_at":"2026-08-10T16:32:15.220946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:15.224784Z","title":"Learning to model relationships for zero-shot video classifica- tion","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-17T08:44:23.508409Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.224784Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:b04e1dae04ee17cd4b48440e759ce038ff14f23c5a6aca6051fc4f3a33902786","observation_id":"10b29226-e65d-4d42-89ab-0fe8adb6b05f","resolution":{"observed_at":"2026-08-10T16:32:15.224784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:15.228720Z","title":"Deep progressive reinforcement learning for skeleton-based action recognition","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-17T08:44:23.508409Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.228720Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:0c135ac1fc084e90ae43ecbf48d98fce1438f7e324e342a497b859f6571199b3","observation_id":"decfecb7-5def-4ccc-b6a8-1bd131ff9d50","resolution":{"observed_at":"2026-08-10T16:32:15.228720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:15.234669Z","title":"Skeleton-based action recognition using multi-scale and multi-stream improved graph convolutional network","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-17T08:44:23.508409Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.234669Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:557a06c4247c1d89526081d0d594aaa93aae561418d415e902fd7ca75cf38bf6","observation_id":"cfc32e2d-9849-40cf-a73e-d4a04198a711","resolution":{"observed_at":"2026-08-10T16:32:15.234669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:15.238567Z","title":"Aggarwal and Q","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-17T08:44:23.508409Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.238567Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:fb1f4d288c1e412d2e894e3af751e52a68a584db9bfdacc7bcfdd0163ac696d3","observation_id":"852b8c3c-2dad-490f-a8a6-99e6427fc1e5","resolution":{"observed_at":"2026-08-10T16:32:15.238567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:15.242242Z","title":"Horn and Brian G","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-17T08:44:23.508409Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.242242Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:cc6e74d469527f30f794d7584bb723ca4ffa1ebb704b814e23133fe420815198","observation_id":"dfc7c30e-c028-4143-a64e-95bc1799f503","resolution":{"observed_at":"2026-08-10T16:32:15.242242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-17T08:44:23.508409Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":97,"verified_exact":3,"verified_fuzzy":0},"total_outbound_references":299},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 100 of 299 outbound references and 0 inbound Pith citation observations for arXiv:2501.13066."}