{"as_of":"2026-08-16T12:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e00dc8c42e75fe7b36cc6b0102141b7f1f2c9fe5f6823db6667ee07e2ce887b9","coverage":[{"denominator":68,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":68,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T22:27:40.342777Z","state":"measured"},{"denominator":68,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":68,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.06691/citation-record","integrity":"/paper/2608.06691/integrity","json":"/paper/2608.06691/citation-record.json","paper":"/paper/2608.06691"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:41.088162Z","title":"Vu: Edge computing-enabled video usefulness detection and its application in large-scale video surveillance systems,","venue":null,"work_id":"41b83d04-99f2-4088-b322-adb0e47ee6e7","year":2019},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-15T03:48:35.155534Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.047787Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:f1ae09ec4fcfc52fa4b6b1c0d15b8aa149de256bfb2a00d628da19724f86f45c","observation_id":"6446068b-9e34-46da-863a-200742939566","resolution":{"observed_at":"2026-08-10T22:27:41.091673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:41.077467Z","title":"Strack: Robust tracking of small objects in low-light conditions,","venue":null,"work_id":"565d1879-8139-4a85-8be6-55772306b791","year":2025},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-15T03:48:35.155534Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.052470Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:882fa3dcc6715616482534436855c9f370696c2416f7c38ba571009e2c32ea95","observation_id":"ce831a05-68bd-4a0a-a1f0-4452f79e0f5e","resolution":{"observed_at":"2026-08-10T22:27:41.081127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:41.066961Z","title":"Ai-driven salient soc- cer events recognition framework for next-generation iot-enabled environments,","venue":null,"work_id":"97809960-9ecf-4a1a-bd7f-77dfefdd1048","year":2021},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-15T03:48:35.155534Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.056292Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:554d78deb48808a1fb245df3bd05eac66229386bb595e868194c3fd87c11489c","observation_id":"aa017a64-7f5d-47e8-badd-372457076fed","resolution":{"observed_at":"2026-08-10T22:27:41.070793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:41.056126Z","title":"Contactless patient care using hospital iot: Cctv-camera-based physiological monitoring in icu,","venue":null,"work_id":"24ad56f5-74af-4862-83e9-ca84a7923b58","year":2023},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-15T03:48:35.155534Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.060762Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:9668faf37f990677d40c4ed3b1dd7c6d3df92f0d1b4e13cde4fdbf4409aa1f1a","observation_id":"489c6eb2-a67e-4f79-9813-2dc873cac505","resolution":{"observed_at":"2026-08-10T22:27:41.060164Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:41.045664Z","title":"Optimization for short video propagation based on user interaction analysis in edge networks,","venue":null,"work_id":"fd58b11f-28e3-4d8c-9604-42176e8f66cd","year":2025},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-15T03:48:35.155534Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.064561Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:1273743e5058f079820a5002be960202eec6970cede06a7f4fbed79c0c60aff5","observation_id":"7f4c3b93-3727-45f8-97f0-411502ac4afc","resolution":{"observed_at":"2026-08-10T22:27:41.049380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:41.035154Z","title":"Panacea+: Panoramic and con- trollable video generation for autonomous driving,","venue":null,"work_id":"eded80da-0486-4c24-b611-68fed1641bb5","year":2025},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-15T03:48:35.155534Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.068617Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:2dc74b8e70449aa579f196ea01a09783e841499f7aeb78f8e08ce2b7027114c2","observation_id":"5641c2eb-0d0e-484a-9bc2-6e31e5cff03f","resolution":{"observed_at":"2026-08-10T22:27:41.038910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:41.024532Z","title":"Tracenet: A novel modular frame- work for robust multi-object tracking in crowded and dynamic environments,","venue":null,"work_id":"cf43fb10-de89-4079-8ba2-6c9cb766ed08","year":2026},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-15T03:48:35.155534Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.072808Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:3f57f1431a039d4d4869098ddbc8e3bf7023c92c77eb4921aac3ae5ab3bb2ae0","observation_id":"825c093c-b36f-477d-9b78-c422c4a7b4cb","resolution":{"observed_at":"2026-08-10T22:27:41.028248Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:41.012898Z","title":"Hamot: A hierarchical adaptive framework for robust multi-object tracking in complex environments,","venue":null,"work_id":"ef8da640-c581-46b6-adbb-83813121bbc0","year":2025},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-15T03:48:35.155534Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.076547Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:9a26b92b1ba512a8d2a23208e72b9413bd3c2e916b5b31b515d8188405990f03","observation_id":"3ec1f5fc-3d76-4fe4-9268-6e610af93803","resolution":{"observed_at":"2026-08-10T22:27:41.016711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:41.003108Z","title":"Imagenet classifi- cation with deep convolutional neural networks,","venue":null,"work_id":"b77fb17c-6016-412c-9780-2d387063f9ad","year":2012},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-15T03:48:35.155534Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.079916Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:8db733af9acd1cd60805dcea23d41c180c606b003e86897d65fe5d74b63a255b","observation_id":"6b0a8d14-7003-4e49-ab4f-41958b95d69c","resolution":{"observed_at":"2026-08-10T22:27:41.006540Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.993005Z","title":"Facelivt: Face recognition using linear vision transformer with structural reparameterization for mobile device,","venue":null,"work_id":"9bf1a60d-adfd-438c-8864-df23f2ece089","year":2025},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-15T03:48:35.155534Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.083436Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:3c817db26ff55d16539a8465506833ebfb2e3ea09d32aba52b8277b48fb354f1","observation_id":"1b672238-dcfa-4771-92ed-e303f32fa285","resolution":{"observed_at":"2026-08-10T22:27:40.996640Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.983151Z","title":"Facelivtv2: An improved hybrid architecture for efficient mobile face recognition,","venue":null,"work_id":"6b75bdfd-3c69-4f62-9508-ba025a362ca5","year":2026},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-15T03:48:35.155534Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.095593Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:9178df29ce65e7e1f2b5da9252a43d180636ddc556953d929f6a6827d32147f3","observation_id":"aba0f7d5-da88-4d41-8800-d78c7bbcb1e0","resolution":{"observed_at":"2026-08-10T22:27:40.986791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.973017Z","title":"Video analytics for detecting motorcy- clist helmet rule violations,","venue":null,"work_id":"ac24eeba-d1bb-4394-b449-32b820c8aafc","year":2023},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-15T03:48:35.155534Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.100508Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:ce7f7bc30403d59e6920b425f1a35b55b8852c6502040870e609f8d9da32ce7b","observation_id":"d4e927d7-c21b-4282-aa1c-e235fa952a32","resolution":{"observed_at":"2026-08-10T22:27:40.976884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.962875Z","title":"Smiletrack: Similarity learning for occlusion-aware multiple object tracking,","venue":null,"work_id":"94ed884d-1e24-46a7-903c-9b113b558f40","year":2024},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-15T03:48:35.155534Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.104805Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:51dd0c92aae0f014437362523bf439be4f557179d43ca9fbf8ad43b497402195","observation_id":"115cada3-891f-4498-be39-4a779f6fad24","resolution":{"observed_at":"2026-08-10T22:27:40.966465Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.952413Z","title":"Lighttrack-reid: A lightweight and occlusion-robust framework for multi-object tracking,","venue":null,"work_id":"afcd5aa6-db58-425e-a205-b4cc3a632dab","year":2026},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-15T03:48:35.155534Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.109170Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:31a423391ae56d4700e90703cf8f2880e8a9234a5fabb97342b5b933fc59760c","observation_id":"25b79e1e-d969-478c-a333-1a8b44984e81","resolution":{"observed_at":"2026-08-10T22:27:40.956229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.941638Z","title":"Ssp-sam: Sam with semantic- spatial prompt for referring expression segmentation,","venue":null,"work_id":"56667418-498e-4698-baeb-14d136a31e83","year":2025},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-15T03:48:35.155534Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.113254Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:ddd8c2e9c89204442f59c01d2e83b911fb6cfb40a8637da48e6211da90ddf7a5","observation_id":"07a36462-cc76-463d-bd06-260ce87bd08d","resolution":{"observed_at":"2026-08-10T22:27:40.945255Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1212.0402","last_updated":"2012-12-03T14:45:31Z","snapshot_observed_at":"2026-08-15T13:34:03.745436Z","submitted_at":"2012-12-03T14:45:31Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1212.0402","snapshot_observed_at":"2026-08-10T22:27:40.117497Z","title":"Ucf101: A dataset of 101 human actions classes from videos in the wild,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-15T03:48:35.155534Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.117497Z"},"links":{"cited_paper":"/paper/1212.0402","citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:c26678bcd2b0fd2c25eb55122cf8221cc829ca83e453efe27e5b9618628d89a8","observation_id":"8615bf5f-10dd-46d8-89f3-c23fc20a300f","resolution":{"observed_at":"2026-08-10T22:27:40.117497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1705.06950","last_updated":"2017-05-19T12:07:01Z","snapshot_observed_at":"2026-08-15T11:35:18.832923Z","submitted_at":"2017-05-19T12:07:01Z","title":"The Kinetics Human Action Video Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.06950","snapshot_observed_at":"2026-08-10T22:27:40.122220Z","title":"The kinet- ics human action video dataset,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-15T03:48:35.155534Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.122220Z"},"links":{"cited_paper":"/paper/1705.06950","citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:8d27746b5b8539c1f411b7600ca300cbf6ecd64d91f79768818c31c787e8b8da","observation_id":"7a7efa79-b9ab-498f-91ff-58d8ccba52e3","resolution":{"observed_at":"2026-08-10T22:27:40.122220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.930769Z","title":"Benchmarking micro-action recognition: Dataset, methods, and applications,","venue":null,"work_id":"7680c6ab-6180-4edf-a31d-ba275d311616","year":2024},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-15T03:48:35.155534Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.127281Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:8147b75de02c0d3389b61cc0a0b5c69cee22c4db19301b0f48b5129e37042b53","observation_id":"1194cf6b-2017-4347-9730-afaeed236a1f","resolution":{"observed_at":"2026-08-10T22:27:40.934657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.918838Z","title":"Quo vadis, action recognition? a new model and the kinetics dataset,","venue":null,"work_id":"e2961f49-d91d-428b-8986-839c2d1cb70e","year":2017},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-15T03:48:35.155534Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.131656Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:0944119e76bb92a32603bc482220ccea5dd945a25766d8f65bac165f30588b21","observation_id":"4b4263b8-20be-4149-8965-c717202842b3","resolution":{"observed_at":"2026-08-10T22:27:40.922436Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.908378Z","title":"Slowfast networks for video recognition,","venue":null,"work_id":"cf9caa8e-bd79-482e-b097-8cfa194bf7c2","year":2019},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-15T03:48:35.155534Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.136067Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:51d19db18d7f8a0d99967e91e855217726799c636b2b0a1d6ee8094f564f7805","observation_id":"62e2f2dc-7870-41a3-9d90-46fc76f28263","resolution":{"observed_at":"2026-08-10T22:27:40.911990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.898412Z","title":"Spatio- temporal adaptive network with bidirectional temporal difference for action recognition,","venue":null,"work_id":"7153505c-407a-4c57-a34b-d700b90a6a98","year":2023},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-15T03:48:35.155534Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.139961Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:50a6c7493c433915f6daee1ce9713d3a544d0c40bb77df5bc941f9b08e298907","observation_id":"26ea1807-0044-45b1-ba10-5c8df18bb87c","resolution":{"observed_at":"2026-08-10T22:27:40.901766Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.888645Z","title":"Agpn: Action granu- larity pyramid network for video action recognition,","venue":null,"work_id":"a88b9856-67bf-4455-8b7e-58e658e78950","year":2023},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-15T03:48:35.155534Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.143943Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:ba10b7e5b14c41aa270657ab18ae9471c49844b910ed1c7bf06b15a21861200e","observation_id":"cc2b007b-c9da-4e9b-8851-659392ae8da2","resolution":{"observed_at":"2026-08-10T22:27:40.892327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-16T09:25:53.087782Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-10T22:27:40.148881Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-15T03:48:35.155534Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.148881Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:a6d4de4bc6fae17ebf7120178153b691cc034155af03e553c597cb77512a8862","observation_id":"8fd14a40-fad8-4ce5-9bab-b86567274927","resolution":{"observed_at":"2026-08-10T22:27:40.148881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.878739Z","title":"Is space-time attention all you need for video understanding?,","venue":null,"work_id":"69c47844-2be8-49be-8da3-4e1921c35351","year":2021},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-15T03:48:35.155534Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.153414Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:906875638326935781a945de52ad7126f76e7c2dd4c326e13f3fd49b08699f6b","observation_id":"e8798e85-d7cd-470b-bb11-a27c9dec6e2c","resolution":{"observed_at":"2026-08-10T22:27:40.882379Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.868607Z","title":"Video trans- former network,","venue":null,"work_id":"10118c23-0d19-498c-9d38-0f8ea6ecc96d","year":2021},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-15T03:48:35.155534Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.157498Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:926eb59ba9afbd6c148342928cf6e1b7fd7436321f927a59f2cf8669bad8ea87","observation_id":"ce33abab-ab98-4780-a598-eb9d8d758f4d","resolution":{"observed_at":"2026-08-10T22:27:40.872162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.857576Z","title":"Video swin transformer,","venue":null,"work_id":"43ec1333-4da0-4f3c-a70a-b3ad584c2482","year":2022},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-15T03:48:35.155534Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.161526Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:4756081e0b3c0404a873336bd3e48fb30ff4dc42a2a77fa0ea7a3abaf706d434","observation_id":"3044da5a-160d-4259-a067-821e792a9988","resolution":{"observed_at":"2026-08-10T22:27:40.861137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.845509Z","title":"Uniformer: Unifying convolution and self-attention for visual recognition,","venue":null,"work_id":"be076afa-5a1a-45cb-99b3-a13ec395247b","year":2023},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-15T03:48:35.155534Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.165668Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:195dac6cc895051285305caf07ed433c012c9f64bf929c3eefdbbcb3e2559b7f","observation_id":"b0bc3023-a163-4fef-a986-30e193666464","resolution":{"observed_at":"2026-08-10T22:27:40.849775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.834906Z","title":"Token shift transformer for video classification,","venue":null,"work_id":"7bfa3fee-494f-4632-acd4-a9f5bd228e26","year":2021},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-15T03:48:35.155534Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.170393Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:e8f8f00633a0747fc4e519983cdda11ec0ebed509c73798b6a24f6b3a2bfe2bb","observation_id":"3960f5b7-2ff6-40aa-9cf1-c12ea214b332","resolution":{"observed_at":"2026-08-10T22:27:40.838731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.824034Z","title":"Long-term leap attention, short-term periodic shift for video classification,","venue":null,"work_id":"0069da89-dc29-4e93-8787-dc055de5138b","year":2022},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-15T03:48:35.155534Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.174913Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:a4d9fbf2b8b11d63801d21c6c2333dfda6c4e8ab41c56c894f2f70760c4e7aa8","observation_id":"463272fb-7394-4e9a-9dfe-22b32e2c2ab8","resolution":{"observed_at":"2026-08-10T22:27:40.827829Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.813677Z","title":"Temporal shift module-based vision transformer network for action recognition,","venue":null,"work_id":"1a5417e2-729f-4ff8-8b7e-32a4b2938eec","year":2024},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-15T03:48:35.155534Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.179422Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:029bb89c79f12da5fb5363120d5eab88c0ae01d0a87669e4b199f447781a0c81","observation_id":"1414484c-054b-4516-a2f6-83214a961ae3","resolution":{"observed_at":"2026-08-10T22:27:40.817466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.803090Z","title":"Tsm: Temporal shift module for efficient and scalable video understanding on edge devices,","venue":null,"work_id":"e2196282-3bc4-4d2a-954e-3b0007faa9a0","year":2022},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-15T03:48:35.155534Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.183365Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:7781e124b189efb29143a84c1fd1881d4cee95d91c78982d3f27fa02bf892e53","observation_id":"04d9fdcb-6eab-4b31-a445-aeea2fb72618","resolution":{"observed_at":"2026-08-10T22:27:40.807475Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.792810Z","title":"Deep residual learning for image recognition,","venue":null,"work_id":"6a710e46-772a-42ed-8303-0f1d89ed403f","year":2016},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-15T03:48:35.155534Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.187289Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:5cf7c01198c42fd4da70ef0837cea1cd865c642bb94c08d3df2c662649b32daa","observation_id":"0bf1222e-5649-486f-96a1-aa4919480ef8","resolution":{"observed_at":"2026-08-10T22:27:40.796691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.782319Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows,","venue":null,"work_id":"97fa5c44-e77b-4a78-b298-ac0f08e43526","year":2021},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-15T03:48:35.155534Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.191220Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:7cf9fa4eff7adb4f9c1822c45a023cb14ad123eb36ddf14be0e7ec0040d965f1","observation_id":"772b8dea-c713-446b-9342-447d31407942","resolution":{"observed_at":"2026-08-10T22:27:40.785994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.771492Z","title":"Movinets: Mobile video networks for efficient video ACCEPTED ON IEEE INTERNET OF THINGS JOURNAL 15 recognition,","venue":null,"work_id":"4aa76c6c-a97e-4c8c-8bd9-0a5ebbac8ab4","year":2021},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-15T03:48:35.155534Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.195231Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:4419dbb74f6bfc856c2ee6dd4587c39af91c1570dbda5d7d6b1040ceee5dbc19","observation_id":"6ad807c0-1c73-4d7f-9606-7e8fdd14d417","resolution":{"observed_at":"2026-08-10T22:27:40.775546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.760869Z","title":"Deepsensemoe: Harnessing power of time series foundation models for few-shot human activity recognition,","venue":null,"work_id":"e1cb021a-86ec-4e04-bc1b-29fd376eb8c3","year":2026},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-15T03:48:35.155534Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.198969Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:23e70d4366d1e9e61e4b5a0dea6b9c7e281042abe663a6d8a4348d7aa7c71d59","observation_id":"9d08b420-9f98-4c2b-b032-70a8f1cb964e","resolution":{"observed_at":"2026-08-10T22:27:40.764881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.750390Z","title":"Sensor- prompt tuning: Aligning time series foundational models with motion sensors for few-shot activity recognition,","venue":null,"work_id":"2b5d9bb1-563b-49f3-957a-6fd74af63ea8","year":2026},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-15T03:48:35.155534Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.203337Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:2a21b5bb9a3dc3b611a4d687ec737a65c462526a9fbacbf52f98128cb52a2eab","observation_id":"6c045643-67e1-4125-b284-596da58b7944","resolution":{"observed_at":"2026-08-10T22:27:40.754344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.739622Z","title":"Deep convolutional state space model as human activity recognizer,","venue":null,"work_id":"2421f833-5848-49f5-8f1f-f32d68633add","year":2025},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-15T03:48:35.155534Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.207439Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:c645e1232b3228328a72105bc1a869a6e9f87b61247f5c711c6c05e105b9a61c","observation_id":"5bc425de-23e7-4ef0-8155-74d804e89a77","resolution":{"observed_at":"2026-08-10T22:27:40.743235Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.729342Z","title":"Learn- ing spatiotemporal features with 3d convolutional networks,","venue":null,"work_id":"c44588a6-18ce-4382-a50a-bfeb8b9e45b9","year":2015},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-15T03:48:35.155534Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.211573Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:5a6929cde853ad09e90d9231bd4cdb5797be63cd4708b07d0aeb66051d905e2f","observation_id":"b542c21c-f478-417e-8558-f9abb5e7654c","resolution":{"observed_at":"2026-08-10T22:27:40.732960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.718887Z","title":"A closer look at spatiotemporal convolutions for action recognition,","venue":null,"work_id":"67f56a05-e769-4260-847e-845ee3b57345","year":2018},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-15T03:48:35.155534Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.215876Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:66fadcc3d577c61a1cc7c49af5dbc13e1d66497a1f6230f3e0ee2e3e96b190e4","observation_id":"c064a65e-95c7-4a90-bfcd-e2333808ac90","resolution":{"observed_at":"2026-08-10T22:27:40.722844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.708539Z","title":"Tsm: Temporal shift module for efficient video understanding,","venue":null,"work_id":"1bf40c6d-c50e-4531-aaec-b3908a4b5cd6","year":2019},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-15T03:48:35.155534Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.220270Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:1d4ff52dda92ae7dbd5d6c308c7ef218c3f2ce39b56a66c7bd9845c826d92909","observation_id":"889b1fdd-02e0-4eff-96ba-2b1ae6d532b6","resolution":{"observed_at":"2026-08-10T22:27:40.712154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.698423Z","title":"X3d: Expanding architectures for efficient video recognition,","venue":null,"work_id":"7a1cfc1a-13f5-4da8-b503-14479bf3c3d0","year":2020},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-15T03:48:35.155534Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.224379Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:c3bea191da500818599d817b4e04e6983dad2ba23b6ce20b2745274956837e83","observation_id":"3d071749-dd3b-42a2-9c07-3981aa196216","resolution":{"observed_at":"2026-08-10T22:27:40.701981Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.687978Z","title":"Mtrfn: Multiscale temporal receptive field network for compressed video action recognition at edge servers,","venue":null,"work_id":"9cbe6651-dbcf-43e9-8510-088c56fc6647","year":2022},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-15T03:48:35.155534Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.228568Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:674c02f13f558810c69bb212ccb632f56a952a43f56f061555f94c2860611b84","observation_id":"729c1e57-65a2-4d73-81cb-26df37db1c56","resolution":{"observed_at":"2026-08-10T22:27:40.691571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.677365Z","title":"Temporal transformer networks with self-supervision for action recognition,","venue":null,"work_id":"149841f5-2fe7-43d3-a1ea-e195ce522b88","year":2023},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-15T03:48:35.155534Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.232932Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:534896597146e4c6d2d0cdc0fd8f2d2ab419b3484a9f54c1c04e58d6ef960b26","observation_id":"5b77e6e9-d2db-4631-b17f-7e60f9a968b0","resolution":{"observed_at":"2026-08-10T22:27:40.681114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.666463Z","title":"Pyramid vision transformer: A versatile backbone for dense prediction without convolutions,","venue":null,"work_id":"76cfad3c-66b9-4682-81b9-19760bbb30e8","year":2021},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-15T03:48:35.155534Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.237403Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:3fcddcc4cf212b0703884b698e49c3f730de38c3cdec00d8d80a907ca5c039de","observation_id":"95c756aa-a568-4c49-a90c-ce7b5bfe3865","resolution":{"observed_at":"2026-08-10T22:27:40.670335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.654408Z","title":"Pvt v2: Improved baselines with pyramid vision transformer,","venue":null,"work_id":"926a06b6-27fe-4f03-a6c6-e46b051340c9","year":2022},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-15T03:48:35.155534Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.241727Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:eebf792e2c9005d8f10dd1466c08624ac3cf14eaf6facaff508e52b0043aaeea","observation_id":"d1b090fb-e234-4404-a965-50a561d4c5b5","resolution":{"observed_at":"2026-08-10T22:27:40.658243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.643009Z","title":"Edgenext: efficiently amalgamated cnn-transformer architecture for mobile vision applications,","venue":null,"work_id":"28bb0cc8-f84a-4261-b554-f093f8d42e76","year":2022},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-15T03:48:35.155534Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.246619Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:fa6093010b9667711af2e9179645cb0c6f395e58971e2f602cec58a29497c0cc","observation_id":"ccbfb6c9-0cfc-4c6e-9830-bf21875327dd","resolution":{"observed_at":"2026-08-10T22:27:40.647566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.631237Z","title":"Fastvit: A fast hybrid vision transformer using structural reparameteriza- tion,","venue":null,"work_id":"da0483e5-27b0-4ef2-9c1c-f5d022bbf8bc","year":2023},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-15T03:48:35.155534Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.251729Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:79402d29393821f49256039ea1cce4df3ab67e696c6ed1efb181c59576ce2cbe","observation_id":"1b78b9a3-814b-45ac-a18d-ab3b3aaca3e9","resolution":{"observed_at":"2026-08-10T22:27:40.635765Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.621054Z","title":"Effi- cientvit: Memory efficient vision transformer with cascaded group attention,","venue":null,"work_id":"cc3d351d-8ab5-4db4-949a-1c1650c45177","year":2023},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-15T03:48:35.155534Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.257204Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:4c98479b61f4b334297318adf354c90ee3bb99c4819645edd3184146f701aefb","observation_id":"752c26c3-a8d0-481d-9f8c-6dfbf5cc5ae8","resolution":{"observed_at":"2026-08-10T22:27:40.624674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.611384Z","title":"Rethinking vision transformers for mobilenet size and speed,","venue":null,"work_id":"3ad734f8-394c-41f0-874a-7b202fee44bc","year":2023},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-15T03:48:35.155534Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.262591Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:733eaeee87f309f0cb2c9ff1bdde04ef4683792376f6cdace5ddbd9669fc3b71","observation_id":"4beaa791-5f24-4b2b-8c86-5158c16d44cc","resolution":{"observed_at":"2026-08-10T22:27:40.614803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.601240Z","title":"Shvit: Single-head vision transformer with memory efficient macro design,","venue":null,"work_id":"f0969bd3-7f97-49e1-a16d-063272a5ee4b","year":2024},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-15T03:48:35.155534Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.267725Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:ab1efc08703a793deb5a1a8d0f13474aa01153fde83eaeb58b1968823fbe7955","observation_id":"b5c99eb8-664c-4ef5-8860-264cf1970b49","resolution":{"observed_at":"2026-08-10T22:27:40.604805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.591655Z","title":"S2aformer: Strip self-attention for efficient vision transformer,","venue":null,"work_id":"4da8dc90-c654-47f9-a614-67a0f1528bf2","year":2025},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-15T03:48:35.155534Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.273334Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:a66645690bcba9a0b2fc4e5466cce632fdbea28e003def38d3e043c7af21af85","observation_id":"04aa0bbd-f7bf-4c89-8bda-e918efc119aa","resolution":{"observed_at":"2026-08-10T22:27:40.595095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.581596Z","title":"Training data-efficient image transformers & distilla- tion through attention,","venue":null,"work_id":"ac25b8f3-ffdf-445c-acc8-8c697a5025f9","year":2021},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-15T03:48:35.155534Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.279089Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:a0e6ca0c4462f0df38d3962cbb5dfce0c5b9e138f2d644d9e874b8d7c7cfd48a","observation_id":"aef23658-fa46-492f-a303-37dfa7c8481c","resolution":{"observed_at":"2026-08-10T22:27:40.585278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.571171Z","title":"Tlee: Temporal-wise and layer-wise early exiting network for efficient video recognition on edge devices,","venue":null,"work_id":"32b0ec2d-4f5b-4919-8f51-2944ff2e3e49","year":2023},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-15T03:48:35.155534Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.284367Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:86648482da5f33415f8b813b2ede2dbdc4e3ca1c3bfc9843056d47a981b69d8f","observation_id":"c4753d23-db85-4daa-bd20-490a226cb9ad","resolution":{"observed_at":"2026-08-10T22:27:40.574896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.561108Z","title":"Conditional positional encodings for vision transformers,","venue":null,"work_id":"d9751f24-4752-4d69-bd58-a275039a38b6","year":2021},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-15T03:48:35.155534Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.289822Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:dce0104967a7d2c1d772825cd2d55e11e727f771c5e7b62d99ada9ff3e377fee","observation_id":"b7eacfc3-ca65-47d7-929c-9ac7e9abf9cd","resolution":{"observed_at":"2026-08-10T22:27:40.564719Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.550661Z","title":"Imagenet large scale visual recognition challenge,","venue":null,"work_id":"a768131b-985a-410b-abdd-3a1ef0a92235","year":2015},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-15T03:48:35.155534Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.294883Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:f282e10c5882640b6d56e9537f9b10fd8ddeb1f20be1405c4faf395182e9b6dd","observation_id":"c5b0fe72-9df0-48ea-8447-996c99abc3e7","resolution":{"observed_at":"2026-08-10T22:27:40.554668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.539822Z","title":"Iformer: Integrating convnet and transformer for mo- bile application,","venue":null,"work_id":"328c2c81-2b48-4466-8fd0-d73339e9b8df","year":2025},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-15T03:48:35.155534Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.298796Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:0d7369de6051bb30ccd631356dde6540474f96af407d3086a985f1692e6987a5","observation_id":"a0359cc6-4548-4b47-93ec-df57e8c33dbc","resolution":{"observed_at":"2026-08-10T22:27:40.543574Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.529406Z","title":"Microvit: a vision transformer with low complexity self attention for edge device,","venue":null,"work_id":"b0928019-1431-4375-88e8-130c46316489","year":2025},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-15T03:48:35.155534Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.302353Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:fd47755af8088b409758170ba75bc43c3cde911329f219897e2faae451c75c5c","observation_id":"478bf45f-a4b1-4e34-9118-af9a6d1f8e93","resolution":{"observed_at":"2026-08-10T22:27:40.533254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.00962","last_updated":"2020-01-03T06:53:00Z","snapshot_observed_at":"2026-08-16T03:15:11.732149Z","submitted_at":"2019-04-01T16:53:35Z","title":"Large Batch Optimization for Deep Learning: Training BERT in 76 minutes","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.00962","snapshot_observed_at":"2026-08-10T22:27:40.305685Z","title":"Large batch optimization for deep learning: Training bert in 76 minutes,","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-15T03:48:35.155534Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.305685Z"},"links":{"cited_paper":"/paper/1904.00962","citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:3bf67a04e0e3db0f09118b0db72fda2b0efe970ba46ee57188958a42e089bbea","observation_id":"51d46b3f-33ab-4ba9-a11d-3fb252a9bef7","resolution":{"observed_at":"2026-08-10T22:27:40.305685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.518659Z","title":"Group contextualization for video recognition,","venue":null,"work_id":"17fce9cd-1ebc-4335-9aad-339cffdacb51","year":2022},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-15T03:48:35.155534Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.309572Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:e4c6afac54e918f25b70e1e5c8db01c88ac3305a97d55ba3cf3084bdcfe8a2b6","observation_id":"b731ffae-4e2c-4e47-ac7a-7fe3e1cf27cc","resolution":{"observed_at":"2026-08-10T22:27:40.522633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.507970Z","title":"Learning spatiotem- poral and motion features in a unified 2d network for action recognition,","venue":null,"work_id":"c640e55f-9c92-4f9d-8dfd-2a1c820bdeca","year":2022},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-15T03:48:35.155534Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.313640Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:b4c4ca16fe41ee1ec8946eb8b2a01318639e1ed7fd5682016b735033ee8910a8","observation_id":"e1eae3e9-f5ae-4e1d-99a6-98ad33e4bfc9","resolution":{"observed_at":"2026-08-10T22:27:40.511593Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.497643Z","title":"Multiscale vision transformers,","venue":null,"work_id":"f4eb5a2a-8cfc-44fe-929c-facb7639e147","year":2021},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-15T03:48:35.155534Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.317104Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:70b44919d68860e4763a4539fcc7db194474e6fcb2009196455cb953e2e223c3","observation_id":"2174d477-b034-4b21-8254-dd2b83a0c945","resolution":{"observed_at":"2026-08-10T22:27:40.501117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.485811Z","title":"Dualactnet: Exploiting slowfast architecture for micro-action recognition,","venue":null,"work_id":"8dffdf5f-d42c-411d-b15d-aa7bbfff54c7","year":2024},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-15T03:48:35.155534Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.320808Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:fca02c4b47ab082aa510087d4bdb0cba0662d12f98b2baab7b988a14b8ca70c8","observation_id":"3ca3896b-5bed-4a27-b671-2078122ca882","resolution":{"observed_at":"2026-08-10T22:27:40.489940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.473438Z","title":"Tdn: Temporal difference networks for efficient action recognition,","venue":null,"work_id":"3b27a57a-664f-4c12-a0e2-3888db379a19","year":1904},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-15T03:48:35.155534Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.324351Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:36c6213b34557405f4be0b37baad20bae70607babdac2cc562d9bedc8579b58e","observation_id":"93cdfa9f-f153-45ec-8485-cf68f92763a4","resolution":{"observed_at":"2026-08-10T22:27:40.477359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.10155","last_updated":"2019-08-27T12:16:55Z","snapshot_observed_at":"2026-08-14T10:48:47.565970Z","submitted_at":"2019-08-27T12:16:55Z","title":"Mobile Video Action Recognition","version":1},"cited_work":{"arxiv_id":"1908.10155","doi":null,"metadata_source":"pith","pith_arxiv_id":"1908.10155","snapshot_observed_at":"2026-08-10T22:27:40.372824Z","title":"Mobile Video Action Recognition","venue":"cs.CV","work_id":"fa43a1a3-9c6f-4a04-b4a0-e7b9c986bac6","year":2019},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-15T03:48:35.155534Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.327863Z"},"links":{"cited_paper":"/paper/1908.10155","citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:6004a4a8776f72e02a9a904ed2aeb882d00e29dc2b47e394e0558903d162b00c","observation_id":"c8d05b21-cdd9-4aec-bba6-d7c78fb0df7c","resolution":{"observed_at":"2026-08-10T22:27:40.378607Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.462058Z","title":"Compressed video action recognition,","venue":null,"work_id":"417273c4-a256-4e12-80b2-c1210e50a55c","year":2018},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-15T03:48:35.155534Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.331790Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:4fd925aa0cdc427ed3415e26a5389f8c704c1c0dfba2d5ea169d5733363d60fb","observation_id":"5cd6d466-e69a-4f01-aeca-31dfc4634eb3","resolution":{"observed_at":"2026-08-10T22:27:40.466025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.450519Z","title":"Afd- former: A hybrid transformer with asymmetric flow division for synthesized view quality enhancement,","venue":null,"work_id":"54de0de4-6be1-48e2-8234-338b658c5550","year":2023},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-15T03:48:35.155534Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.335302Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:c3a55598556ec787723608ffe9c425cca6e5f48348e8bf225812308e170fd826","observation_id":"fbd6d38c-f0ea-419d-8702-989a200502b0","resolution":{"observed_at":"2026-08-10T22:27:40.454538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.438447Z","title":"Token fusion: Bridging the gap between token pruning and token merging,","venue":null,"work_id":"8108acac-1dcc-435f-b283-aa5db5e738b9","year":2024},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-15T03:48:35.155534Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.338827Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:03d0066ce296cd7a0dccac61ebd93f4eb83b801a45a919800a75fdb223f0822f","observation_id":"4295a7c9-5fcc-4ede-af2d-9de71e111506","resolution":{"observed_at":"2026-08-10T22:27:40.442445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:40.426470Z","title":"He is currently a Full Professor with the Department of Electronic and Computer Engineering, National Taiwan University of Science and Technology","venue":null,"work_id":"644cb8f6-7d92-4d48-a846-238b4bfd6497","year":2005},"citing_paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","snapshot_observed_at":"2026-08-15T03:48:35.155534Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition","version":1},"reference_index":2011,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:40.342777Z"},"links":{"citing_paper":"/paper/2608.06691"},"observation_digest":"sha256:bb54bf948179ad91a0ceedc779a04f2a9c9d5f036d18edc0e6df3b06114ae48b","observation_id":"cc0be8c5-e969-41e8-962b-04edaeae6b16","resolution":{"observed_at":"2026-08-10T22:27:40.430469Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.06691","last_updated":"2026-08-07T01:40:20Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T03:48:35.155534Z","submitted_at":"2026-08-07T01:40:20Z","title":"CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition"},"reference_resolution":{"displayed":68,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":4,"verified_exact":1,"verified_fuzzy":63},"total_outbound_references":68},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 68 of 68 outbound references and 0 inbound Pith citation observations for arXiv:2608.06691."}