{"as_of":"2026-08-10T04:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7abd2eff19803b7302c244974ce764d36078f1a8c2d50e85d07b969afa6205a8","coverage":[{"denominator":95,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":95,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T16:52:55.019874Z","state":"measured"},{"denominator":95,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":95,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.12426/citation-record","integrity":"/paper/2507.12426/integrity","json":"/paper/2507.12426/citation-record.json","paper":"/paper/2507.12426"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:52:46.543670Z","title":"Quo vadis, action recognition? a new model and the kinetics dataset,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-08T21:26:36.687030Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:46.543670Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:a3b087860909383001e4e483eb8058546cb05e763a6175b4b561a37a41f84385","observation_id":"7d6fa9a7-95b3-4e9b-b0c8-bfc6deb3b292","resolution":{"observed_at":"2026-08-06T16:52:46.543670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:52:46.603264Z","title":"Spatiotemporal residual networks for video action recognition,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-08T21:26:36.687030Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:46.603264Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:f2fd213275abcdb751572ee51980d91a896c8e407df3d88697d8a2ab16f1fbdd","observation_id":"f6dfecc4-6bac-46de-8600-043905dbef6d","resolution":{"observed_at":"2026-08-06T16:52:46.603264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:52:46.762590Z","title":"Learning spatiotemporal features with 3d convolutional networks,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-08T21:26:36.687030Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:46.762590Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:e21689149610fbd86c91eb167e6355ba7956951f76aecac89ecdf4b3cc917c1d","observation_id":"da7f7c26-20f2-4582-829d-229133615bd3","resolution":{"observed_at":"2026-08-06T16:52:46.762590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:52:46.834049Z","title":"Large-scale video classification with convolutional neural networks,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-08T21:26:36.687030Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:46.834049Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:b2964a0ad0b4655af0085df6de68e2da5406d0a1bce5377723fd5625e315c864","observation_id":"1139d00a-d086-4239-9ee1-f7fbbe824386","resolution":{"observed_at":"2026-08-06T16:52:46.834049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:52:46.912945Z","title":"Beyond short snippets: Deep networks for video classification,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-08T21:26:36.687030Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:46.912945Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:0d4869470f8649c46f43468daabf33e9a538802f6dd2a9484d3b6b0f4f729f3c","observation_id":"81df5fdd-3704-4da7-864d-36ff4ef50b15","resolution":{"observed_at":"2026-08-06T16:52:46.912945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:52:46.999396Z","title":"Two-stream convolutional networks for action recognition in videos,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-08T21:26:36.687030Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:46.999396Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:df3762ad8654110e84b4c988b4aa4d92db098b5ede0ecd6b27aff1f705a455fc","observation_id":"30e07942-23e6-46a0-9685-6d2274f38ca8","resolution":{"observed_at":"2026-08-06T16:52:46.999396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:52:47.061463Z","title":"Action recognition using deep 3d cnns with sequential feature aggregation and attention,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-08T21:26:36.687030Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:47.061463Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:7ff4c278ccd6548524a10410e44a3be7b020d78c6ffe87fc309a12d3be5f1803","observation_id":"2ab53b6f-85c6-446e-b41c-2ad3340312f1","resolution":{"observed_at":"2026-08-06T16:52:47.061463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:52:47.139621Z","title":"A closer look at spatiotemporal convolutions for action recognition,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-08T21:26:36.687030Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:47.139621Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:4d6fb0b87a0c9eb138d06424785d9e97356bc51ddc03e77d525bcea5a22ef58c","observation_id":"befd3be9-d7eb-4f72-a1a3-e92c65ab6b2a","resolution":{"observed_at":"2026-08-06T16:52:47.139621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:52:47.215422Z","title":"Human action recognition in videos using convolution long short-term memory network with spatio-temporal networks,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-08T21:26:36.687030Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:47.215422Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:8e53a275b4f2ee728dbe1f0ad3fe99f0a1908d37387a287451380803ec28d843","observation_id":"89171f78-0d81-4a0f-8b44-9d16f4498847","resolution":{"observed_at":"2026-08-06T16:52:47.215422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:52:47.293116Z","title":"Action recognition in videos using pre-trained 2d convolutional neural networks,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-08T21:26:36.687030Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:47.293116Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:f073de163b497f7167b8ff203d984dc336c8e8bc24069beb3a50fac3a1caad6f","observation_id":"ea61037a-f432-42f1-8c1e-5bc5d0ed4871","resolution":{"observed_at":"2026-08-06T16:52:47.293116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:52:47.365973Z","title":"Video-focalnets: Spatio-temporal focal modulation for video action recognition,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-08T21:26:36.687030Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:47.365973Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:6667d4f9a77b71d5438c79373e17b72f5e1177f20776d8a85f045022b2bc2bb4","observation_id":"57809d8d-af21-4dad-a9c4-caa9ce0ce57b","resolution":{"observed_at":"2026-08-06T16:52:47.365973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:52:47.458192Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-08T21:26:36.687030Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:47.458192Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:cafe574366d96a20e2fce582f63c180c5b0e22697d4891c128569c7ce94c6bf9","observation_id":"cbd63ea4-ac98-4630-b0d5-2f34a2a50e21","resolution":{"observed_at":"2026-08-06T16:52:47.458192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:52:47.549508Z","title":"Morph: flexible acceleration for 3d cnn-based video understanding,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-08T21:26:36.687030Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:47.549508Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:7168b00f831bae34e76a9958c42c94c0e5c8210baa209bddda8f49d11d744e78","observation_id":"94573c9d-c9d9-405f-a809-205fd9385d3b","resolution":{"observed_at":"2026-08-06T16:52:47.549508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:52:47.646960Z","title":"Video swin transformer,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-08T21:26:36.687030Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:47.646960Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:09c4d633715e0fc75fa06dba8a0d3c09e9eba75b4885b347414038bf9738939b","observation_id":"7dacace1-b6ab-4d7f-a2f6-134e5c83ccb9","resolution":{"observed_at":"2026-08-06T16:52:47.646960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:52:47.720373Z","title":"Is space-time attention all you need for video understanding?","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-08T21:26:36.687030Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:47.720373Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:b9b44c830d0df0cba6082d630ba74d98d3fdcdf56e3d6302a96c910a619eb388","observation_id":"f0cf805b-b70b-45ea-9f7b-4c0d38c27a59","resolution":{"observed_at":"2026-08-06T16:52:47.720373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:53:06.295815Z","title":"Vivit: A video vision transformer,","venue":null,"work_id":"16d52d46-7c16-4aad-b83e-4bb4caceddae","year":2021},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-08T21:26:36.687030Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:47.802678Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:e0985efaf5c964d66246f2d4c0ec745090461e83bbcb6647f3e1522ff56f5ab4","observation_id":"3eb7b69d-ddd7-49e0-9c4f-fe022bf11c61","resolution":{"observed_at":"2026-08-06T16:53:06.347041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:53:06.185665Z","title":"Video swin transformer,","venue":null,"work_id":"ad6476f6-536d-4508-8813-57412b7a1945","year":2022},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-08T21:26:36.687030Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:47.915356Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:20bd31f5781200a934d562cba9c010a451f9a11c5f038242c175493d2f9da01a","observation_id":"82e5e3f7-b6c3-41a8-9fc9-f6b66ec19b23","resolution":{"observed_at":"2026-08-06T16:53:06.256262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:53:05.929428Z","title":"Multiview transformers for video recognition,","venue":null,"work_id":"aba279cd-a984-4842-9a64-36f68f2d3b76","year":2022},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-08T21:26:36.687030Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:48.002422Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:150852b2ea2f3701fbfdcda74ebe3506427e06aede01b6b18bc357ddf8ccdac8","observation_id":"05571d0b-4696-43a4-a4c0-f3ef2b565420","resolution":{"observed_at":"2026-08-06T16:53:06.027968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:53:05.726144Z","title":"Vivit: a video vision transformer,","venue":null,"work_id":"57ddd6ea-7fe1-402f-b863-0483f67a74f7","year":2021},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-08T21:26:36.687030Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:48.113860Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:673510be4e81eb2eaca00c43168312efc770f9cfb686c8642a48b6fc6e7540e2","observation_id":"d19db6ac-64a3-4d5b-8bc4-38a75d42c01d","resolution":{"observed_at":"2026-08-06T16:53:05.838377Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.06987","last_updated":"2022-10-17T19:58:40Z","snapshot_observed_at":"2026-07-06T08:08:03.081236Z","submitted_at":"2019-07-15T12:58:21Z","title":"A Short Note on the Kinetics-700 Human Action Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.06987","snapshot_observed_at":"2026-08-06T16:52:48.257823Z","title":"A short note on the kinetics-700 human action dataset,","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-08T21:26:36.687030Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:48.257823Z"},"links":{"cited_paper":"/paper/1907.06987","citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:1af1467ac3f4bfe0b555d6428a5caa94fa7a0e8141d64df29125d693a9b3b038","observation_id":"b1bcdfe6-4cdc-44f8-aad7-61da12e91435","resolution":{"observed_at":"2026-08-06T16:52:48.257823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:53:05.480592Z","title":"The\" something something","venue":null,"work_id":"ee4e4e30-a27a-48fe-92ba-f69b88f176cc","year":2017},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-08T21:26:36.687030Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:48.310977Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:3ce97a8f80d3b0648d958cad459608b5142e1bb93e904718a2e069aa463ea504","observation_id":"a818e4a1-4b5e-4a94-b1fa-ad39061bc3c9","resolution":{"observed_at":"2026-08-06T16:53:05.619678Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:53:05.294045Z","title":"Tsnet: token sparsification for efficient video transformer,","venue":null,"work_id":"5615ef7a-05f7-415f-b690-1ad48af5f1b3","year":2023},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-08T21:26:36.687030Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:48.397443Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:8d5dddd53fdf29981c8a26895accf476d3b3d60e6e4a16107f5a4f70cf64d0b0","observation_id":"619217a0-41a1-4d5f-bb13-e281e3ab75a4","resolution":{"observed_at":"2026-08-06T16:53:05.374484Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:53:05.126976Z","title":"Dualformer: local- global stratified transformer for efficient video recognition,","venue":null,"work_id":"59b7425f-342e-48d1-bbe3-3e6c0d54df50","year":2021},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-08T21:26:36.687030Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:48.495776Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:74e4903e33ec795d95ce0810b4ab9f8beee13fc9d4d66ae3da3a3eda060eb8d8","observation_id":"14426831-847c-42f1-a119-ab7de1c633fd","resolution":{"observed_at":"2026-08-06T16:53:05.198144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:53:04.927965Z","title":"Aerobics action recognition algorithm based on three-dimensional convolutional neural network and multilabel clas- sification,","venue":null,"work_id":"e2002952-e390-4c41-b1fa-2e38694a9ff3","year":2021},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-08T21:26:36.687030Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:48.645264Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:7f2948eb977b99e7fe54d0069f33bfe36ec88530bb1f9f9c9a77ff423df2f0ad","observation_id":"9e639f13-90b9-4e10-890f-1c9f41288763","resolution":{"observed_at":"2026-08-06T16:53:05.032271Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:53:04.694391Z","title":"Tsm: temporal shift module for efficient video understanding,","venue":null,"work_id":"302689ff-4022-4c59-82f7-3b1084be9168","year":2019},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-08T21:26:36.687030Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:48.745524Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:7c6be8aba92dc5ba85d5b85ef51dd5357e039dbc597a8f4f08a8e233b4566a3c","observation_id":"ecd963af-485a-4dc1-8fed-b62f79566714","resolution":{"observed_at":"2026-08-06T16:53:04.810289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:52:48.903466Z","title":"Multi-stream interaction networks for human action recognition,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-08T21:26:36.687030Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:48.903466Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:3b46f66b20f480c60b47708366a78d0cfbc1c2e9af188bf61df79e73179f1e46","observation_id":"02dadde9-ea1b-43a4-9339-e281a66574ed","resolution":{"observed_at":"2026-08-06T16:52:48.903466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:53:04.488656Z","title":"Spatio- temporal adaptive network with bidirectional temporal difference for action recognition,","venue":null,"work_id":"a75279ab-3f45-4027-b2b4-859454d5cf4e","year":2023},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-08T21:26:36.687030Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:48.988513Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:7aa9d544e7796fe0aaf0089398687806a610b524453c6b10ba9c23f54e52463b","observation_id":"f4125143-b5a1-47c0-ad04-f863252f597f","resolution":{"observed_at":"2026-08-06T16:53:04.577825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:53:04.284275Z","title":"Agpn: Action granularity pyramid network for video action recognition,","venue":null,"work_id":"63baa2f9-9f11-4fc4-a087-eb8183b21a10","year":2023},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-08T21:26:36.687030Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:49.052816Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:045243fb51f48a7f0162c04681e5b26f70f7824bc742112852d88776dc86c8d8","observation_id":"7239b067-039d-4a18-b7ed-b876d7c032a5","resolution":{"observed_at":"2026-08-06T16:53:04.413558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:53:04.094932Z","title":"Mawkdn: A multimodal fusion wavelet knowledge distillation approach based on cross-view attention for action recognition,","venue":null,"work_id":"8a9c5e01-ccae-4525-b6b4-030ea4ce410e","year":2023},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-08T21:26:36.687030Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:49.130816Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:83c8f7793c634ae20461a7be0f2e1f221e70b04e5e6b19cf8218c2ab2b24adcd","observation_id":"10739f60-4c9f-4362-bc5d-71672cacce9c","resolution":{"observed_at":"2026-08-06T16:53:04.180393Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:53:03.904063Z","title":"Convolutional neural networks or vision transformers: who will win the race for action recognitions in visual data?","venue":null,"work_id":"135ac3fc-36c9-4b86-992a-437d3fb05d1c","year":2023},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-08T21:26:36.687030Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:49.203358Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:f19599d0b6bfdda569ae11a670c59fcd873bfa4ffb623cf46a791e05b59ec0b9","observation_id":"a3b87581-b7aa-4cce-8d76-78178a971912","resolution":{"observed_at":"2026-08-06T16:53:04.004396Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:53:03.716153Z","title":"Decoupled knowledge distillation,","venue":null,"work_id":"71332dcd-9900-4e50-82c8-b40e2ddc348c","year":2022},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-08T21:26:36.687030Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:49.291727Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:da2c17dd510fd4bb56ef2460ac9317a848e3d59ac6e109c607fe62d2e46912c6","observation_id":"dc449c7c-7aab-4408-9730-7df66158556e","resolution":{"observed_at":"2026-08-06T16:53:03.788026Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:53:03.530977Z","title":"Knowledge distil- lation in video-based human action recognition: an intuitive approach to efficient and flexible model training,","venue":null,"work_id":"44caf298-45c8-41d9-ab75-1312c7ed6be4","year":2024},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-08T21:26:36.687030Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:49.359338Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:062d72765ab8cf2a8b76ddd082ab99d2fb0dfdd72bb9869d34a2197d14b61c52","observation_id":"6c54a01c-3a35-469e-8b2d-214a8e7009c1","resolution":{"observed_at":"2026-08-06T16:53:03.616547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:53:03.356560Z","title":"Tomato leaf disease recognition based on multi-task distillation learning,","venue":null,"work_id":"cba12220-0bc2-4a83-9ce8-9f02534b1ce8","year":2024},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-08T21:26:36.687030Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:49.445207Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:ee05654b53bcb73050650974ec1fa4960cc0d55c20892380f9304529af2a0154","observation_id":"0c4740cb-6e71-425d-b39b-8bb395344d67","resolution":{"observed_at":"2026-08-06T16:53:03.441174Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:53:03.162283Z","title":"Videoadviser: video knowledge distillation for multimodal transfer learning,","venue":null,"work_id":"c3653a10-7552-4616-ac93-0bab50eb4fe0","year":2023},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-08T21:26:36.687030Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:49.510135Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:201ef3c82cc8d4fb09e642be413dbc4e4efa58ad3600584701796ffa4c720a45","observation_id":"abc9a7cf-cff3-428b-86d2-4a8ec455593e","resolution":{"observed_at":"2026-08-06T16:53:03.264063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:53:03.022920Z","title":"Generative model- based feature knowledge distillation for action recognition,","venue":null,"work_id":"e0e408a1-e656-4556-9ea1-d487f273ac7a","year":2024},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-08T21:26:36.687030Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:49.627318Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:9569bd4273f2a2242e1565e9e542e39c1fc35d49a6e745428d3625be928a87f0","observation_id":"f0e5042d-7bdc-44c7-ad1e-eb7de09209f5","resolution":{"observed_at":"2026-08-06T16:53:03.099709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:53:02.817642Z","title":"Distillation of human-object interaction contexts for action recognition,","venue":null,"work_id":"38ae02db-6bf4-4a66-b2aa-aa534a1d324a","year":2021},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-08T21:26:36.687030Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:49.680694Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:f4842e5a33b3da8b5b4def25d185fc1bf79e4fd06be5b4bca81a60979d6be9e6","observation_id":"7ac67c90-6540-4d09-9d3f-49fb1a495643","resolution":{"observed_at":"2026-08-06T16:53:02.880266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.08415","last_updated":"2023-06-06T01:53:32Z","snapshot_observed_at":"2026-07-06T05:01:27.910364Z","submitted_at":"2016-06-27T19:20:40Z","title":"Gaussian Error Linear Units (GELUs)","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.08415","snapshot_observed_at":"2026-08-06T16:52:49.779462Z","title":"Gaussian error linear units (gelus),","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-08T21:26:36.687030Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:49.779462Z"},"links":{"cited_paper":"/paper/1606.08415","citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:cdc5d335c8c70796c3e986881bcaae1d8ba79f762e9ff031e8e3f53c48dbc016","observation_id":"51a66055-0d5c-4e05-ae76-efc69f911c32","resolution":{"observed_at":"2026-08-06T16:52:49.779462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:53:02.694813Z","title":"Recognizing 50 human action categories of web videos,","venue":null,"work_id":"b73164ee-41c2-4196-b5c2-d49c7d23e9f0","year":2013},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-08T21:26:36.687030Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:49.860074Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:efc2cfd2fe297f8de658b7bc528ddfd1e2ef1b7e8022d80f0360d75b42ac84a7","observation_id":"42c9bee4-121f-49f0-bb40-e03ca6c20299","resolution":{"observed_at":"2026-08-06T16:53:02.753222Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1212.0402","last_updated":"2012-12-03T14:45:31Z","snapshot_observed_at":"2026-07-06T03:01:10.229407Z","submitted_at":"2012-12-03T14:45:31Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1212.0402","snapshot_observed_at":"2026-08-06T16:52:50.009362Z","title":"Ucf101: A dataset of 101 human actions classes from videos in the wild,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-08T21:26:36.687030Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:50.009362Z"},"links":{"cited_paper":"/paper/1212.0402","citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:efe87ede17fab88b130d42cddb42fc4d29e4a22c6ab470739f6e7d6cbd6d6f3f","observation_id":"9a6faf9b-3c84-4091-854b-7615a44fba10","resolution":{"observed_at":"2026-08-06T16:52:50.009362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:53:02.598379Z","title":"Hmdb: a large video database for human motion recognition,","venue":null,"work_id":"f4f4987d-e9e9-4893-9ef7-ac261731db68","year":2011},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-08T21:26:36.687030Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:50.106813Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:aac4889c4d9f86484eb602a108d70ced46af852cb909e7b62b16111b6c5db8de","observation_id":"3f17c9e8-b6e2-4c9c-bddf-97a6c44e5f88","resolution":{"observed_at":"2026-08-06T16:53:02.650847Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:53:02.471844Z","title":"The\" something something","venue":null,"work_id":"6cb12d87-020e-4862-bc77-1861b7b682cc","year":2017},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-08T21:26:36.687030Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:50.174304Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:05a06a498c9ddd76401f03113526d3a6f61cc806daaee97bfc2e9bda73e089b5","observation_id":"c75510fe-4399-4f99-b634-5292bf4a285f","resolution":{"observed_at":"2026-08-06T16:53:02.556260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.06950","last_updated":"2017-05-19T12:07:01Z","snapshot_observed_at":"2026-08-08T17:46:50.107463Z","submitted_at":"2017-05-19T12:07:01Z","title":"The Kinetics Human Action Video Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.06950","snapshot_observed_at":"2026-08-06T16:52:50.256104Z","title":"The kinetics human action video dataset,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-08T21:26:36.687030Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:50.256104Z"},"links":{"cited_paper":"/paper/1705.06950","citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:f1061f39f1d027cb0fb1a088440e177d152f43b71532aa2eb0a56b3aef6f3204","observation_id":"b3a55fc2-d47e-44ba-bc91-dbe64eb2618d","resolution":{"observed_at":"2026-08-06T16:52:50.256104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.04676","last_updated":"2022-02-08T16:36:12Z","snapshot_observed_at":"2026-08-04T03:00:58.368363Z","submitted_at":"2022-01-12T20:02:32Z","title":"UniFormer: Unified Transformer for Efficient Spatiotemporal Representation Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.04676","snapshot_observed_at":"2026-08-06T16:52:50.390492Z","title":"Uniformer: Unified transformer for efficient spatiotemporal representation learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-08T21:26:36.687030Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:50.390492Z"},"links":{"cited_paper":"/paper/2201.04676","citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:d42a541c786be489ab766b0ab04aba25f9036e42c0eb9f34a4ab9fa7935adca7","observation_id":"1c01ee1e-7001-44a3-a8f4-b282d3eed1db","resolution":{"observed_at":"2026-08-06T16:52:50.390492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:53:02.306077Z","title":"Going deeper with convolutions,","venue":null,"work_id":"6b7cff65-bbfe-4b65-98e1-b5b06ea62e56","year":2015},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-08T21:26:36.687030Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:50.471227Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:76a29b40730da3cb37bd6c5c9dc00c9b88719cffc7ba64d37c6505fa1bedeb80","observation_id":"771bb7c5-6e0d-495d-8627-a7fe6aec94b5","resolution":{"observed_at":"2026-08-06T16:53:02.389286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:53:02.237426Z","title":"Making sense of neuromorphic event data for human action recognition,","venue":null,"work_id":"82a3dd7e-9128-439f-826c-f36e232a8475","year":2021},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-08T21:26:36.687030Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:50.520535Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:559273825bf89dca1ffaf7f3b7e02dcd59aef22b1da948aea90d1289d91d24be","observation_id":"24febacd-fbf9-4fa0-95f4-43b6defeb682","resolution":{"observed_at":"2026-08-06T16:53:02.263934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:53:02.151553Z","title":"Human action recognition using dis- tance transform and entropy based features,","venue":null,"work_id":"e5b86bf9-3e41-4fcf-b066-f7be641b6000","year":2021},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-08T21:26:36.687030Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:50.601096Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:e24232fef4c9509963dac92d50adbe9abcc80739fa35b9ebcc2f483f54162df8","observation_id":"d670189b-3b5f-453a-9bb4-193e9c814505","resolution":{"observed_at":"2026-08-06T16:53:02.200658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:53:02.086776Z","title":"Human action recognition using hybrid deep evolving neural networks,","venue":null,"work_id":"5fb3c33f-6280-486f-82e7-a64b8c4c6e25","year":2022},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-08T21:26:36.687030Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:50.719001Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:6f1a2a7a08e73d176ab372cce4dc43d57d8f771d5454b03d3769cebd6bd8919a","observation_id":"121473c8-a8a4-402a-bb27-b0ab77aab99d","resolution":{"observed_at":"2026-08-06T16:53:02.116040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:53:02.013093Z","title":"Simple-action-guided dictionary learning for complex action recognition,","venue":null,"work_id":"b356f284-a06f-4c31-9aba-3c4bdc1cc1d5","year":2022},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-08T21:26:36.687030Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:50.830577Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:6b3e800103a1ccded698b0d62a0060f6e95cf9fb4dd26a8e05416d122d25bf3e","observation_id":"36e68b1f-41af-4cf8-b42b-2f5eebc74e94","resolution":{"observed_at":"2026-08-06T16:53:02.035273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:53:01.863842Z","title":"Human activity classification using the 3dcnn architecture,","venue":null,"work_id":"e6b407ab-a92b-418d-aa2c-07158f6aa107","year":2022},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-08T21:26:36.687030Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:50.937287Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:9cf4b6dc147d7a2cb7adeafbd6ee84601074f16f961e982f3faaac8728430598","observation_id":"6a77b057-5bb1-4b19-9eeb-6b4c9707ba87","resolution":{"observed_at":"2026-08-06T16:53:01.921818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:53:01.690806Z","title":"Fast classification and action recognition with event-based imaging,","venue":null,"work_id":"4d60fe21-a909-4b30-aac1-74104f387b62","year":2022},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-08T21:26:36.687030Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:51.096512Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:461a4d7f8e96fb1d4bfc28e202ce2c5a86823748668a4d1c232c2162409c51cc","observation_id":"46e3ecc0-c91d-4f86-8982-338625a5b2c6","resolution":{"observed_at":"2026-08-06T16:53:01.770390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:53:01.545539Z","title":"Spatio-temporal features based human action recognition using convolutional long short-term deep neural network,","venue":null,"work_id":"c9ceda3e-8639-40b0-bbd5-28a01d50b340","year":2023},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-08T21:26:36.687030Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:51.214457Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:0d03a4d30c7cf5d41b2fca9209acb9d0d2006808a37d7af9d8b90f20211426a2","observation_id":"04678e70-a280-4266-b2bf-1cbc78009620","resolution":{"observed_at":"2026-08-06T16:53:01.610341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:53:01.452362Z","title":"Human action recognition using multi-stream fusion and hybrid deep neural networks,","venue":null,"work_id":"72327103-f372-42f3-9585-9c24aa2b43ba","year":2023},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-08T21:26:36.687030Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:51.327664Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:e5a5b2c161dc5cb574a43822256c4686b3c7e69f5cb686bf7d986237ebf715c3","observation_id":"26c54948-d8b3-443e-b9b7-c1fb8ddcacac","resolution":{"observed_at":"2026-08-06T16:53:01.479218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:53:01.391388Z","title":"Self-supervised video representation learning by uncovering spatio-temporal statistics,","venue":null,"work_id":"5459e037-ebbd-4824-befd-afe76c154954","year":2021},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-08T21:26:36.687030Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:51.425880Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:ee53f4a9d73ab6c9629f8ccf463fae05a693f4e6160060e032ae962d0bae977e","observation_id":"51710b76-8eed-4762-b895-c9825289873f","resolution":{"observed_at":"2026-08-06T16:53:01.420896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:53:01.265176Z","title":"Enhancing self-supervised video representation learning via multi-level feature optimization,","venue":null,"work_id":"20b77063-aa7d-4a21-9272-0982719cd6d1","year":2021},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-08T21:26:36.687030Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:51.505885Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:844c1bc69d1387419337a0ae26be957b8a2ee654b5337fe7487d6057267123e9","observation_id":"7057970c-2ce6-4cfe-a130-d6867f5205b4","resolution":{"observed_at":"2026-08-06T16:53:01.332744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:53:01.107082Z","title":"Videomoco: Contrastive video representation learning with temporally adversarial examples,","venue":null,"work_id":"b57f2bd7-54a0-4611-8e78-aa1f3de9fea3","year":2021},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-08T21:26:36.687030Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:51.608989Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:efcf81248850cc1fd0261f005e6726eebdb304f2907adf3fb90aec04aea07b02","observation_id":"d59234f2-5c29-47a9-83f8-a177742866da","resolution":{"observed_at":"2026-08-06T16:53:01.169505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:53:01.022290Z","title":"Action recognition from a single coded image,","venue":null,"work_id":"ac96a79b-6ce1-4541-a4dd-8e8eaa4012db","year":2022},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-08T21:26:36.687030Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:51.708625Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:d5b70eb721ccb257ba425ca4334603a33a2ca4751320aab936ad3f72a1d1d8a3","observation_id":"ef665412-a01e-4b14-ae2b-f6664f0c0d74","resolution":{"observed_at":"2026-08-06T16:53:01.043969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:53:00.915528Z","title":"Tclr: Temporal contrastive learning for video representation,","venue":null,"work_id":"c940e349-298e-4eb8-8e34-e7afb29a13ee","year":2022},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-08T21:26:36.687030Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:51.782435Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:cf783007664d643a8a030ef4d35145f64be4106ecd345441f33c236c845fb344","observation_id":"7c3b9fb0-aafb-4894-bebe-e9dd1baf0f02","resolution":{"observed_at":"2026-08-06T16:53:00.949242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:53:00.784226Z","title":"Learn2augment: learning to composite videos for data augmentation in action recognition,","venue":null,"work_id":"6e56a0c1-9bad-4ccf-9056-b0928b899d03","year":2022},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-08T21:26:36.687030Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:51.887584Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:cf0a9ce26471157edb10820cb9995bd82bc5261be7fe36c891e7ea39be5b09ee","observation_id":"8e4ccfc8-44d5-4f05-b48a-8474961d34c8","resolution":{"observed_at":"2026-08-06T16:53:00.857703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:53:00.593355Z","title":"Learning from temporal gradient for semi-supervised action recognition,","venue":null,"work_id":"5e9e2939-b4f3-419c-94a5-4a27757a5d5b","year":2022},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-08T21:26:36.687030Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:51.993613Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:177f0975afa597914792868850d9b77ea3a7d8c6c7826a9dd2fe8277c3ca6d3c","observation_id":"5e96c946-27dc-4cae-b725-e151ef84c116","resolution":{"observed_at":"2026-08-06T16:53:00.657387Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.00506","last_updated":"2022-05-01T16:31:25Z","snapshot_observed_at":"2026-08-04T18:59:10.388793Z","submitted_at":"2022-05-01T16:31:25Z","title":"Preserve Pre-trained Knowledge: Transfer Learning With Self-Distillation For Action Recognition","version":1},"cited_work":{"arxiv_id":"2205.00506","doi":null,"metadata_source":"pith","pith_arxiv_id":"2205.00506","snapshot_observed_at":"2026-08-06T16:52:55.251624Z","title":"Preserve Pre-trained Knowledge: Transfer Learning With Self-Distillation For Action Recognition","venue":"cs.CV","work_id":"3a26ca6b-a6d8-4e10-8469-64e4d135667e","year":2022},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-08T21:26:36.687030Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:52.098718Z"},"links":{"cited_paper":"/paper/2205.00506","citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:3270c7dea83cb1156ea7d46ba96e3e42c46107b43921a2ad9e62be3954243c82","observation_id":"627c3103-b39a-40f0-aac2-395d19dc5380","resolution":{"observed_at":"2026-08-06T16:52:55.326931Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:53:00.361033Z","title":"Extreme low- resolution action recognition with confident spatial-temporal attention transfer,","venue":null,"work_id":"05516ce2-e18b-4921-86e1-0529a661cf58","year":2023},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-08T21:26:36.687030Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:52.195968Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:08b5bbc9d7cdf2d8c87209e092da7dee80ce04452703c5114510ed5717df011a","observation_id":"64a00eee-4644-447b-b2c3-22bcf3d2d01a","resolution":{"observed_at":"2026-08-06T16:53:00.478916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:53:00.215151Z","title":"Self-supervised video-based action recognition with disturbances,","venue":null,"work_id":"e039025d-6bbc-4371-baa5-6a9d13711288","year":2023},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-08T21:26:36.687030Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:52.315336Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:7d9fcb71d6775110458384de48fdae8631653e350855629ef163bcbb4aa67be8","observation_id":"0a6f9449-9838-4d17-a28b-95f3b333cdee","resolution":{"observed_at":"2026-08-06T16:53:00.286153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:53:00.080022Z","title":"Spatial-temporal exclusive capsule network for open set action recognition,","venue":null,"work_id":"0b696afe-4c53-41f4-9427-178731a00e7f","year":2023},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-08T21:26:36.687030Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:52.428855Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:b7265440b34f62551be45f1bd97e271c9689db8bc2c4135475dfb3cba8d5e186","observation_id":"24aaf547-bc02-420f-8f6f-ae968884f75f","resolution":{"observed_at":"2026-08-06T16:53:00.146160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:52:59.933671Z","title":"Sv- former: Semi-supervised video transformer for action recognition,","venue":null,"work_id":"ca2e28c6-1c1d-4ae4-bfb6-c8e7602f0a49","year":2023},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-08T21:26:36.687030Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:52.509199Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:ec25ba244cf2671aae7e7b6a5040f8f855fae599ee5eab5784e864dfc8b55d01","observation_id":"7cff12ac-649e-46be-b717-016115aaf030","resolution":{"observed_at":"2026-08-06T16:52:59.986980Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.11654","last_updated":"2024-01-22T02:21:26Z","snapshot_observed_at":"2026-08-09T14:42:33.051467Z","submitted_at":"2024-01-22T02:21:26Z","title":"ActionHub: A Large-scale Action Video Description Dataset for Zero-shot Action Recognition","version":1},"cited_work":{"arxiv_id":"2401.11654","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.11654","snapshot_observed_at":"2026-08-06T16:52:55.128625Z","title":"ActionHub: A Large-scale Action Video Description Dataset for Zero-shot Action Recognition","venue":"cs.CV","work_id":"6d1eb68c-0bd6-4070-a0d0-387c9b154cf7","year":2024},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-08T21:26:36.687030Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:52.604016Z"},"links":{"cited_paper":"/paper/2401.11654","citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:840c03a27653f96599b46c8084f7985a9bd53876db29536f0d7b47051c2e0995","observation_id":"6e74282b-f332-4229-bd4c-a2008662ed7a","resolution":{"observed_at":"2026-08-06T16:52:55.174880Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:52:59.730876Z","title":"Self-supervised learning via multi-transformation classification for action recognition,","venue":null,"work_id":"395711c9-51c7-46f4-8e13-af74b5a25a20","year":2024},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-08T21:26:36.687030Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:52.730793Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:a8105311ab9775e0bdb087f6d77ab0d11262f4a11e850fb50ca81cb4b1d1066b","observation_id":"3ac35da3-01a0-4f25-8917-be0cde4a5013","resolution":{"observed_at":"2026-08-06T16:52:59.802805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:52:59.483213Z","title":"Semi-supervised action recog- nition with dynamic temporal information fusion,","venue":null,"work_id":"e6df6188-e660-44ec-a49a-aa3380f8ead0","year":2024},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-08T21:26:36.687030Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:52.788124Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:c2ef614e558b081915bba886b79222ac69faf447dd03abf7e03b1045da36dd7e","observation_id":"48d46bd4-9904-490f-9eaa-43495d8f3c7f","resolution":{"observed_at":"2026-08-06T16:52:59.610844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:52:59.357219Z","title":"Spatiotemporal contrastive video representation learning,","venue":null,"work_id":"b972e908-20c5-426e-9883-1990164f016d","year":2021},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-08T21:26:36.687030Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:52.852312Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:32d09b9c46c60e5728c2a1e2dbad798fc5ba8a51446ea2ad9605d738b8563ae9","observation_id":"fa98add2-c079-44e4-aac9-8e0bc6c79754","resolution":{"observed_at":"2026-08-06T16:52:59.422918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:52:59.204333Z","title":"Representation learning for compressed video action recognition via attentive cross- modal interaction with motion enhancement,","venue":null,"work_id":"225af9e8-cc12-42b4-b785-9ab10a0fa095","year":2022},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-08T21:26:36.687030Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:52.921579Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:7339574b2bdd1003e35232783b52ea3d66e6dfe3542e0a915e2af6e4fb90ec92","observation_id":"9dd942c3-2298-4b33-bc85-24eb0ffdef8a","resolution":{"observed_at":"2026-08-06T16:52:59.292874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:52:59.096821Z","title":"Motion-driven visual tempo learn- ing for video-based action recognition,","venue":null,"work_id":"a4739dd7-b3aa-419a-a12c-73a0820afabb","year":2022},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-08T21:26:36.687030Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:52.991457Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:3f453bf8e71223dfca3bf56b8e703d8235917c83a90ccc1f883c314d63f98011","observation_id":"001c1faf-2447-4562-8b39-aec022990205","resolution":{"observed_at":"2026-08-06T16:52:59.149388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:52:58.893205Z","title":"Learning spatiotemporal and motion features in a unified 2d network for action recognition,","venue":null,"work_id":"1abda6a3-8435-42ec-a780-2b283aa8bdf5","year":2022},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-08T21:26:36.687030Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:53.056544Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:286f008e2380cd91529bf73f3cded4947ce6a5c3edaf40c0ad23b4544585611e","observation_id":"1fea8405-db0e-418c-a4ed-095cc6fcfc9b","resolution":{"observed_at":"2026-08-06T16:52:58.958930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:52:58.749122Z","title":"Vit-ret: Vision and recurrent transformer neural networks for human activity recognition in videos,","venue":null,"work_id":"46d83dc8-25a0-4c87-a084-a2eec868ddf0","year":2023},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-08T21:26:36.687030Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:53.175022Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:8a6b40a0be14ffd87fa39e5ab040417ce966195278f4bacfcbda73729c127242","observation_id":"72f9b3c9-d38f-4a75-b885-c9606e8b1c55","resolution":{"observed_at":"2026-08-06T16:52:58.805940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:52:58.587576Z","title":"Spatial-temporal interleaved net- work for efficient action recognition,","venue":null,"work_id":"7888202d-faaf-41f7-aafa-da073214396f","year":2024},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-08T21:26:36.687030Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:53.283537Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:24e3526193a421199fc4ddf3b2b4908c13ef0fa8f2889e44e5f17f5b5bb765c7","observation_id":"6274f1a9-a5e3-4101-ace2-d631abf33154","resolution":{"observed_at":"2026-08-06T16:52:58.668315Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:52:58.367876Z","title":"A hybrid transformer framework for efficient activity recog- nition using consumer electronics,","venue":null,"work_id":"d61213cd-3630-4528-b90c-ede845d377eb","year":2024},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-08T21:26:36.687030Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:53.396459Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:17754e5632e9bdc0c54a295dc804a415b903c6063ad35288d559fd073067fa8f","observation_id":"35e04df3-1d2c-4336-90ce-67622692a76b","resolution":{"observed_at":"2026-08-06T16:52:58.469065Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:52:58.222995Z","title":"A knowledge-based hierarchical causal inference network for video action recognition,","venue":null,"work_id":"32a50469-02f4-4710-92d9-971205949310","year":2024},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-08T21:26:36.687030Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:53.500055Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:68a64f742d975f0dcdae00ae08c953073457d9fe73459f427a57e58a14565231","observation_id":"affa9eb6-feaf-49ce-ac9c-4e00473fd572","resolution":{"observed_at":"2026-08-06T16:52:58.287590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:52:53.559512Z","title":"Is space-time attention all you need for video understanding?","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-08T21:26:36.687030Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:53.559512Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:6b3759455aaaeb53b50dc0ebcd8faf7526ad91e7081d3c28279225cb9cc412d1","observation_id":"158182ec-519a-4c5b-9884-f96baf7d8dfb","resolution":{"observed_at":"2026-08-06T16:52:53.559512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:52:58.044289Z","title":"Vidtr: Video transformer without convolutions,","venue":null,"work_id":"55ffb34b-f9fe-4413-8258-661784939003","year":2021},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-08T21:26:36.687030Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:53.632514Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:6983efe8412f5b6f0e9e4fa4514ea81a0727283c62bf2dc410075f721c43a1eb","observation_id":"070b335d-9239-4dfb-b0cb-f10f38c64ee1","resolution":{"observed_at":"2026-08-06T16:52:58.141635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:52:57.918773Z","title":"Keeping your eye on the ball: Tra- jectory attention in video transformers,","venue":null,"work_id":"70e50689-517c-4dea-a204-f6529c7cd7d6","year":2021},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-08T21:26:36.687030Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:53.714960Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:84ffaa8a3d546da5fb93835f0720144e816e69154b3e091571d15b48f5bb610c","observation_id":"cc5a6118-9795-47ed-af13-2a4b5f8d00de","resolution":{"observed_at":"2026-08-06T16:52:57.961367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:52:57.737084Z","title":"Multiscale vision transformers,","venue":null,"work_id":"061d5e46-4418-4a2c-835b-a8bee2166b32","year":2021},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-08T21:26:36.687030Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:53.837040Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:961830756da57df0aad2ab11039190e4346fddc746fd565266b9e23a0a80aca9","observation_id":"7be14330-1fd3-4783-b88b-c3567693fad5","resolution":{"observed_at":"2026-08-06T16:52:57.813054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:52:57.631587Z","title":"Multiview transformers for video recognition,","venue":null,"work_id":"ce48a6d5-2fea-445d-b504-806704e01086","year":2022},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-08T21:26:36.687030Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:53.978259Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:bac46b70c1c7cbd6af33a6f3be5f321d3a1f6e3430ae2ed5284d23dae293a3ff","observation_id":"30bfd305-887a-4872-9621-edd153208baf","resolution":{"observed_at":"2026-08-06T16:52:57.677629Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:52:57.521633Z","title":"Video swin transformer,","venue":null,"work_id":"965d39e6-d41a-4e10-9e7e-c8512a757bba","year":2022},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-08T21:26:36.687030Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:54.063447Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:96a15a51df576655b3032634c41b8478d4d17bf61d048de46c578a266ec0c189","observation_id":"f796a309-6d28-429e-ab81-1870fb80b295","resolution":{"observed_at":"2026-08-06T16:52:57.567092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:52:57.379389Z","title":"Mvitv2: Improved multiscale vision transformers for classification and detection,","venue":null,"work_id":"95ddfaf1-2356-45e6-b92c-8fc99d94e238","year":2022},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-08T21:26:36.687030Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:54.121446Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:14e3cc23c2e2a06c980eea2b6e2d750dfc5c242cb8aff28f19e7f69f80d8a570","observation_id":"7af3d5bd-983f-4ee8-a0c6-9cd773fde5e9","resolution":{"observed_at":"2026-08-06T16:52:57.452633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:52:57.234935Z","title":"A novel spatio-temporal-wise network for action recognition,","venue":null,"work_id":"2b31876c-dd99-4a18-994a-c6ec2ef904ca","year":2023},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-08T21:26:36.687030Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:54.207067Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:dadc7991232cc14f3c7c079cad2b857db8e1adee3cc0c2769b50a9443bd55f9f","observation_id":"1ac19103-74cc-4d7a-b7f4-eef175cdbd75","resolution":{"observed_at":"2026-08-06T16:52:57.285877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:52:57.099700Z","title":"D-tsm: Discriminative temporal shift module for action recognition,","venue":null,"work_id":"f68ec587-f051-4442-8ebd-eaae34189dba","year":2023},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-08T21:26:36.687030Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:54.282421Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:602e12a6180028e2f27f8545db794fdc4febaa86101d9942e319101b98075111","observation_id":"bf3879a6-426f-4218-82e6-3ee66704101c","resolution":{"observed_at":"2026-08-06T16:52:57.163489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:52:56.955623Z","title":"Scene adaptive mechanism for action recognition,","venue":null,"work_id":"e021c0b9-4c0f-4db4-a223-f22a20c6bf98","year":2024},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-08T21:26:36.687030Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:54.344367Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:2ba6fe926666f8293739fb6113d9ff860c15eb7106955a942e5476f7bbb5a6c7","observation_id":"e352fb0d-f249-40ef-b2c8-c164288a4a29","resolution":{"observed_at":"2026-08-06T16:52:57.021801Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:52:56.800196Z","title":"Sta+: Spatiotemporal adaptation with adaptive model selection for video action recognition,","venue":null,"work_id":"123943e3-aa6b-48a2-b1e6-86d614c0b29f","year":2024},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-08T21:26:36.687030Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:54.396120Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:8a75cf26163317c6c3be19073e619b2b27e40cf5577a7c3773097d74f230a0ef","observation_id":"8affa414-54cd-4ff1-b837-4f01b33aaef0","resolution":{"observed_at":"2026-08-06T16:52:56.855411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:52:56.650750Z","title":"Short-term action learning for video action recognition,","venue":null,"work_id":"2afbd62d-abd9-489c-8224-4422a9e8d9e2","year":2024},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-08T21:26:36.687030Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:54.487275Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:37f6a2193cd68593e2422d96ea77cf3731209f10d22d934012c9e519cee9b7e3","observation_id":"bab42be6-c522-4b76-95fa-665b474a8812","resolution":{"observed_at":"2026-08-06T16:52:56.720156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:52:56.501800Z","title":"Tea: Temporal excitation and aggregation for action recognition,","venue":null,"work_id":"8980297f-5566-4e8f-aab7-6e61e45defc4","year":2020},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-08T21:26:36.687030Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:54.566351Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:bc49d6c16fce1bf3c8bb46f978953c92d3d02cd31a28c14070de2425492cea14","observation_id":"75ed9bf1-ed5b-4bae-a3e7-d754c807b0ba","resolution":{"observed_at":"2026-08-06T16:52:56.585739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:52:56.292710Z","title":"Movinets: Mobile video networks for efficient video recogni- tion,","venue":null,"work_id":"aaab900b-6fb6-45f3-8e5d-d20fda34f553","year":2021},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-08T21:26:36.687030Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:54.657092Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:75037e8883c4aa16df8858d60cb8790be6eb9bc4aeff217afec9d8e9fbbd5827","observation_id":"1c59ee0d-d2d0-4368-8eab-645b74f76a7e","resolution":{"observed_at":"2026-08-06T16:52:56.394162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:52:56.122248Z","title":"Timebal- ance: Temporally-invariant and temporally-distinctive video represen- tations for semi-supervised action recognition,","venue":null,"work_id":"6f12b9d2-03d3-4e26-a1a1-848ffaf7493b","year":2023},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-08T21:26:36.687030Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:54.746931Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:68df5a6de72dcc4f08aa68b173099b417bf572fa33974d9c13e9141043c4a16d","observation_id":"3901d6cc-435a-4bb1-87dc-5176f6e73f41","resolution":{"observed_at":"2026-08-06T16:52:56.180372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:52:55.965484Z","title":"Dilated multi-temporal modeling for action recognition,","venue":null,"work_id":"f1fdf970-c93f-4207-9626-4ba225e05c7a","year":2023},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-08T21:26:36.687030Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:54.862860Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:f6e0f44817e7aff99f9af7c216fc181473b15bc4a21ecd6902a3cb0d6fc52ce9","observation_id":"89d04c6f-4153-4f0e-b987-06a169856d17","resolution":{"observed_at":"2026-08-06T16:52:56.035863Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16416","last_updated":"2024-04-25T08:49:08Z","snapshot_observed_at":"2026-07-06T18:05:25.418545Z","submitted_at":"2024-04-25T08:49:08Z","title":"Learning Discriminative Spatio-temporal Representations for Semi-supervised Action Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16416","snapshot_observed_at":"2026-08-06T16:52:54.894113Z","title":"Learning discriminative spatio- temporal representations for semi-supervised action recognition,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-08T21:26:36.687030Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:54.894113Z"},"links":{"cited_paper":"/paper/2404.16416","citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:bd11e5b6aef25b0d25fa48ff96171235deef13f12873f1ce7c450a99a34acc25","observation_id":"2d9693e9-22a7-4efb-9789-44932768db2c","resolution":{"observed_at":"2026-08-06T16:52:54.894113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:52:55.769765Z","title":"Discrimina- tive segment focus network for fine-grained video action recognition,","venue":null,"work_id":"159daac6-1296-4977-8b7c-80c634851e34","year":2024},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-08T21:26:36.687030Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:54.944965Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:d3b25a1a03b9fc43541f8b8dbf43333d33d5997804a20769342dd49e56aeb7b2","observation_id":"a4bdf994-b313-41e5-a2f3-029c2ad88fd7","resolution":{"observed_at":"2026-08-06T16:52:55.869769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:52:55.592538Z","title":"Temporal difference attention for action recog- nition,","venue":null,"work_id":"900a19d2-fa3b-4ae0-b31c-6df4abe68d8c","year":2024},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-08T21:26:36.687030Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:54.978639Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:1f4bd7b234c0231910cdcc39f581947b1caabc1347a1167f56e474cc0f2a70a7","observation_id":"37f17f06-1d35-4c0e-ad1f-0514af327267","resolution":{"observed_at":"2026-08-06T16:52:55.666237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:52:55.437347Z","title":"An efficient motion visual learning method for video action recognition,","venue":null,"work_id":"cacc84f3-e1c8-4910-bc5f-f1aecae2db48","year":2024},"citing_paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","snapshot_observed_at":"2026-08-08T21:26:36.687030Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-06T16:52:55.019874Z"},"links":{"citing_paper":"/paper/2507.12426"},"observation_digest":"sha256:603898b07a3431c225ab4f0f678570126dbea1268594b8594bf4167c49e74053","observation_id":"62891965-1003-479c-9435-0d893005c4e6","resolution":{"observed_at":"2026-08-06T16:52:55.515616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.12426","last_updated":"2025-07-18T14:10:43Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T21:26:36.687030Z","submitted_at":"2025-07-16T17:15:06Z","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition"},"reference_resolution":{"displayed":95,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":2,"verified_fuzzy":70},"total_outbound_references":95},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 95 of 95 outbound references and 0 inbound Pith citation observations for arXiv:2507.12426."}