{"as_of":"2026-08-09T22:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:313ffd03c2a4ac08420ff46915f05fbad17834f14db16e425d85ebd4c9bdd7d1","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":40,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T13:31:23.569839Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T20:00:08.259998Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2109.08472","last_updated":"2021-09-17T11:21:34Z","snapshot_observed_at":"2026-07-06T11:48:42.000083Z","submitted_at":"2021-09-17T11:21:34Z","title":"ActionCLIP: A New Paradigm for Video Action Recognition","version":1},"cited_work":{"arxiv_id":"2109.08472","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2109.08472","snapshot_observed_at":"2026-07-04T20:00:08.259998Z","title":"Action- CLIP: A New Paradigm for Video Action Recognition","venue":null,"work_id":"e4022c4a-1a07-4760-a40b-9728fd25cdd4","year":2021},"citing_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"reference_index":102,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:53.235740Z"},"links":{"cited_paper":"/paper/2109.08472","citing_paper":"/paper/2212.03191"},"observation_digest":"sha256:783917b4fdf7cba02650d91c5fed55a50fbc3f1317e0b3013882cca509b70d2a","observation_id":"5f97fecb-928b-4e39-a1ce-cd7485922d02","resolution":{"observed_at":"2026-05-17T00:36:53.345981Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.08472","last_updated":"2021-09-17T11:21:34Z","snapshot_observed_at":"2026-07-06T11:48:42.000083Z","submitted_at":"2021-09-17T11:21:34Z","title":"ActionCLIP: A New Paradigm for Video Action Recognition","version":1},"cited_work":{"arxiv_id":"2109.08472","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2109.08472","snapshot_observed_at":"2026-07-04T20:00:08.259998Z","title":"Action- CLIP: A New Paradigm for Video Action Recognition","venue":null,"work_id":"e4022c4a-1a07-4760-a40b-9728fd25cdd4","year":2021},"citing_paper":{"arxiv_id":"2401.07669","last_updated":"2026-05-25T19:17:10Z","snapshot_observed_at":"2026-08-01T15:10:33.776201Z","submitted_at":"2024-01-15T13:27:34Z","title":"SRL-CLIP: Efficient CLIP Video Adaptation via Structured Semantic Role Labels","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-24T04:46:18.542521Z"},"links":{"cited_paper":"/paper/2109.08472","citing_paper":"/paper/2401.07669"},"observation_digest":"sha256:bca7f24e25bd6b6ec4c54278184b802153d8e5e6cdf00ddf3545eab14092fc5a","observation_id":"63c284db-2302-4cfa-87e9-dda14f932cb2","resolution":{"observed_at":"2026-05-24T04:48:54.278709Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.08472","last_updated":"2021-09-17T11:21:34Z","snapshot_observed_at":"2026-07-06T11:48:42.000083Z","submitted_at":"2021-09-17T11:21:34Z","title":"ActionCLIP: A New Paradigm for Video Action Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.08472","snapshot_observed_at":"2026-08-09T13:31:23.569839Z","title":"Actionclip: A new paradigm for video action recognition","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.02069","last_updated":"2025-02-04T07:40:26Z","snapshot_observed_at":"2026-08-09T13:24:52.848723Z","submitted_at":"2025-02-04T07:40:26Z","title":"LoRA-TTT: Low-Rank Test-Time Training for Vision-Language Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-09T13:31:23.569839Z"},"links":{"cited_paper":"/paper/2109.08472","citing_paper":"/paper/2502.02069"},"observation_digest":"sha256:c45db22e7ac4d20ebc304a94c089fe576bb77b22f9b805bdaab49ac6bf01d60b","observation_id":"1a11ae7e-743f-4e0d-b04e-64b1d6bc76f4","resolution":{"observed_at":"2026-08-09T13:31:23.569839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.08472","last_updated":"2021-09-17T11:21:34Z","snapshot_observed_at":"2026-07-06T11:48:42.000083Z","submitted_at":"2021-09-17T11:21:34Z","title":"ActionCLIP: A New Paradigm for Video Action Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.08472","snapshot_observed_at":"2026-08-09T04:44:58.877082Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.03459","last_updated":"2025-02-05T18:57:04Z","snapshot_observed_at":"2026-08-09T18:52:00.002531Z","submitted_at":"2025-02-05T18:57:04Z","title":"SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-09T04:44:58.877082Z"},"links":{"cited_paper":"/paper/2109.08472","citing_paper":"/paper/2502.03459"},"observation_digest":"sha256:e8eed75ed4671ed1e53bc1a1d65b65fa27191c6fdfe48a16f2e54f1b844fa8d3","observation_id":"717a7f45-29f6-4f8d-a1c0-9a0d749f5d34","resolution":{"observed_at":"2026-08-09T04:44:58.877082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.08472","last_updated":"2021-09-17T11:21:34Z","snapshot_observed_at":"2026-07-06T11:48:42.000083Z","submitted_at":"2021-09-17T11:21:34Z","title":"ActionCLIP: A New Paradigm for Video Action Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.08472","snapshot_observed_at":"2026-08-09T04:37:09.819109Z","title":"Actionclip: A new paradigm for video action recognition","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.03549","last_updated":"2025-02-10T03:28:56Z","snapshot_observed_at":"2026-08-09T18:05:27.309665Z","submitted_at":"2025-02-05T19:03:58Z","title":"Kronecker Mask and Interpretive Prompts are Language-Action Video Learners","version":3},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-09T04:37:09.819109Z"},"links":{"cited_paper":"/paper/2109.08472","citing_paper":"/paper/2502.03549"},"observation_digest":"sha256:1b1a2f294e7e308b436697cb123d1b6709168139ee7f6946cff9858d200ef6e5","observation_id":"04503e34-8e11-4846-8e67-8a304247919c","resolution":{"observed_at":"2026-08-09T04:37:09.819109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.08472","last_updated":"2021-09-17T11:21:34Z","snapshot_observed_at":"2026-07-06T11:48:42.000083Z","submitted_at":"2021-09-17T11:21:34Z","title":"ActionCLIP: A New Paradigm for Video Action Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.08472","snapshot_observed_at":"2026-08-08T14:57:12.562855Z","title":"Ac- tionclip: A new paradigm for video action recognition,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.06631","last_updated":"2025-07-22T14:31:49Z","snapshot_observed_at":"2026-08-08T14:49:15.966222Z","submitted_at":"2025-02-10T16:27:20Z","title":"Conformal Predictions for Human Action Recognition with Vision-Language Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T14:57:12.562855Z"},"links":{"cited_paper":"/paper/2109.08472","citing_paper":"/paper/2502.06631"},"observation_digest":"sha256:5e7c29d70dbdec4fae7be54508e8fa8d1ca7ae7f0f524ce00131b99043f38fc8","observation_id":"db75da33-556d-40dd-8625-aa56000599e1","resolution":{"observed_at":"2026-08-08T14:57:12.562855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.08472","last_updated":"2021-09-17T11:21:34Z","snapshot_observed_at":"2026-07-06T11:48:42.000083Z","submitted_at":"2021-09-17T11:21:34Z","title":"ActionCLIP: A New Paradigm for Video Action Recognition","version":1},"cited_work":{"arxiv_id":"2109.08472","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2109.08472","snapshot_observed_at":"2026-07-04T20:00:08.259998Z","title":"Action- CLIP: A New Paradigm for Video Action Recognition","venue":null,"work_id":"e4022c4a-1a07-4760-a40b-9728fd25cdd4","year":2021},"citing_paper":{"arxiv_id":"2504.18662","last_updated":"2026-04-29T08:31:04Z","snapshot_observed_at":"2026-08-09T08:58:18.088136Z","submitted_at":"2025-04-25T19:36:17Z","title":"M2R2: MultiModal Robotic Representation for Temporal Action Segmentation","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-22T17:39:23.051951Z"},"links":{"cited_paper":"/paper/2109.08472","citing_paper":"/paper/2504.18662"},"observation_digest":"sha256:af18cecb1a87562f0b1f1280d9bb81f06d54cf52488c5c89579137c155f681c4","observation_id":"64738afd-5232-4775-aa1e-ca4dfe9670b1","resolution":{"observed_at":"2026-05-22T17:41:53.079251Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.08472","last_updated":"2021-09-17T11:21:34Z","snapshot_observed_at":"2026-07-06T11:48:42.000083Z","submitted_at":"2021-09-17T11:21:34Z","title":"ActionCLIP: A New Paradigm for Video Action Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.08472","snapshot_observed_at":"2026-08-07T14:06:06.655155Z","title":"Actionclip: A new paradigm for video action recognition,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.20106","last_updated":"2025-05-26T15:11:23Z","snapshot_observed_at":"2026-08-08T02:52:10.331528Z","submitted_at":"2025-05-26T15:11:23Z","title":"From Data to Modeling: Fully Open-vocabulary Scene Graph Generation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T14:06:06.655155Z"},"links":{"cited_paper":"/paper/2109.08472","citing_paper":"/paper/2505.20106"},"observation_digest":"sha256:835e0067a7ea34b64788689bb4c8ecc7ce0df7dc10809ffe2a4732f2dd929e48","observation_id":"ca03ad4d-a30e-4554-a856-6b3bd56dea65","resolution":{"observed_at":"2026-08-07T14:06:06.655155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.08472","last_updated":"2021-09-17T11:21:34Z","snapshot_observed_at":"2026-07-06T11:48:42.000083Z","submitted_at":"2021-09-17T11:21:34Z","title":"ActionCLIP: A New Paradigm for Video Action Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.08472","snapshot_observed_at":"2026-08-07T13:17:08.610513Z","title":"Actionclip: A new paradigm for video action recognition","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.00043","last_updated":"2025-05-28T11:21:33Z","snapshot_observed_at":"2026-08-07T13:09:45.267667Z","submitted_at":"2025-05-28T11:21:33Z","title":"From Motion to Behavior: Hierarchical Modeling of Humanoid Generative Behavior Control","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T13:17:08.610513Z"},"links":{"cited_paper":"/paper/2109.08472","citing_paper":"/paper/2506.00043"},"observation_digest":"sha256:75a5220c806c56d0825aca823d6d7ac680bce651d1ed5e16193c44c876cfdd05","observation_id":"9324a207-f7ac-4fba-aa21-6728672fc579","resolution":{"observed_at":"2026-08-07T13:17:08.610513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.08472","last_updated":"2021-09-17T11:21:34Z","snapshot_observed_at":"2026-07-06T11:48:42.000083Z","submitted_at":"2021-09-17T11:21:34Z","title":"ActionCLIP: A New Paradigm for Video Action Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.08472","snapshot_observed_at":"2026-08-07T10:26:59.796244Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-09T06:06:16.397696Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T10:26:59.796244Z"},"links":{"cited_paper":"/paper/2109.08472","citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:547756730cea07cd4f49ff77663bde8c2f9fbfcc6cfb7bfaefe3d82a9fa54624","observation_id":"f133875f-465d-4055-a12b-a1b2bf6f951e","resolution":{"observed_at":"2026-08-07T10:26:59.796244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.08472","last_updated":"2021-09-17T11:21:34Z","snapshot_observed_at":"2026-07-06T11:48:42.000083Z","submitted_at":"2021-09-17T11:21:34Z","title":"ActionCLIP: A New Paradigm for Video Action Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.08472","snapshot_observed_at":"2026-08-06T22:55:24.152416Z","title":"CoRRabs/2109.08472(2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.20342","last_updated":"2025-06-25T11:50:23Z","snapshot_observed_at":"2026-08-09T02:38:05.961296Z","submitted_at":"2025-06-25T11:50:23Z","title":"Feature Hallucination for Self-supervised Action Recognition","version":1},"reference_index":168,"source":"pdf_text","source_observed_at":"2026-08-06T22:55:24.152416Z"},"links":{"cited_paper":"/paper/2109.08472","citing_paper":"/paper/2506.20342"},"observation_digest":"sha256:5e3a80f8162647807cfe270063c664028430b1091cf2ba373df85636b0b20cbc","observation_id":"db80e471-c663-44e1-999d-d3c94c8a6fbd","resolution":{"observed_at":"2026-08-06T22:55:24.152416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.08472","last_updated":"2021-09-17T11:21:34Z","snapshot_observed_at":"2026-07-06T11:48:42.000083Z","submitted_at":"2021-09-17T11:21:34Z","title":"ActionCLIP: A New Paradigm for Video Action Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.08472","snapshot_observed_at":"2026-08-06T21:51:57.921969Z","title":"Ac- tionclip: A new paradigm for video action recognition","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.23283","last_updated":"2025-06-29T15:14:55Z","snapshot_observed_at":"2026-08-08T07:28:03.599688Z","submitted_at":"2025-06-29T15:14:55Z","title":"MoMa: Modulating Mamba for Adapting Image Foundation Models to Video Recognition","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:57.921969Z"},"links":{"cited_paper":"/paper/2109.08472","citing_paper":"/paper/2506.23283"},"observation_digest":"sha256:634ceb5e8931bafce9ed27df2119c9c92ede8ca0caa521a3419b93e809cca4c1","observation_id":"fefb174e-7ad2-4264-838b-62483d589634","resolution":{"observed_at":"2026-08-06T21:51:57.921969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.08472","last_updated":"2021-09-17T11:21:34Z","snapshot_observed_at":"2026-07-06T11:48:42.000083Z","submitted_at":"2021-09-17T11:21:34Z","title":"ActionCLIP: A New Paradigm for Video Action Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.08472","snapshot_observed_at":"2026-08-06T21:46:01.269123Z","title":"Actionclip: A new paradigm for video action recognition.arXiv preprint arXiv:2109.08472, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.23502","last_updated":"2025-07-12T09:48:32Z","snapshot_observed_at":"2026-08-06T21:38:04.444768Z","submitted_at":"2025-06-30T03:49:08Z","title":"LLM-enhanced Action-aware Multi-modal Prompt Tuning for Image-Text Matching","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T21:46:01.269123Z"},"links":{"cited_paper":"/paper/2109.08472","citing_paper":"/paper/2506.23502"},"observation_digest":"sha256:80f6ac1c643e578cca5201d21e3a74786f70650f6368c47dbacd5ae76994e651","observation_id":"4e85078f-a7d3-4f7d-9755-7bc0e018c68a","resolution":{"observed_at":"2026-08-06T21:46:01.269123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.08472","last_updated":"2021-09-17T11:21:34Z","snapshot_observed_at":"2026-07-06T11:48:42.000083Z","submitted_at":"2021-09-17T11:21:34Z","title":"ActionCLIP: A New Paradigm for Video Action Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.08472","snapshot_observed_at":"2026-08-06T21:41:44.379725Z","title":"arXiv preprint arXiv:2109.08472 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.23648","last_updated":"2025-06-30T09:22:52Z","snapshot_observed_at":"2026-08-06T21:33:17.291346Z","submitted_at":"2025-06-30T09:22:52Z","title":"MReg: A Novel Regression Model with MoE-based Video Feature Mining for Mitral Regurgitation Diagnosis","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:44.379725Z"},"links":{"cited_paper":"/paper/2109.08472","citing_paper":"/paper/2506.23648"},"observation_digest":"sha256:7dad859a6a0807582ecd6d7663d21399bb87d3cebbe0e1de9a29706ccce57efb","observation_id":"7064ddaa-7c79-407f-98fb-91c5b4832711","resolution":{"observed_at":"2026-08-06T21:41:44.379725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.08472","last_updated":"2021-09-17T11:21:34Z","snapshot_observed_at":"2026-07-06T11:48:42.000083Z","submitted_at":"2021-09-17T11:21:34Z","title":"ActionCLIP: A New Paradigm for Video Action Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.08472","snapshot_observed_at":"2026-08-06T21:29:05.004317Z","title":"Actionclip: A new paradigm for video action recognition","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.24124","last_updated":"2025-07-01T03:40:22Z","snapshot_observed_at":"2026-08-08T13:48:41.128139Z","submitted_at":"2025-06-30T17:59:14Z","title":"Teaching Time Series to See and Speak: Forecasting with Aligned Visual and Textual Perspectives","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-06T21:29:05.004317Z"},"links":{"cited_paper":"/paper/2109.08472","citing_paper":"/paper/2506.24124"},"observation_digest":"sha256:1c3bea1ca9a734fa3b1b5ae8d31c701ae74d7b8101e0af1fb7fb6b5ad58b0e8c","observation_id":"5e0caaa7-7186-43ea-a47c-e988f75f6f33","resolution":{"observed_at":"2026-08-06T21:29:05.004317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.08472","last_updated":"2021-09-17T11:21:34Z","snapshot_observed_at":"2026-07-06T11:48:42.000083Z","submitted_at":"2021-09-17T11:21:34Z","title":"ActionCLIP: A New Paradigm for Video Action Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.08472","snapshot_observed_at":"2026-08-06T21:23:47.752536Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.00286","last_updated":"2025-07-19T04:31:05Z","snapshot_observed_at":"2026-08-09T16:11:59.852302Z","submitted_at":"2025-06-30T21:55:21Z","title":"\"Before, I Asked My Mom, Now I Ask ChatGPT\": Visual Privacy Management with Generative AI for Blind and Low-Vision People","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:47.752536Z"},"links":{"cited_paper":"/paper/2109.08472","citing_paper":"/paper/2507.00286"},"observation_digest":"sha256:ea9d71bca048433ad6f8a739a457734b4e781101f5a46a7f09a2658e84cfd6da","observation_id":"82048a79-c77a-45fa-830c-fd89501bfcc4","resolution":{"observed_at":"2026-08-06T21:23:47.752536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.08472","last_updated":"2021-09-17T11:21:34Z","snapshot_observed_at":"2026-07-06T11:48:42.000083Z","submitted_at":"2021-09-17T11:21:34Z","title":"ActionCLIP: A New Paradigm for Video Action Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.08472","snapshot_observed_at":"2026-08-06T19:06:10.178430Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.06603","last_updated":"2025-08-01T08:19:46Z","snapshot_observed_at":"2026-08-06T18:57:01.949640Z","submitted_at":"2025-07-09T07:22:54Z","title":"Cross-Modal Dual-Causal Learning for Long-Term Action Recognition","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T19:06:10.178430Z"},"links":{"cited_paper":"/paper/2109.08472","citing_paper":"/paper/2507.06603"},"observation_digest":"sha256:609fb66c20aa6968e63bb5fb6ac849d846b8dceb5c67139198d4911e77089793","observation_id":"cbe83651-a236-407f-91e9-f4fb52d25874","resolution":{"observed_at":"2026-08-06T19:06:10.178430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.08472","last_updated":"2021-09-17T11:21:34Z","snapshot_observed_at":"2026-07-06T11:48:42.000083Z","submitted_at":"2021-09-17T11:21:34Z","title":"ActionCLIP: A New Paradigm for Video Action Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.08472","snapshot_observed_at":"2026-08-06T11:07:20.168158Z","title":"Actionclip: A new paradigm for video action recognition,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-06T11:07:18.369191Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:20.168158Z"},"links":{"cited_paper":"/paper/2109.08472","citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:0ddc3155cf4c88b226cb3eb3f8d47c208fa21a3cf3afed8f2c72dc2a35876d94","observation_id":"0e899e0e-25bf-4e3e-ab1b-d6b312477551","resolution":{"observed_at":"2026-08-06T11:07:20.168158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.08472","last_updated":"2021-09-17T11:21:34Z","snapshot_observed_at":"2026-07-06T11:48:42.000083Z","submitted_at":"2021-09-17T11:21:34Z","title":"ActionCLIP: A New Paradigm for Video Action Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.08472","snapshot_observed_at":"2026-08-06T04:53:54.848055Z","title":"Actionclip: A new paradigm for video action recognition,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.02981","last_updated":"2025-08-05T01:14:05Z","snapshot_observed_at":"2026-08-06T04:53:52.595940Z","submitted_at":"2025-08-05T01:14:05Z","title":"MoExDA: Domain Adaptation for Edge-based Action Recognition","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T04:53:54.848055Z"},"links":{"cited_paper":"/paper/2109.08472","citing_paper":"/paper/2508.02981"},"observation_digest":"sha256:d6b896b886d5a31a04f35f56f43a03d8b87b32a970491df9e545649ab90cdf7e","observation_id":"332235fb-b1dd-4aa6-915b-f080b3dd2d37","resolution":{"observed_at":"2026-08-06T04:53:54.848055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.08472","last_updated":"2021-09-17T11:21:34Z","snapshot_observed_at":"2026-07-06T11:48:42.000083Z","submitted_at":"2021-09-17T11:21:34Z","title":"ActionCLIP: A New Paradigm for Video Action Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.08472","snapshot_observed_at":"2026-08-05T16:56:27.442977Z","title":"Actionclip: A new paradigm for video action recognition","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.17417","last_updated":"2025-08-24T15:45:22Z","snapshot_observed_at":"2026-08-09T22:29:36.759803Z","submitted_at":"2025-08-24T15:45:22Z","title":"Constrained Prompt Enhancement for Improving Zero-Shot Generalization of Vision-Language Models","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-05T16:56:27.442977Z"},"links":{"cited_paper":"/paper/2109.08472","citing_paper":"/paper/2508.17417"},"observation_digest":"sha256:3ecc7cbc3419550855fa2e10b6ef25c321500dbe690e99f858c6c85bdcea7213","observation_id":"8793f05a-a5f2-4c71-9e9d-648154d60476","resolution":{"observed_at":"2026-08-05T16:56:27.442977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.08472","last_updated":"2021-09-17T11:21:34Z","snapshot_observed_at":"2026-07-06T11:48:42.000083Z","submitted_at":"2021-09-17T11:21:34Z","title":"ActionCLIP: A New Paradigm for Video Action Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.08472","snapshot_observed_at":"2026-08-05T14:02:04.935174Z","title":"Actionclip: A new paradigm for video action recognition.arXiv preprint arXiv:2109.08472, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.21770","last_updated":"2025-09-08T12:51:08Z","snapshot_observed_at":"2026-08-08T11:57:14.434723Z","submitted_at":"2025-08-29T16:43:19Z","title":"What Can We Learn from Harry Potter? An Exploratory Study of Visual Representation Learning from Atypical Videos","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-05T14:02:04.935174Z"},"links":{"cited_paper":"/paper/2109.08472","citing_paper":"/paper/2508.21770"},"observation_digest":"sha256:4a83920acf3e8f27f38bd618554947bb3252feb5dc6cc2005b8132c06e2776f3","observation_id":"3d76a287-af6c-469c-bde0-b99ccc3cfd3f","resolution":{"observed_at":"2026-08-05T14:02:04.935174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.08472","last_updated":"2021-09-17T11:21:34Z","snapshot_observed_at":"2026-07-06T11:48:42.000083Z","submitted_at":"2021-09-17T11:21:34Z","title":"ActionCLIP: A New Paradigm for Video Action Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.08472","snapshot_observed_at":"2026-08-04T19:37:41.696663Z","title":"Actionclip: A new paradigm for video action recognition,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-09T17:50:11.271087Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:41.696663Z"},"links":{"cited_paper":"/paper/2109.08472","citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:623bbfb56de17ededd4e4bf7d8e021e2eee8b6dc1c657925f19298731d290d7c","observation_id":"d81fe392-c880-4688-9e6e-3676c10a83e5","resolution":{"observed_at":"2026-08-04T19:37:41.696663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.08472","last_updated":"2021-09-17T11:21:34Z","snapshot_observed_at":"2026-07-06T11:48:42.000083Z","submitted_at":"2021-09-17T11:21:34Z","title":"ActionCLIP: A New Paradigm for Video Action Recognition","version":1},"cited_work":{"arxiv_id":"2109.08472","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2109.08472","snapshot_observed_at":"2026-07-04T20:00:08.259998Z","title":"Action- CLIP: A New Paradigm for Video Action Recognition","venue":null,"work_id":"e4022c4a-1a07-4760-a40b-9728fd25cdd4","year":2021},"citing_paper":{"arxiv_id":"2509.11058","last_updated":"2026-04-29T15:21:39Z","snapshot_observed_at":"2026-07-06T22:29:48.011706Z","submitted_at":"2025-09-14T02:51:32Z","title":"Action Hints: Semantic Typicality and Context Uniqueness for Generalizable Skeleton-based Video Anomaly Detection","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-18T17:14:25.533181Z"},"links":{"cited_paper":"/paper/2109.08472","citing_paper":"/paper/2509.11058"},"observation_digest":"sha256:c2221ec669dbe0a417cacbefa3df0bbbe691a861b9bf2772cd0b8f3273d5d321","observation_id":"c2e75ed0-5b86-48b1-9aaa-87c5ba2f0735","resolution":{"observed_at":"2026-05-18T17:16:40.083368Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.08472","last_updated":"2021-09-17T11:21:34Z","snapshot_observed_at":"2026-07-06T11:48:42.000083Z","submitted_at":"2021-09-17T11:21:34Z","title":"ActionCLIP: A New Paradigm for Video Action Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.08472","snapshot_observed_at":"2026-08-03T17:09:21.923280Z","title":"Actionclip: A new paradigm for video action recognition.arXiv preprint arXiv:2109.08472, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.10607","last_updated":"2026-07-14T22:19:55Z","snapshot_observed_at":"2026-08-08T08:02:13.176273Z","submitted_at":"2025-12-11T13:03:03Z","title":"Track and Caption Any Motion: Open-Vocabulary Spatiotemporal Captioning via Trajectory-Conditioned Generation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:21.923280Z"},"links":{"cited_paper":"/paper/2109.08472","citing_paper":"/paper/2512.10607"},"observation_digest":"sha256:d7b8b0fe9974a03eec8e8a173b169fc3d9ab1eedba7c5f095cefaa6239e1461b","observation_id":"0984b6a3-f540-4e40-80e9-ffdbb441b3ec","resolution":{"observed_at":"2026-08-03T17:09:21.923280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.08472","last_updated":"2021-09-17T11:21:34Z","snapshot_observed_at":"2026-07-06T11:48:42.000083Z","submitted_at":"2021-09-17T11:21:34Z","title":"ActionCLIP: A New Paradigm for Video Action Recognition","version":1},"cited_work":{"arxiv_id":"2109.08472","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2109.08472","snapshot_observed_at":"2026-07-04T20:00:08.259998Z","title":"Action- CLIP: A New Paradigm for Video Action Recognition","venue":null,"work_id":"e4022c4a-1a07-4760-a40b-9728fd25cdd4","year":2021},"citing_paper":{"arxiv_id":"2512.13511","last_updated":"2026-05-01T11:23:38Z","snapshot_observed_at":"2026-07-06T22:39:04.164003Z","submitted_at":"2025-12-15T16:38:59Z","title":"Adapting MLLMs for Nuanced Video Retrieval","version":3},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-16T22:20:09.051957Z"},"links":{"cited_paper":"/paper/2109.08472","citing_paper":"/paper/2512.13511"},"observation_digest":"sha256:1abc28b5d4dccb215f11e95f301749ccac12bcee1cf20b37d15d9a45a5e95e41","observation_id":"20e27860-9ce1-44c0-8ec3-f1d915dd61d7","resolution":{"observed_at":"2026-05-16T22:21:18.876851Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.08472","last_updated":"2021-09-17T11:21:34Z","snapshot_observed_at":"2026-07-06T11:48:42.000083Z","submitted_at":"2021-09-17T11:21:34Z","title":"ActionCLIP: A New Paradigm for Video Action Recognition","version":1},"cited_work":{"arxiv_id":"2109.08472","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2109.08472","snapshot_observed_at":"2026-07-04T20:00:08.259998Z","title":"Action- CLIP: A New Paradigm for Video Action Recognition","venue":null,"work_id":"e4022c4a-1a07-4760-a40b-9728fd25cdd4","year":2021},"citing_paper":{"arxiv_id":"2601.06394","last_updated":"2026-04-29T19:00:59Z","snapshot_observed_at":"2026-08-02T23:44:38.206631Z","submitted_at":"2026-01-10T02:39:24Z","title":"Context Matters: Peer-Aware Student Behavioral Engagement Measurement via VLM Action Parsing and LLM Sequence Classification","version":4},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-16T15:47:08.925519Z"},"links":{"cited_paper":"/paper/2109.08472","citing_paper":"/paper/2601.06394"},"observation_digest":"sha256:3c7abced65117d92e38b63f7f9011810afecf53da5558d9ff4f781e07add8913","observation_id":"de5a1c17-d768-477b-ad83-b51daef083d0","resolution":{"observed_at":"2026-05-16T15:48:03.803999Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.08472","last_updated":"2021-09-17T11:21:34Z","snapshot_observed_at":"2026-07-06T11:48:42.000083Z","submitted_at":"2021-09-17T11:21:34Z","title":"ActionCLIP: A New Paradigm for Video Action Recognition","version":1},"cited_work":{"arxiv_id":"2109.08472","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2109.08472","snapshot_observed_at":"2026-07-04T20:00:08.259998Z","title":"Action- CLIP: A New Paradigm for Video Action Recognition","venue":null,"work_id":"e4022c4a-1a07-4760-a40b-9728fd25cdd4","year":2021},"citing_paper":{"arxiv_id":"2604.11498","last_updated":"2026-04-13T14:03:58Z","snapshot_observed_at":"2026-08-03T00:38:30.162712Z","submitted_at":"2026-04-13T14:03:58Z","title":"TAG-Head: Time-Aligned Graph Head for Plug-and-Play Fine-grained Action Recognition","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-10T16:33:28.632640Z"},"links":{"cited_paper":"/paper/2109.08472","citing_paper":"/paper/2604.11498"},"observation_digest":"sha256:fe2a27ff371f6596d27b5aecbdf618a86152f7b40bd650da917141c1a683e511","observation_id":"87ef0e5d-2b09-4f9c-93cd-d1c08ccddb87","resolution":{"observed_at":"2026-05-11T08:40:59.528093Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.08472","last_updated":"2021-09-17T11:21:34Z","snapshot_observed_at":"2026-07-06T11:48:42.000083Z","submitted_at":"2021-09-17T11:21:34Z","title":"ActionCLIP: A New Paradigm for Video Action Recognition","version":1},"cited_work":{"arxiv_id":"2109.08472","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2109.08472","snapshot_observed_at":"2026-07-04T20:00:08.259998Z","title":"Action- CLIP: A New Paradigm for Video Action Recognition","venue":null,"work_id":"e4022c4a-1a07-4760-a40b-9728fd25cdd4","year":2021},"citing_paper":{"arxiv_id":"2604.22595","last_updated":"2026-04-24T14:23:24Z","snapshot_observed_at":"2026-07-06T23:08:56.419589Z","submitted_at":"2026-04-24T14:23:24Z","title":"EV-CLIP: Efficient Visual Prompt Adaptation for CLIP in Few-shot Action Recognition under Visual Challenges","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-08T12:29:32.897198Z"},"links":{"cited_paper":"/paper/2109.08472","citing_paper":"/paper/2604.22595"},"observation_digest":"sha256:a366a5a37746ec35ad702c149d805ace0257a9af90deae04dfd2b2e56d0a17da","observation_id":"c9d0742d-7ef4-4a97-9a98-793f70546892","resolution":{"observed_at":"2026-05-11T19:16:07.304347Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.08472","last_updated":"2021-09-17T11:21:34Z","snapshot_observed_at":"2026-07-06T11:48:42.000083Z","submitted_at":"2021-09-17T11:21:34Z","title":"ActionCLIP: A New Paradigm for Video Action Recognition","version":1},"cited_work":{"arxiv_id":"2109.08472","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2109.08472","snapshot_observed_at":"2026-07-04T20:00:08.259998Z","title":"Action- CLIP: A New Paradigm for Video Action Recognition","venue":null,"work_id":"e4022c4a-1a07-4760-a40b-9728fd25cdd4","year":2021},"citing_paper":{"arxiv_id":"2605.23288","last_updated":"2026-05-22T07:01:23Z","snapshot_observed_at":"2026-07-06T23:33:29.550551Z","submitted_at":"2026-05-22T07:01:23Z","title":"Spatio-Temporal Similarity Volume Aggregation for Open-Vocabulary Action Recognition","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-25T05:13:20.840430Z"},"links":{"cited_paper":"/paper/2109.08472","citing_paper":"/paper/2605.23288"},"observation_digest":"sha256:968cd377b8581f040a3c5061b6483b7b4df57bcad54df57da9a9814d3cc745c1","observation_id":"2441715e-1b69-4569-845d-2751f516b4fe","resolution":{"observed_at":"2026-05-25T05:15:22.369888Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.08472","last_updated":"2021-09-17T11:21:34Z","snapshot_observed_at":"2026-07-06T11:48:42.000083Z","submitted_at":"2021-09-17T11:21:34Z","title":"ActionCLIP: A New Paradigm for Video Action Recognition","version":1},"cited_work":{"arxiv_id":"2109.08472","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2109.08472","snapshot_observed_at":"2026-07-04T20:00:08.259998Z","title":"Action- CLIP: A New Paradigm for Video Action Recognition","venue":null,"work_id":"e4022c4a-1a07-4760-a40b-9728fd25cdd4","year":2021},"citing_paper":{"arxiv_id":"2605.28229","last_updated":"2026-05-27T09:43:06Z","snapshot_observed_at":"2026-08-05T02:10:57.115222Z","submitted_at":"2026-05-27T09:43:06Z","title":"VidPrism: Heterogeneous Mixture of Experts for Image-to-Video Transfer","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-29T13:01:42.880738Z"},"links":{"cited_paper":"/paper/2109.08472","citing_paper":"/paper/2605.28229"},"observation_digest":"sha256:7e803ec46cb0ee997b13bcba86c0741e818b2f5a2e8badfed622b05293e5c733","observation_id":"82f2df7e-a194-4303-a9bc-8dd02a225af3","resolution":{"observed_at":"2026-06-29T13:03:25.922776Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.08472","last_updated":"2021-09-17T11:21:34Z","snapshot_observed_at":"2026-07-06T11:48:42.000083Z","submitted_at":"2021-09-17T11:21:34Z","title":"ActionCLIP: A New Paradigm for Video Action Recognition","version":1},"cited_work":{"arxiv_id":"2109.08472","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2109.08472","snapshot_observed_at":"2026-07-04T20:00:08.259998Z","title":"Action- CLIP: A New Paradigm for Video Action Recognition","venue":null,"work_id":"e4022c4a-1a07-4760-a40b-9728fd25cdd4","year":2021},"citing_paper":{"arxiv_id":"2606.00656","last_updated":"2026-05-30T10:00:52Z","snapshot_observed_at":"2026-07-06T23:41:19.955034Z","submitted_at":"2026-05-30T10:00:52Z","title":"Demystifying the Optimal Fair Classifier in Multi-Class Classification","version":1},"reference_index":184,"source":"arxiv_source","source_observed_at":"2026-06-28T18:49:29.377237Z"},"links":{"cited_paper":"/paper/2109.08472","citing_paper":"/paper/2606.00656"},"observation_digest":"sha256:214f1c90e441845b8c8e3a3044c91353ed8027bdd20961e5ebe9ae8ed0e238cf","observation_id":"fbb1ef4b-4342-42aa-b0d0-84eb9d5bcc46","resolution":{"observed_at":"2026-06-28T19:52:35.633070Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.08472","last_updated":"2021-09-17T11:21:34Z","snapshot_observed_at":"2026-07-06T11:48:42.000083Z","submitted_at":"2021-09-17T11:21:34Z","title":"ActionCLIP: A New Paradigm for Video Action Recognition","version":1},"cited_work":{"arxiv_id":"2109.08472","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2109.08472","snapshot_observed_at":"2026-07-04T20:00:08.259998Z","title":"Action- CLIP: A New Paradigm for Video Action Recognition","venue":null,"work_id":"e4022c4a-1a07-4760-a40b-9728fd25cdd4","year":2021},"citing_paper":{"arxiv_id":"2606.25160","last_updated":"2026-06-23T20:46:54Z","snapshot_observed_at":"2026-07-06T23:59:37.533078Z","submitted_at":"2026-06-23T20:46:54Z","title":"Toward Low-Latency Vision-Language Models with Doubly-Correct Predictions in Egocentric Visual Understanding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-25T23:47:12.032082Z"},"links":{"cited_paper":"/paper/2109.08472","citing_paper":"/paper/2606.25160"},"observation_digest":"sha256:8631551bce19e9788d77e67bb28382462a113ee8ef2d7748093eb39f9674c97c","observation_id":"b89ac15d-cda5-433e-ba95-01e276df524b","resolution":{"observed_at":"2026-07-04T17:20:00.470725Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.08472","last_updated":"2021-09-17T11:21:34Z","snapshot_observed_at":"2026-07-06T11:48:42.000083Z","submitted_at":"2021-09-17T11:21:34Z","title":"ActionCLIP: A New Paradigm for Video Action Recognition","version":1},"cited_work":{"arxiv_id":"2109.08472","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2109.08472","snapshot_observed_at":"2026-07-04T20:00:08.259998Z","title":"Action- CLIP: A New Paradigm for Video Action Recognition","venue":null,"work_id":"e4022c4a-1a07-4760-a40b-9728fd25cdd4","year":2021},"citing_paper":{"arxiv_id":"2606.25478","last_updated":"2026-06-29T04:17:52Z","snapshot_observed_at":"2026-08-04T07:34:36.354834Z","submitted_at":"2026-06-24T07:06:12Z","title":"TACO: Towards Task-Consistent Open-Vocabulary Adaptation in Video Recognition","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-25T20:54:39.254414Z"},"links":{"cited_paper":"/paper/2109.08472","citing_paper":"/paper/2606.25478"},"observation_digest":"sha256:3606d5d649e40d4f1a6b209afb42aeecf91f5480e71e17737528d054beb12e10","observation_id":"5105fa1e-95b7-4df3-9dbb-c4dc0fe454fa","resolution":{"observed_at":"2026-07-04T20:00:08.261733Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.08472","last_updated":"2021-09-17T11:21:34Z","snapshot_observed_at":"2026-07-06T11:48:42.000083Z","submitted_at":"2021-09-17T11:21:34Z","title":"ActionCLIP: A New Paradigm for Video Action Recognition","version":1},"cited_work":{"arxiv_id":"2109.08472","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2109.08472","snapshot_observed_at":"2026-07-04T20:00:08.259998Z","title":"Action- CLIP: A New Paradigm for Video Action Recognition","venue":null,"work_id":"e4022c4a-1a07-4760-a40b-9728fd25cdd4","year":2021},"citing_paper":{"arxiv_id":"2606.25478","last_updated":"2026-06-29T04:17:52Z","snapshot_observed_at":"2026-08-04T07:34:36.354834Z","submitted_at":"2026-06-24T07:06:12Z","title":"TACO: Towards Task-Consistent Open-Vocabulary Adaptation in Video Recognition","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-30T09:39:12.683562Z"},"links":{"cited_paper":"/paper/2109.08472","citing_paper":"/paper/2606.25478"},"observation_digest":"sha256:508c251b88fc2ff9dbbdf78d0ebb2afa12967450b61fba195b567cfb0a36b50b","observation_id":"f7dcf529-7636-4356-acf1-0530476bda84","resolution":{"observed_at":"2026-06-30T09:44:37.715522Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.08472","last_updated":"2021-09-17T11:21:34Z","snapshot_observed_at":"2026-07-06T11:48:42.000083Z","submitted_at":"2021-09-17T11:21:34Z","title":"ActionCLIP: A New Paradigm for Video Action Recognition","version":1},"cited_work":{"arxiv_id":"2109.08472","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2109.08472","snapshot_observed_at":"2026-07-04T20:00:08.259998Z","title":"Action- CLIP: A New Paradigm for Video Action Recognition","venue":null,"work_id":"e4022c4a-1a07-4760-a40b-9728fd25cdd4","year":2021},"citing_paper":{"arxiv_id":"2606.26981","last_updated":"2026-06-25T12:50:33Z","snapshot_observed_at":"2026-07-31T20:45:50.510483Z","submitted_at":"2026-06-25T12:50:33Z","title":"In-Context Model Predictive Generation: Open-Vocabulary Motion Synthesis from Language Models to Physics","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-26T05:15:22.022274Z"},"links":{"cited_paper":"/paper/2109.08472","citing_paper":"/paper/2606.26981"},"observation_digest":"sha256:896ca71ac999d5cccfdcdd0fa4e6bd1b96d8e8ad917994fd6991a358305af718","observation_id":"7b0ae27a-24ac-4b29-8281-5227163d1908","resolution":{"observed_at":"2026-07-04T13:29:50.802179Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.08472","last_updated":"2021-09-17T11:21:34Z","snapshot_observed_at":"2026-07-06T11:48:42.000083Z","submitted_at":"2021-09-17T11:21:34Z","title":"ActionCLIP: A New Paradigm for Video Action Recognition","version":1},"cited_work":{"arxiv_id":"2109.08472","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2109.08472","snapshot_observed_at":"2026-07-04T20:00:08.259998Z","title":"Action- CLIP: A New Paradigm for Video Action Recognition","venue":null,"work_id":"e4022c4a-1a07-4760-a40b-9728fd25cdd4","year":2021},"citing_paper":{"arxiv_id":"2606.27777","last_updated":"2026-06-26T07:06:34Z","snapshot_observed_at":"2026-07-07T00:01:59.695342Z","submitted_at":"2026-06-26T07:06:34Z","title":"TRUST: Efficient Abdominal Trauma Recognition via Image-to-Ultrasound-Video Transfer Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-29T05:08:02.242341Z"},"links":{"cited_paper":"/paper/2109.08472","citing_paper":"/paper/2606.27777"},"observation_digest":"sha256:347493912e7cb788c92110fc52ca4016f473c5a1db4d61f585b8ca29a9bb0c19","observation_id":"980d0c9c-a66e-42b1-944c-ae7f1d73f149","resolution":{"observed_at":"2026-06-29T18:23:51.208396Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.08472","last_updated":"2021-09-17T11:21:34Z","snapshot_observed_at":"2026-07-06T11:48:42.000083Z","submitted_at":"2021-09-17T11:21:34Z","title":"ActionCLIP: A New Paradigm for Video Action Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.08472","snapshot_observed_at":"2026-07-14T04:15:21.548043Z","title":"Actionclip: A new paradigm for video action recognition,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.11633","last_updated":"2026-07-13T14:49:06Z","snapshot_observed_at":"2026-08-09T13:02:19.040054Z","submitted_at":"2026-07-13T14:49:06Z","title":"Breaking the 15% Barrier: A Real-World Data-Driven System for Proactive Social Robot Triggered by User Nonverbal Cues","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-14T04:15:21.548043Z"},"links":{"cited_paper":"/paper/2109.08472","citing_paper":"/paper/2607.11633"},"observation_digest":"sha256:b26d1489ef383dc3f7b81873d6150761e8fedcaf3700604769d80fded2ccb7cb","observation_id":"b1de98bf-1973-4d4e-9c6d-69ee5aaf6fbe","resolution":{"observed_at":"2026-07-14T04:15:21.548043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.08472","last_updated":"2021-09-17T11:21:34Z","snapshot_observed_at":"2026-07-06T11:48:42.000083Z","submitted_at":"2021-09-17T11:21:34Z","title":"ActionCLIP: A New Paradigm for Video Action Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.08472","snapshot_observed_at":"2026-08-02T04:51:54.256318Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.13569","last_updated":"2026-07-20T14:28:04Z","snapshot_observed_at":"2026-08-08T12:50:27.660017Z","submitted_at":"2026-07-15T08:09:05Z","title":"GHR-VLM: Making Zero-Shot Transit Video Analytics Realizable with Grounded Hybrid Reasoning","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T04:51:54.256318Z"},"links":{"cited_paper":"/paper/2109.08472","citing_paper":"/paper/2607.13569"},"observation_digest":"sha256:a6ba4f430b181a5a6a63b6aef1e6021f94de88e73dc2c80de64725131cce2359","observation_id":"71a45313-f943-4d80-943f-5f4f0e7ccf5b","resolution":{"observed_at":"2026-08-02T04:51:54.256318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.08472","last_updated":"2021-09-17T11:21:34Z","snapshot_observed_at":"2026-07-06T11:48:42.000083Z","submitted_at":"2021-09-17T11:21:34Z","title":"ActionCLIP: A New Paradigm for Video Action Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.08472","snapshot_observed_at":"2026-08-02T03:19:52.676974Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.13941","last_updated":"2026-07-15T15:24:19Z","snapshot_observed_at":"2026-08-02T03:19:49.899405Z","submitted_at":"2026-07-15T15:24:19Z","title":"Peak-End-Net: A Peak-End Rule Inspired Framework for Generalizable Video Aesthetic Assessment","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T03:19:52.676974Z"},"links":{"cited_paper":"/paper/2109.08472","citing_paper":"/paper/2607.13941"},"observation_digest":"sha256:f972cf10e7c677d3d32640f2a447a1ffc3e973cb691f877060d398981ef505cb","observation_id":"37ad474c-adf1-4974-8d68-3e0b5f0c6071","resolution":{"observed_at":"2026-08-02T03:19:52.676974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.08472","last_updated":"2021-09-17T11:21:34Z","snapshot_observed_at":"2026-07-06T11:48:42.000083Z","submitted_at":"2021-09-17T11:21:34Z","title":"ActionCLIP: A New Paradigm for Video Action Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.08472","snapshot_observed_at":"2026-08-01T03:02:41.727505Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.26097","last_updated":"2026-08-04T07:44:31Z","snapshot_observed_at":"2026-08-07T23:09:38.098036Z","submitted_at":"2026-07-28T03:54:27Z","title":"Knowledge-guided Disentanglement with Atomic Actions for Action Recognition","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-01T03:02:41.727505Z"},"links":{"cited_paper":"/paper/2109.08472","citing_paper":"/paper/2607.26097"},"observation_digest":"sha256:8b07fb4c40cdb7eb381eda0ce543c0086bfb5f141e45458c5066ebd6cf619a3d","observation_id":"0cc73b54-d097-46e3-afed-9aa40a8047c3","resolution":{"observed_at":"2026-08-01T03:02:41.727505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2109.08472/citation-record","integrity":"/paper/2109.08472/integrity","json":"/paper/2109.08472/citation-record.json","paper":"/paper/2109.08472"},"outbound":[],"paper":{"arxiv_id":"2109.08472","last_updated":"2021-09-17T11:21:34Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T11:48:42.000083Z","submitted_at":"2021-09-17T11:21:34Z","title":"ActionCLIP: A New Paradigm for Video Action Recognition"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 40 inbound Pith citation observations for arXiv:2109.08472."}