{"as_of":"2026-08-17T05:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:29375645c04a5dacaaf950bf06d4e7cf746e244146a96177a8f1924343a375a0","coverage":[{"denominator":81,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":81,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T16:41:35.796320Z","state":"measured"},{"denominator":82,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":82,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T22:55:34.614403Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-15T22:55:35.017324Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.09895","last_updated":"2025-02-09T12:42:37Z","snapshot_observed_at":"2026-08-16T09:54:06.241187Z","submitted_at":"2024-12-13T06:30:52Z","title":"Building a Multi-modal Spatiotemporal Expert for Zero-shot Action Recognition with CLIP","version":2},"cited_work":{"arxiv_id":"2412.09895","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.09895","snapshot_observed_at":"2026-08-15T22:55:35.017324Z","title":"Building a Multi-modal Spatiotemporal Expert for Zero-shot Action Recognition with CLIP","venue":"cs.CV","work_id":"1890e494-72d6-44c9-852d-c5644f167492","year":2024},"citing_paper":{"arxiv_id":"2505.06002","last_updated":"2025-07-03T03:25:01Z","snapshot_observed_at":"2026-08-15T22:48:30.159327Z","submitted_at":"2025-05-09T12:34:10Z","title":"Task-Adapter++: Task-specific Adaptation with Order-aware Alignment for Few-shot Action Recognition","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T22:55:34.614403Z"},"links":{"cited_paper":"/paper/2412.09895","citing_paper":"/paper/2505.06002"},"observation_digest":"sha256:f2a14bcac18be6bfae2584a39b4f220d7b8fa1a2c88f83879e271288e8fdf397","observation_id":"a789da5b-9901-4a69-8fca-e9115415c18e","resolution":{"observed_at":"2026-08-15T22:55:35.022671Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.09895/citation-record","integrity":"/paper/2412.09895/integrity","json":"/paper/2412.09895/citation-record.json","paper":"/paper/2412.09895"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:41:37.003489Z","title":null,"venue":null,"work_id":"dd831b38-24f6-432e-94cc-906d38a5ad97","year":null},"citing_paper":{"arxiv_id":"2412.09895","last_updated":"2025-02-09T12:42:37Z","snapshot_observed_at":"2026-08-16T09:54:06.241187Z","submitted_at":"2024-12-13T06:30:52Z","title":"Building a Multi-modal Spatiotemporal Expert for Zero-shot Action Recognition with CLIP","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T16:41:35.460295Z"},"links":{"citing_paper":"/paper/2412.09895"},"observation_digest":"sha256:eac3f0f34e3d80ece1afdaee6983323cea7557489c31215ffcb34e09e5c77c73","observation_id":"e1e4052c-37f7-49c0-8ff1-b206c51fa4a5","resolution":{"observed_at":"2026-08-11T16:41:37.008579Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:41:36.988933Z","title":null,"venue":null,"work_id":"813933c6-8571-4d62-bebd-efcba5af0721","year":null},"citing_paper":{"arxiv_id":"2412.09895","last_updated":"2025-02-09T12:42:37Z","snapshot_observed_at":"2026-08-16T09:54:06.241187Z","submitted_at":"2024-12-13T06:30:52Z","title":"Building a Multi-modal Spatiotemporal Expert for Zero-shot Action Recognition with CLIP","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T16:41:35.464893Z"},"links":{"citing_paper":"/paper/2412.09895"},"observation_digest":"sha256:8d13ff8ed9fadd6b55b719b657da6ae509da873df1b3e6f5630bbd39c5716ebf","observation_id":"8d83d00c-8508-4542-be35-1b33c1091153","resolution":{"observed_at":"2026-08-11T16:41:36.993580Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1808.01340","last_updated":"2018-08-03T20:17:05Z","snapshot_observed_at":"2026-08-15T17:51:24.030376Z","submitted_at":"2018-08-03T20:17:05Z","title":"A Short Note about Kinetics-600","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.01340","snapshot_observed_at":"2026-08-11T16:41:35.425233Z","title":"Advances in neural information processing systems, 33: 1877–1901","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2412.09895","last_updated":"2025-02-09T12:42:37Z","snapshot_observed_at":"2026-08-16T09:54:06.241187Z","submitted_at":"2024-12-13T06:30:52Z","title":"Building a Multi-modal Spatiotemporal Expert for Zero-shot Action Recognition with CLIP","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T16:41:35.425233Z"},"links":{"cited_paper":"/paper/1808.01340","citing_paper":"/paper/2412.09895"},"observation_digest":"sha256:6631ce187875a30eca4be4a48c6e86faec08da63a33c11ede0c20e915f785056","observation_id":"cd1035d4-28eb-48c7-9093-06919a7e5916","resolution":{"observed_at":"2026-08-11T16:41:35.425233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:41:36.957189Z","title":null,"venue":null,"work_id":"b3da2fbf-cf92-4faa-8720-763e59e26ac3","year":null},"citing_paper":{"arxiv_id":"2412.09895","last_updated":"2025-02-09T12:42:37Z","snapshot_observed_at":"2026-08-16T09:54:06.241187Z","submitted_at":"2024-12-13T06:30:52Z","title":"Building a Multi-modal Spatiotemporal Expert for Zero-shot Action Recognition with CLIP","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T16:41:35.474613Z"},"links":{"citing_paper":"/paper/2412.09895"},"observation_digest":"sha256:4e8be4b971705c3e78fc304aac6d3006e054d66a15bbc54f7f8181029fb6350b","observation_id":"b5628ccf-e913-441f-bc6f-25fd9d9b3ff3","resolution":{"observed_at":"2026-08-11T16:41:36.962123Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:41:36.927997Z","title":null,"venue":null,"work_id":"b3d7015f-7830-455f-946e-cb016ef139f4","year":null},"citing_paper":{"arxiv_id":"2412.09895","last_updated":"2025-02-09T12:42:37Z","snapshot_observed_at":"2026-08-16T09:54:06.241187Z","submitted_at":"2024-12-13T06:30:52Z","title":"Building a Multi-modal Spatiotemporal Expert for Zero-shot Action Recognition with CLIP","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T16:41:35.479269Z"},"links":{"citing_paper":"/paper/2412.09895"},"observation_digest":"sha256:a4d0a25cff2b7fff266a1db92109b0cc6a55d3e457502aeb563b09c6b2a85b2a","observation_id":"0748889f-d01e-4c92-8b6d-569f533d136c","resolution":{"observed_at":"2026-08-11T16:41:36.932708Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:41:36.913509Z","title":null,"venue":null,"work_id":"0920a3c6-fb38-42fb-9b4a-2eed767d684f","year":null},"citing_paper":{"arxiv_id":"2412.09895","last_updated":"2025-02-09T12:42:37Z","snapshot_observed_at":"2026-08-16T09:54:06.241187Z","submitted_at":"2024-12-13T06:30:52Z","title":"Building a Multi-modal Spatiotemporal Expert for Zero-shot Action Recognition with CLIP","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T16:41:35.484238Z"},"links":{"citing_paper":"/paper/2412.09895"},"observation_digest":"sha256:c58c81fea4be82f679a0f8030540a8f2d277840019f13747dc4a46fbc486438e","observation_id":"cece37e7-1654-4128-9149-d896670024fe","resolution":{"observed_at":"2026-08-11T16:41:36.918232Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1212.0402","last_updated":"2012-12-03T14:45:31Z","snapshot_observed_at":"2026-08-16T21:21:44.768787Z","submitted_at":"2012-12-03T14:45:31Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1212.0402","snapshot_observed_at":"2026-08-11T16:41:35.444683Z","title":"In Pro- ceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, 6545–6554","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.09895","last_updated":"2025-02-09T12:42:37Z","snapshot_observed_at":"2026-08-16T09:54:06.241187Z","submitted_at":"2024-12-13T06:30:52Z","title":"Building a Multi-modal Spatiotemporal Expert for Zero-shot Action Recognition with CLIP","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T16:41:35.444683Z"},"links":{"cited_paper":"/paper/1212.0402","citing_paper":"/paper/2412.09895"},"observation_digest":"sha256:54cb1fe6a6c1f23a936bd368fee794c76cd79d2acedd4ad74e941ca531c61713","observation_id":"6e3c96fc-4ad9-4dd4-895c-14abf033f7c0","resolution":{"observed_at":"2026-08-11T16:41:35.444683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.08472","last_updated":"2021-09-17T11:21:34Z","snapshot_observed_at":"2026-08-16T17:55:55.135501Z","submitted_at":"2021-09-17T11:21:34Z","title":"ActionCLIP: A New Paradigm for Video Action Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.08472","snapshot_observed_at":"2026-08-11T16:41:35.449384Z","title":"In Proceedings of the IEEE/CVF International Conference on Computer Vision, 19936–19947","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09895","last_updated":"2025-02-09T12:42:37Z","snapshot_observed_at":"2026-08-16T09:54:06.241187Z","submitted_at":"2024-12-13T06:30:52Z","title":"Building a Multi-modal Spatiotemporal Expert for Zero-shot Action Recognition with CLIP","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T16:41:35.449384Z"},"links":{"cited_paper":"/paper/2109.08472","citing_paper":"/paper/2412.09895"},"observation_digest":"sha256:a19906f2b67cb24bc773f3000e77d8cf162c4353c78ffc42e1f22025086581cb","observation_id":"abcbb0da-2040-4bd1-90e5-bde471121f85","resolution":{"observed_at":"2026-08-11T16:41:35.449384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.03024","last_updated":"2023-02-06T18:59:17Z","snapshot_observed_at":"2026-08-16T15:57:18.631878Z","submitted_at":"2023-02-06T18:59:17Z","title":"AIM: Adapting Image Models for Efficient Video Action Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.03024","snapshot_observed_at":"2026-08-11T16:41:35.455213Z","title":"commonsense knowledge base for human actions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09895","last_updated":"2025-02-09T12:42:37Z","snapshot_observed_at":"2026-08-16T09:54:06.241187Z","submitted_at":"2024-12-13T06:30:52Z","title":"Building a Multi-modal Spatiotemporal Expert for Zero-shot Action Recognition with CLIP","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T16:41:35.455213Z"},"links":{"cited_paper":"/paper/2302.03024","citing_paper":"/paper/2412.09895"},"observation_digest":"sha256:11539a08359c5ddaef45338a00c3de4a65b160029513c0ef55d699b9a3d7f839","observation_id":"7d050f96-786a-4bde-8973-7ca2b622a978","resolution":{"observed_at":"2026-08-11T16:41:35.455213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:41:36.972856Z","title":null,"venue":null,"work_id":"d788e38d-27d2-444d-b883-28cbd119c52a","year":null},"citing_paper":{"arxiv_id":"2412.09895","last_updated":"2025-02-09T12:42:37Z","snapshot_observed_at":"2026-08-16T09:54:06.241187Z","submitted_at":"2024-12-13T06:30:52Z","title":"Building a Multi-modal Spatiotemporal Expert for Zero-shot Action Recognition with CLIP","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T16:41:35.469970Z"},"links":{"citing_paper":"/paper/2412.09895"},"observation_digest":"sha256:a39241aa48bc2067b92de13303a42e8dd603f07c0a7bd9db39442bbe05cd48df","observation_id":"2d5d870c-9dd9-4c77-96f1-7ef6de7e99a9","resolution":{"observed_at":"2026-08-11T16:41:36.977628Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:41:36.899214Z","title":"Sub-action list:","venue":null,"work_id":"cc5949d3-a634-4218-8916-829f85e6335f","year":null},"citing_paper":{"arxiv_id":"2412.09895","last_updated":"2025-02-09T12:42:37Z","snapshot_observed_at":"2026-08-16T09:54:06.241187Z","submitted_at":"2024-12-13T06:30:52Z","title":"Building a Multi-modal Spatiotemporal Expert for Zero-shot Action Recognition with CLIP","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T16:41:35.489068Z"},"links":{"citing_paper":"/paper/2412.09895"},"observation_digest":"sha256:2c58e89e20054968ff0b8ab30e3083799dd31dcc56fda7d1f97d10b156f16413","observation_id":"24df1153-402e-4455-a5ab-8c5887c7c98c","resolution":{"observed_at":"2026-08-11T16:41:36.903915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:41:36.883577Z","title":null,"venue":null,"work_id":"d7de57df-878e-43bb-b6d7-7345ef65de24","year":null},"citing_paper":{"arxiv_id":"2412.09895","last_updated":"2025-02-09T12:42:37Z","snapshot_observed_at":"2026-08-16T09:54:06.241187Z","submitted_at":"2024-12-13T06:30:52Z","title":"Building a Multi-modal Spatiotemporal Expert for Zero-shot Action Recognition with CLIP","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T16:41:35.493873Z"},"links":{"citing_paper":"/paper/2412.09895"},"observation_digest":"sha256:4af19a137c9a47d9c34cc021cb85d99c7dcd536790c1c1350d167923b356474b","observation_id":"2c3238b8-7ef8-4f67-b250-f54f529a39ba","resolution":{"observed_at":"2026-08-11T16:41:36.888249Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:41:36.867951Z","title":null,"venue":null,"work_id":"b6ddaa72-6c61-4966-b600-13bcbd7e7495","year":null},"citing_paper":{"arxiv_id":"2412.09895","last_updated":"2025-02-09T12:42:37Z","snapshot_observed_at":"2026-08-16T09:54:06.241187Z","submitted_at":"2024-12-13T06:30:52Z","title":"Building a Multi-modal Spatiotemporal Expert for Zero-shot Action Recognition with CLIP","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T16:41:35.498702Z"},"links":{"citing_paper":"/paper/2412.09895"},"observation_digest":"sha256:2385e9eebde1952456271b07d1272698524f7e0aca47693b4ebc249b71050554","observation_id":"658f3d45-73e9-426b-a703-3bca23e6cac8","resolution":{"observed_at":"2026-08-11T16:41:36.873477Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:41:36.852684Z","title":null,"venue":null,"work_id":"f0f2e75a-873a-43e4-9fe9-0c07b813edb0","year":null},"citing_paper":{"arxiv_id":"2412.09895","last_updated":"2025-02-09T12:42:37Z","snapshot_observed_at":"2026-08-16T09:54:06.241187Z","submitted_at":"2024-12-13T06:30:52Z","title":"Building a Multi-modal Spatiotemporal Expert for Zero-shot Action Recognition with CLIP","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T16:41:35.504067Z"},"links":{"citing_paper":"/paper/2412.09895"},"observation_digest":"sha256:4b83580b4b934316adeade4cfc597c0e8a8c3acfd4553e7b7b4bde15a9af797c","observation_id":"c29aa97d-2e3b-4258-b881-a5d3b385ac85","resolution":{"observed_at":"2026-08-11T16:41:36.857743Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:41:36.837542Z","title":null,"venue":null,"work_id":"e2c25ee9-f0c5-445a-8d49-f66595aa7b03","year":null},"citing_paper":{"arxiv_id":"2412.09895","last_updated":"2025-02-09T12:42:37Z","snapshot_observed_at":"2026-08-16T09:54:06.241187Z","submitted_at":"2024-12-13T06:30:52Z","title":"Building a Multi-modal Spatiotemporal Expert for Zero-shot Action Recognition with CLIP","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T16:41:35.509306Z"},"links":{"citing_paper":"/paper/2412.09895"},"observation_digest":"sha256:d6a141fec7f2ee00ab042640aef7e79bd59fe408a6df88a5d9c084a23dffdf90","observation_id":"000d4a80-9583-490e-b2a8-012a0159c461","resolution":{"observed_at":"2026-08-11T16:41:36.842178Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:41:36.822568Z","title":null,"venue":null,"work_id":"3446d64f-2463-4807-bb33-71514d70a07f","year":null},"citing_paper":{"arxiv_id":"2412.09895","last_updated":"2025-02-09T12:42:37Z","snapshot_observed_at":"2026-08-16T09:54:06.241187Z","submitted_at":"2024-12-13T06:30:52Z","title":"Building a Multi-modal Spatiotemporal Expert for Zero-shot Action Recognition with CLIP","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T16:41:35.514358Z"},"links":{"citing_paper":"/paper/2412.09895"},"observation_digest":"sha256:54a58ff7e315289a256ed65d1390755498712c045b1903c1690bcf0142506314","observation_id":"d0408fee-b2f2-463d-b198-de4a8d6559a5","resolution":{"observed_at":"2026-08-11T16:41:36.827080Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:41:36.807418Z","title":null,"venue":null,"work_id":"d5bfdf92-fb61-492e-9ddd-17e449f9c6cf","year":null},"citing_paper":{"arxiv_id":"2412.09895","last_updated":"2025-02-09T12:42:37Z","snapshot_observed_at":"2026-08-16T09:54:06.241187Z","submitted_at":"2024-12-13T06:30:52Z","title":"Building a Multi-modal Spatiotemporal Expert for Zero-shot Action Recognition with CLIP","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T16:41:35.519169Z"},"links":{"citing_paper":"/paper/2412.09895"},"observation_digest":"sha256:25227c63880045c8e1a93dc737447fe813782eef34cb0a19ec417432415d142c","observation_id":"4f86c36b-5afa-45ce-a71d-9884aa93d8f2","resolution":{"observed_at":"2026-08-11T16:41:36.812538Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:41:36.792201Z","title":null,"venue":null,"work_id":"2f423711-1ccd-467f-9eb1-53f0e16ce6c2","year":null},"citing_paper":{"arxiv_id":"2412.09895","last_updated":"2025-02-09T12:42:37Z","snapshot_observed_at":"2026-08-16T09:54:06.241187Z","submitted_at":"2024-12-13T06:30:52Z","title":"Building a Multi-modal Spatiotemporal Expert for Zero-shot Action Recognition with CLIP","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T16:41:35.524367Z"},"links":{"citing_paper":"/paper/2412.09895"},"observation_digest":"sha256:ead976b03b8d80cb8716a9ceccaa1947388bb5c56fbed5f0343d6105abbafed5","observation_id":"2e37585c-0929-45ce-8feb-356115eb4bfc","resolution":{"observed_at":"2026-08-11T16:41:36.796896Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:41:36.776978Z","title":null,"venue":null,"work_id":"c6daec89-e9d9-4969-80e4-019cfc483a9f","year":null},"citing_paper":{"arxiv_id":"2412.09895","last_updated":"2025-02-09T12:42:37Z","snapshot_observed_at":"2026-08-16T09:54:06.241187Z","submitted_at":"2024-12-13T06:30:52Z","title":"Building a Multi-modal Spatiotemporal Expert for Zero-shot Action Recognition with CLIP","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T16:41:35.529457Z"},"links":{"citing_paper":"/paper/2412.09895"},"observation_digest":"sha256:bd54f942cc7792c8ee437753e2166d52922682b805913a92b7ef817743727f65","observation_id":"472d5c52-89ce-4ddc-8f95-977771c9997c","resolution":{"observed_at":"2026-08-11T16:41:36.781860Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:41:36.760777Z","title":"Sub-action relation triples for temporal text prompts [T]:","venue":null,"work_id":"705d7850-9ac0-4c01-8fee-755307c825c2","year":null},"citing_paper":{"arxiv_id":"2412.09895","last_updated":"2025-02-09T12:42:37Z","snapshot_observed_at":"2026-08-16T09:54:06.241187Z","submitted_at":"2024-12-13T06:30:52Z","title":"Building a Multi-modal Spatiotemporal Expert for Zero-shot Action Recognition with CLIP","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T16:41:35.534387Z"},"links":{"citing_paper":"/paper/2412.09895"},"observation_digest":"sha256:56dfbc62b5477c75fe30cada594677bdebd157d22c6ba629e3fabf2c2bedceb0","observation_id":"907bf1e0-99c7-4291-a594-569dad3c5d78","resolution":{"observed_at":"2026-08-11T16:41:36.765399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:41:36.746814Z","title":null,"venue":null,"work_id":"333285e4-6859-49f5-b7eb-634e2b6abbff","year":null},"citing_paper":{"arxiv_id":"2412.09895","last_updated":"2025-02-09T12:42:37Z","snapshot_observed_at":"2026-08-16T09:54:06.241187Z","submitted_at":"2024-12-13T06:30:52Z","title":"Building a Multi-modal Spatiotemporal Expert for Zero-shot Action Recognition with CLIP","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T16:41:35.538823Z"},"links":{"citing_paper":"/paper/2412.09895"},"observation_digest":"sha256:541a8af4df4f546bbe5381387e63c356d36550b49f7e1d91a0d4e1874185b469","observation_id":"d464e9af-b9d3-41a4-bf4c-b103b0615b69","resolution":{"observed_at":"2026-08-11T16:41:36.750950Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:41:36.733113Z","title":null,"venue":null,"work_id":"72ff2035-fdb7-4dca-b4e6-cf76a314ca8d","year":null},"citing_paper":{"arxiv_id":"2412.09895","last_updated":"2025-02-09T12:42:37Z","snapshot_observed_at":"2026-08-16T09:54:06.241187Z","submitted_at":"2024-12-13T06:30:52Z","title":"Building a Multi-modal Spatiotemporal Expert for Zero-shot Action Recognition with CLIP","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T16:41:35.543406Z"},"links":{"citing_paper":"/paper/2412.09895"},"observation_digest":"sha256:59cdcdf4e042ea1f630a4d7fdfcee3c77c60ceea1734bacfd06d32c5deaa2412","observation_id":"2905054b-43ef-4078-b1a9-f87f9efb41c3","resolution":{"observed_at":"2026-08-11T16:41:36.737523Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:41:36.718646Z","title":null,"venue":null,"work_id":"87f712b6-238e-4aaa-b333-b2db8d40d5a8","year":null},"citing_paper":{"arxiv_id":"2412.09895","last_updated":"2025-02-09T12:42:37Z","snapshot_observed_at":"2026-08-16T09:54:06.241187Z","submitted_at":"2024-12-13T06:30:52Z","title":"Building a Multi-modal Spatiotemporal Expert for Zero-shot Action Recognition with CLIP","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T16:41:35.548859Z"},"links":{"citing_paper":"/paper/2412.09895"},"observation_digest":"sha256:178195c4132e454082e56cbbd3cbe54a201c38e0d398c199dd9fb15e71dbca82","observation_id":"d43fb80d-a3ac-4d7d-b238-37da53c63b3a","resolution":{"observed_at":"2026-08-11T16:41:36.723612Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:41:36.702759Z","title":null,"venue":null,"work_id":"dfa40a57-c008-49dd-91ad-28c5ab9dc8ac","year":null},"citing_paper":{"arxiv_id":"2412.09895","last_updated":"2025-02-09T12:42:37Z","snapshot_observed_at":"2026-08-16T09:54:06.241187Z","submitted_at":"2024-12-13T06:30:52Z","title":"Building a Multi-modal Spatiotemporal Expert for Zero-shot Action Recognition with CLIP","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T16:41:35.554641Z"},"links":{"citing_paper":"/paper/2412.09895"},"observation_digest":"sha256:f5402d0d9647de86a918f3e08db3e5f33a294e306d37d56d6594126a1a7fb2d6","observation_id":"520871b4-8713-4c6b-97aa-4e9dd1b395b0","resolution":{"observed_at":"2026-08-11T16:41:36.708199Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:41:36.684850Z","title":null,"venue":null,"work_id":"513b80c5-ef96-4173-a6da-d988f882a1e4","year":null},"citing_paper":{"arxiv_id":"2412.09895","last_updated":"2025-02-09T12:42:37Z","snapshot_observed_at":"2026-08-16T09:54:06.241187Z","submitted_at":"2024-12-13T06:30:52Z","title":"Building a Multi-modal Spatiotemporal Expert for Zero-shot Action Recognition with CLIP","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T16:41:35.560349Z"},"links":{"citing_paper":"/paper/2412.09895"},"observation_digest":"sha256:52a40544dff1d5f4186f5ac17d857cf597fe4fe3d78fd3896df122c287a45965","observation_id":"c24c487f-8871-495a-9cf6-939cce21ac34","resolution":{"observed_at":"2026-08-11T16:41:36.689492Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:41:36.670509Z","title":"Responses for action category “Surfing”: Object list for spatial text prompts [S]:","venue":null,"work_id":"d911a028-2dec-4285-9d35-da09c0d45bb1","year":null},"citing_paper":{"arxiv_id":"2412.09895","last_updated":"2025-02-09T12:42:37Z","snapshot_observed_at":"2026-08-16T09:54:06.241187Z","submitted_at":"2024-12-13T06:30:52Z","title":"Building a Multi-modal Spatiotemporal Expert for Zero-shot Action Recognition with CLIP","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T16:41:35.565565Z"},"links":{"citing_paper":"/paper/2412.09895"},"observation_digest":"sha256:7ecdba7d11954e3a78e0836d8292fac6d9e779df68e0824046482126cd4d0f45","observation_id":"34bc97d2-29ae-42d0-bb6c-6090aaa87c95","resolution":{"observed_at":"2026-08-11T16:41:36.675106Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:41:36.656336Z","title":null,"venue":null,"work_id":"e72bdd1c-a01f-4b42-902d-2e9c16a85231","year":null},"citing_paper":{"arxiv_id":"2412.09895","last_updated":"2025-02-09T12:42:37Z","snapshot_observed_at":"2026-08-16T09:54:06.241187Z","submitted_at":"2024-12-13T06:30:52Z","title":"Building a Multi-modal Spatiotemporal Expert for Zero-shot Action Recognition with CLIP","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T16:41:35.570823Z"},"links":{"citing_paper":"/paper/2412.09895"},"observation_digest":"sha256:4d8f29480afdc516853cfc49134c5702482977c6e44957b0ae67d0b0809d2776","observation_id":"3508cd0c-47ef-4aea-890d-89a117075176","resolution":{"observed_at":"2026-08-11T16:41:36.660917Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:41:36.641510Z","title":null,"venue":null,"work_id":"26a985c0-d3db-4380-bb6d-ec43ddae7100","year":null},"citing_paper":{"arxiv_id":"2412.09895","last_updated":"2025-02-09T12:42:37Z","snapshot_observed_at":"2026-08-16T09:54:06.241187Z","submitted_at":"2024-12-13T06:30:52Z","title":"Building a Multi-modal Spatiotemporal Expert for Zero-shot Action Recognition with CLIP","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T16:41:35.574896Z"},"links":{"citing_paper":"/paper/2412.09895"},"observation_digest":"sha256:97d87ee7f92175ee312d28e1ffe3f9a4195e6da70010d53ec788f5cd684b0adb","observation_id":"4b833654-c6df-455d-8124-7cb60090ae95","resolution":{"observed_at":"2026-08-11T16:41:36.646147Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:41:36.626777Z","title":null,"venue":null,"work_id":"97feed5d-7864-4b0c-8d17-400c81cbb85c","year":null},"citing_paper":{"arxiv_id":"2412.09895","last_updated":"2025-02-09T12:42:37Z","snapshot_observed_at":"2026-08-16T09:54:06.241187Z","submitted_at":"2024-12-13T06:30:52Z","title":"Building a Multi-modal Spatiotemporal Expert for Zero-shot Action Recognition with CLIP","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T16:41:35.579164Z"},"links":{"citing_paper":"/paper/2412.09895"},"observation_digest":"sha256:a2075408559adda8165899d1bdb5835e834bb4c10708343e6b278cd4d61f1623","observation_id":"c76308dd-8a8f-4355-9f6b-9d027017bb75","resolution":{"observed_at":"2026-08-11T16:41:36.631409Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:41:36.612198Z","title":null,"venue":null,"work_id":"0912a0e6-2a85-4aa5-b3ea-f7decad77a6f","year":null},"citing_paper":{"arxiv_id":"2412.09895","last_updated":"2025-02-09T12:42:37Z","snapshot_observed_at":"2026-08-16T09:54:06.241187Z","submitted_at":"2024-12-13T06:30:52Z","title":"Building a Multi-modal Spatiotemporal Expert for Zero-shot Action Recognition with CLIP","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T16:41:35.583420Z"},"links":{"citing_paper":"/paper/2412.09895"},"observation_digest":"sha256:c8aba586fac0fb5ff6b03457ae0946e57ece220e2cfd5fe5ea1597bf193db61f","observation_id":"ed8cb8bb-fcfa-4798-a8b5-2c31f6b40fc6","resolution":{"observed_at":"2026-08-11T16:41:36.616920Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:41:36.595579Z","title":null,"venue":null,"work_id":"d753b301-37ed-4d98-9eaf-4326e2a2a5b8","year":null},"citing_paper":{"arxiv_id":"2412.09895","last_updated":"2025-02-09T12:42:37Z","snapshot_observed_at":"2026-08-16T09:54:06.241187Z","submitted_at":"2024-12-13T06:30:52Z","title":"Building a Multi-modal Spatiotemporal Expert for Zero-shot Action Recognition with CLIP","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T16:41:35.587957Z"},"links":{"citing_paper":"/paper/2412.09895"},"observation_digest":"sha256:397881def3adc24449ec1c7190b5b6746a1c47c352b916a64bce48c33ee05bc2","observation_id":"b407b063-6e62-4508-bfe9-6f13d09b2999","resolution":{"observed_at":"2026-08-11T16:41:36.600275Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:41:36.579695Z","title":null,"venue":null,"work_id":"13098650-bd32-474b-8d52-d2d308c0e6c2","year":null},"citing_paper":{"arxiv_id":"2412.09895","last_updated":"2025-02-09T12:42:37Z","snapshot_observed_at":"2026-08-16T09:54:06.241187Z","submitted_at":"2024-12-13T06:30:52Z","title":"Building a Multi-modal Spatiotemporal Expert for Zero-shot Action Recognition with CLIP","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T16:41:35.592642Z"},"links":{"citing_paper":"/paper/2412.09895"},"observation_digest":"sha256:3c245873f1c17d91cd48ad7314fb8dd19fe4f8f25bac6c778e715f2f9073515c","observation_id":"0ff8ec5c-6c18-4ec7-9a34-f818a585fc4d","resolution":{"observed_at":"2026-08-11T16:41:36.585007Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:41:36.563742Z","title":"Sub-action list:","venue":null,"work_id":"0d5d7d89-767c-4b1d-bcc8-c9c16c75e346","year":null},"citing_paper":{"arxiv_id":"2412.09895","last_updated":"2025-02-09T12:42:37Z","snapshot_observed_at":"2026-08-16T09:54:06.241187Z","submitted_at":"2024-12-13T06:30:52Z","title":"Building a Multi-modal Spatiotemporal Expert for Zero-shot Action Recognition with CLIP","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T16:41:35.596857Z"},"links":{"citing_paper":"/paper/2412.09895"},"observation_digest":"sha256:b7647d5c0a1d6857812b5b459cf51ef695bbbc4f03bdf23a929c9b406d802de6","observation_id":"3310ed52-22ca-41e7-9fd2-dafb21b4346c","resolution":{"observed_at":"2026-08-11T16:41:36.568910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:41:36.550313Z","title":"given action name","venue":null,"work_id":"be9a9c15-e1fd-47af-8ef4-de0f73c0dfd3","year":null},"citing_paper":{"arxiv_id":"2412.09895","last_updated":"2025-02-09T12:42:37Z","snapshot_observed_at":"2026-08-16T09:54:06.241187Z","submitted_at":"2024-12-13T06:30:52Z","title":"Building a Multi-modal Spatiotemporal Expert for Zero-shot Action Recognition with CLIP","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T16:41:35.602066Z"},"links":{"citing_paper":"/paper/2412.09895"},"observation_digest":"sha256:317724474261a637f369a32cd40f0d3f970814905b46c62c829b88ede50878f4","observation_id":"1e8ce5c8-232c-4fa1-a67f-f0418efaf330","resolution":{"observed_at":"2026-08-11T16:41:36.554491Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:41:36.535795Z","title":null,"venue":null,"work_id":"c60d298f-78fe-4778-98f8-3d750b5a13d6","year":null},"citing_paper":{"arxiv_id":"2412.09895","last_updated":"2025-02-09T12:42:37Z","snapshot_observed_at":"2026-08-16T09:54:06.241187Z","submitted_at":"2024-12-13T06:30:52Z","title":"Building a Multi-modal Spatiotemporal Expert for Zero-shot Action Recognition with CLIP","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T16:41:35.607394Z"},"links":{"citing_paper":"/paper/2412.09895"},"observation_digest":"sha256:57bd2e990f68faf31d4702e3d3e37b9b587f59fbfb892a39f41da8bf5660ca36","observation_id":"715ba0c4-9293-4c8c-9823-1f53f9e321c3","resolution":{"observed_at":"2026-08-11T16:41:36.539984Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:41:36.521688Z","title":null,"venue":null,"work_id":"f6b71e72-402e-4fe7-97ae-392f9b8daf4d","year":null},"citing_paper":{"arxiv_id":"2412.09895","last_updated":"2025-02-09T12:42:37Z","snapshot_observed_at":"2026-08-16T09:54:06.241187Z","submitted_at":"2024-12-13T06:30:52Z","title":"Building a Multi-modal Spatiotemporal Expert for Zero-shot Action Recognition with CLIP","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T16:41:35.612239Z"},"links":{"citing_paper":"/paper/2412.09895"},"observation_digest":"sha256:f1015e343c3ecb711415e86d206f4e6fac41701d42bf7b8befee2e3eae08eb61","observation_id":"cb3a4fe5-4b16-4954-8e1f-3e346d6c43fa","resolution":{"observed_at":"2026-08-11T16:41:36.525766Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:41:36.508433Z","title":null,"venue":null,"work_id":"ae656c01-d96d-490f-8f7b-035ec8450309","year":null},"citing_paper":{"arxiv_id":"2412.09895","last_updated":"2025-02-09T12:42:37Z","snapshot_observed_at":"2026-08-16T09:54:06.241187Z","submitted_at":"2024-12-13T06:30:52Z","title":"Building a Multi-modal Spatiotemporal Expert for Zero-shot Action Recognition with CLIP","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T16:41:35.617075Z"},"links":{"citing_paper":"/paper/2412.09895"},"observation_digest":"sha256:5bd710c82adfe828e67b6deb0937d35a3cc3647c96c67ad7f842d8ea08ceb940","observation_id":"e6896d1f-d830-4e01-bb3b-e727d0669cdb","resolution":{"observed_at":"2026-08-11T16:41:36.512304Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:41:36.494081Z","title":null,"venue":null,"work_id":"9dfbf828-2739-4a88-a81c-8dcbd25cb008","year":null},"citing_paper":{"arxiv_id":"2412.09895","last_updated":"2025-02-09T12:42:37Z","snapshot_observed_at":"2026-08-16T09:54:06.241187Z","submitted_at":"2024-12-13T06:30:52Z","title":"Building a Multi-modal Spatiotemporal Expert for Zero-shot Action Recognition with CLIP","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T16:41:35.621966Z"},"links":{"citing_paper":"/paper/2412.09895"},"observation_digest":"sha256:3d2033306cfa723295317ebfbada27ca762ab2485db7771b31fc5f8e6a613c37","observation_id":"4604b74a-3dc0-4a02-810e-741808f2f607","resolution":{"observed_at":"2026-08-11T16:41:36.498650Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:41:36.478761Z","title":null,"venue":null,"work_id":"f33469c2-85af-4f1a-b6fa-910a2f4054f3","year":null},"citing_paper":{"arxiv_id":"2412.09895","last_updated":"2025-02-09T12:42:37Z","snapshot_observed_at":"2026-08-16T09:54:06.241187Z","submitted_at":"2024-12-13T06:30:52Z","title":"Building a Multi-modal Spatiotemporal Expert for Zero-shot Action Recognition with CLIP","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T16:41:35.627226Z"},"links":{"citing_paper":"/paper/2412.09895"},"observation_digest":"sha256:85c5a6ffa01e5a6462f0d4b979aff3ad892526414f9c2f2dfe9ac87ac1fb17fa","observation_id":"7eef8db0-8f5c-4155-beaa-c48496b87f3f","resolution":{"observed_at":"2026-08-11T16:41:36.483352Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:41:36.463267Z","title":null,"venue":null,"work_id":"b44122b0-a681-4466-b784-7bf99f6aac7a","year":null},"citing_paper":{"arxiv_id":"2412.09895","last_updated":"2025-02-09T12:42:37Z","snapshot_observed_at":"2026-08-16T09:54:06.241187Z","submitted_at":"2024-12-13T06:30:52Z","title":"Building a Multi-modal Spatiotemporal Expert for Zero-shot Action Recognition with CLIP","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T16:41:35.632248Z"},"links":{"citing_paper":"/paper/2412.09895"},"observation_digest":"sha256:f08555de117a29fe28a7acb64e96cf30ba695613e27080ef93161593fe34564d","observation_id":"c327faa7-29f0-4752-a44f-e59524ef7e60","resolution":{"observed_at":"2026-08-11T16:41:36.468702Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:41:36.448363Z","title":null,"venue":null,"work_id":"0e9db7c5-b32f-4089-a7a5-12c05360b9f6","year":null},"citing_paper":{"arxiv_id":"2412.09895","last_updated":"2025-02-09T12:42:37Z","snapshot_observed_at":"2026-08-16T09:54:06.241187Z","submitted_at":"2024-12-13T06:30:52Z","title":"Building a Multi-modal Spatiotemporal Expert for Zero-shot Action Recognition with CLIP","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T16:41:35.636966Z"},"links":{"citing_paper":"/paper/2412.09895"},"observation_digest":"sha256:3efe6724261be757d777f3bf6283265540b02da1ea578c3d1851e398f6d178be","observation_id":"e4b7d01f-ae90-45de-903b-3630190e1f80","resolution":{"observed_at":"2026-08-11T16:41:36.453446Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:41:36.433730Z","title":"Sub-action relation triples for temporal text prompts [T]:","venue":null,"work_id":"2e3956fb-bd89-4db8-aca2-ab94e86abb30","year":null},"citing_paper":{"arxiv_id":"2412.09895","last_updated":"2025-02-09T12:42:37Z","snapshot_observed_at":"2026-08-16T09:54:06.241187Z","submitted_at":"2024-12-13T06:30:52Z","title":"Building a Multi-modal Spatiotemporal Expert for Zero-shot Action Recognition with CLIP","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T16:41:35.641426Z"},"links":{"citing_paper":"/paper/2412.09895"},"observation_digest":"sha256:e2caa12b8a663626da424fbb869b319474c2431f1cec36ca3eef1a71c9371963","observation_id":"72cbe206-ccde-4d35-9645-5921daf7cccf","resolution":{"observed_at":"2026-08-11T16:41:36.438626Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:41:36.419077Z","title":null,"venue":null,"work_id":"537846d9-7771-44a3-ad07-1a2722de1fb2","year":null},"citing_paper":{"arxiv_id":"2412.09895","last_updated":"2025-02-09T12:42:37Z","snapshot_observed_at":"2026-08-16T09:54:06.241187Z","submitted_at":"2024-12-13T06:30:52Z","title":"Building a Multi-modal Spatiotemporal Expert for Zero-shot Action Recognition with CLIP","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T16:41:35.645907Z"},"links":{"citing_paper":"/paper/2412.09895"},"observation_digest":"sha256:15b06c3dfa3e85e2d21a749045bcca511d578a297412241b588ba14cd541bb5b","observation_id":"c69e605d-6355-4977-a6d3-7ab9f20977a8","resolution":{"observed_at":"2026-08-11T16:41:36.423754Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:41:36.404092Z","title":null,"venue":null,"work_id":"4ad71e88-1ace-4f3a-9139-4d5add6b8a6a","year":null},"citing_paper":{"arxiv_id":"2412.09895","last_updated":"2025-02-09T12:42:37Z","snapshot_observed_at":"2026-08-16T09:54:06.241187Z","submitted_at":"2024-12-13T06:30:52Z","title":"Building a Multi-modal Spatiotemporal Expert for Zero-shot Action Recognition with CLIP","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T16:41:35.650859Z"},"links":{"citing_paper":"/paper/2412.09895"},"observation_digest":"sha256:f3470e6cdadeb3b49c53aaf789a215ab8c2882c3a027b111712466949561327b","observation_id":"ace0df3f-cfcd-4585-9a75-981c6360c71f","resolution":{"observed_at":"2026-08-11T16:41:36.408609Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:41:36.389798Z","title":null,"venue":null,"work_id":"7e747058-f52a-4f62-8cb1-a0665e152218","year":null},"citing_paper":{"arxiv_id":"2412.09895","last_updated":"2025-02-09T12:42:37Z","snapshot_observed_at":"2026-08-16T09:54:06.241187Z","submitted_at":"2024-12-13T06:30:52Z","title":"Building a Multi-modal Spatiotemporal Expert for Zero-shot Action Recognition with CLIP","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T16:41:35.655428Z"},"links":{"citing_paper":"/paper/2412.09895"},"observation_digest":"sha256:61f8a72dc6cdb13a51be3c116e8ba6f74723b2fd5c36ac8881445c0675316daa","observation_id":"63a5e824-3a9a-4b6e-bfef-1b7d990d91a9","resolution":{"observed_at":"2026-08-11T16:41:36.394323Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:41:36.374997Z","title":null,"venue":null,"work_id":"c784324a-ac0c-4c4e-bec5-9ce4868a1340","year":null},"citing_paper":{"arxiv_id":"2412.09895","last_updated":"2025-02-09T12:42:37Z","snapshot_observed_at":"2026-08-16T09:54:06.241187Z","submitted_at":"2024-12-13T06:30:52Z","title":"Building a Multi-modal Spatiotemporal Expert for Zero-shot Action Recognition with CLIP","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T16:41:35.659914Z"},"links":{"citing_paper":"/paper/2412.09895"},"observation_digest":"sha256:d69183693365d8b62bdae2b248668ae29543efe0c103ca0dd4c9c7b328facc59","observation_id":"054c740e-499b-4282-a1e6-3e626481ffe5","resolution":{"observed_at":"2026-08-11T16:41:36.379530Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:41:36.360969Z","title":null,"venue":null,"work_id":"4bd1a62e-bd59-4041-beea-2bf98e99ab62","year":null},"citing_paper":{"arxiv_id":"2412.09895","last_updated":"2025-02-09T12:42:37Z","snapshot_observed_at":"2026-08-16T09:54:06.241187Z","submitted_at":"2024-12-13T06:30:52Z","title":"Building a Multi-modal Spatiotemporal Expert for Zero-shot Action Recognition with CLIP","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T16:41:35.664511Z"},"links":{"citing_paper":"/paper/2412.09895"},"observation_digest":"sha256:fb32300c46195fe01667262a87e1e09d0f92198447b304bd7ddeb3395893e3d7","observation_id":"1be595b1-c095-4013-8b28-87e8dce80b7b","resolution":{"observed_at":"2026-08-11T16:41:36.365014Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:41:36.347292Z","title":"Clean and jerk","venue":null,"work_id":"9d73cd60-0006-40fc-9ab6-82ba32ded8a2","year":null},"citing_paper":{"arxiv_id":"2412.09895","last_updated":"2025-02-09T12:42:37Z","snapshot_observed_at":"2026-08-16T09:54:06.241187Z","submitted_at":"2024-12-13T06:30:52Z","title":"Building a Multi-modal Spatiotemporal Expert for Zero-shot Action Recognition with CLIP","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T16:41:35.668719Z"},"links":{"citing_paper":"/paper/2412.09895"},"observation_digest":"sha256:9b5ae9a4b6de546605248ab5cd7aec4fcc2f15caa4f571e3ca967c050b3641f1","observation_id":"e5002ea4-d56b-4fc6-8726-2f32aae58328","resolution":{"observed_at":"2026-08-11T16:41:36.351397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:41:36.332216Z","title":null,"venue":null,"work_id":"c7aa4027-1818-43e7-85b0-5320dea7d7da","year":null},"citing_paper":{"arxiv_id":"2412.09895","last_updated":"2025-02-09T12:42:37Z","snapshot_observed_at":"2026-08-16T09:54:06.241187Z","submitted_at":"2024-12-13T06:30:52Z","title":"Building a Multi-modal Spatiotemporal Expert for Zero-shot Action Recognition with CLIP","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T16:41:35.673142Z"},"links":{"citing_paper":"/paper/2412.09895"},"observation_digest":"sha256:1ca9ea180ab5c795b681ce11cbd3ea279614ad03658ab55c02442425817f26c1","observation_id":"92631da5-4954-48f6-ac02-b668ce0ea1e9","resolution":{"observed_at":"2026-08-11T16:41:36.337236Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:41:36.317887Z","title":null,"venue":null,"work_id":"b2e9eea4-6794-443d-96e1-8de4c4b879b7","year":null},"citing_paper":{"arxiv_id":"2412.09895","last_updated":"2025-02-09T12:42:37Z","snapshot_observed_at":"2026-08-16T09:54:06.241187Z","submitted_at":"2024-12-13T06:30:52Z","title":"Building a Multi-modal Spatiotemporal Expert for Zero-shot Action Recognition with CLIP","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T16:41:35.677555Z"},"links":{"citing_paper":"/paper/2412.09895"},"observation_digest":"sha256:aa4702a369de8e7865fe6da47d5bb781c6e4f2aa8a6f5eece6c4166897610a15","observation_id":"2b06b85c-74b6-4174-90fb-c06b0342bb72","resolution":{"observed_at":"2026-08-11T16:41:36.322517Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:41:36.303384Z","title":null,"venue":null,"work_id":"d88d9062-7790-4aee-9275-9b254449b85d","year":null},"citing_paper":{"arxiv_id":"2412.09895","last_updated":"2025-02-09T12:42:37Z","snapshot_observed_at":"2026-08-16T09:54:06.241187Z","submitted_at":"2024-12-13T06:30:52Z","title":"Building a Multi-modal Spatiotemporal Expert for Zero-shot Action Recognition with CLIP","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T16:41:35.682303Z"},"links":{"citing_paper":"/paper/2412.09895"},"observation_digest":"sha256:b3d2af7fee0ce66e4e3c324df701cfa3d5ac261ac98167f7bbd40178622e2323","observation_id":"76a85673-baba-4a35-ae23-0d898b89b1ed","resolution":{"observed_at":"2026-08-11T16:41:36.307906Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:41:36.288067Z","title":null,"venue":null,"work_id":"88b2c988-a7b0-4236-a3db-eebc8458098c","year":null},"citing_paper":{"arxiv_id":"2412.09895","last_updated":"2025-02-09T12:42:37Z","snapshot_observed_at":"2026-08-16T09:54:06.241187Z","submitted_at":"2024-12-13T06:30:52Z","title":"Building a Multi-modal Spatiotemporal Expert for Zero-shot Action Recognition with CLIP","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T16:41:35.687056Z"},"links":{"citing_paper":"/paper/2412.09895"},"observation_digest":"sha256:7fc8cdeaf768ef0a52b37bbc73af41a9c5b7d286bebdfbaa48edc89b016f890b","observation_id":"d26f89f6-a4c9-4616-820a-bb6ed704e2b6","resolution":{"observed_at":"2026-08-11T16:41:36.292915Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:41:36.274074Z","title":null,"venue":null,"work_id":"c0180a1c-f161-43c7-9458-bbeed3aff3e2","year":null},"citing_paper":{"arxiv_id":"2412.09895","last_updated":"2025-02-09T12:42:37Z","snapshot_observed_at":"2026-08-16T09:54:06.241187Z","submitted_at":"2024-12-13T06:30:52Z","title":"Building a Multi-modal Spatiotemporal Expert for Zero-shot Action Recognition with CLIP","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T16:41:35.692402Z"},"links":{"citing_paper":"/paper/2412.09895"},"observation_digest":"sha256:6ecfa51c74047c483cd3ac2d4898b6a12f55005c7dbac1c24cb0c0fb3c361e13","observation_id":"9bbbd63d-cf7b-4899-92c6-cc284b8693bb","resolution":{"observed_at":"2026-08-11T16:41:36.278314Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:41:36.260032Z","title":null,"venue":null,"work_id":"7aeff0ca-8ca6-460f-b7ef-a369091b689c","year":null},"citing_paper":{"arxiv_id":"2412.09895","last_updated":"2025-02-09T12:42:37Z","snapshot_observed_at":"2026-08-16T09:54:06.241187Z","submitted_at":"2024-12-13T06:30:52Z","title":"Building a Multi-modal Spatiotemporal Expert for Zero-shot Action Recognition with CLIP","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T16:41:35.696907Z"},"links":{"citing_paper":"/paper/2412.09895"},"observation_digest":"sha256:309105065a8db3feead5be363a48b7a283f311f148171466c0fd12146c77955d","observation_id":"97282e13-6b49-4ac9-890d-c36f39908512","resolution":{"observed_at":"2026-08-11T16:41:36.264381Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:41:36.245452Z","title":null,"venue":null,"work_id":"fa89c723-f192-42a4-9d52-ad10f4df61f4","year":null},"citing_paper":{"arxiv_id":"2412.09895","last_updated":"2025-02-09T12:42:37Z","snapshot_observed_at":"2026-08-16T09:54:06.241187Z","submitted_at":"2024-12-13T06:30:52Z","title":"Building a Multi-modal Spatiotemporal Expert for Zero-shot Action Recognition with CLIP","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-11T16:41:35.702217Z"},"links":{"citing_paper":"/paper/2412.09895"},"observation_digest":"sha256:79de22157df9b6e68593896d90a644c36aea6231199914835fabd32b5a11dbaa","observation_id":"aa8e3779-b8cb-4e43-9620-c1c47bef0f37","resolution":{"observed_at":"2026-08-11T16:41:36.249948Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:41:36.231680Z","title":null,"venue":null,"work_id":"1de2cb72-dd88-4d07-834e-04d7f7f124c4","year":null},"citing_paper":{"arxiv_id":"2412.09895","last_updated":"2025-02-09T12:42:37Z","snapshot_observed_at":"2026-08-16T09:54:06.241187Z","submitted_at":"2024-12-13T06:30:52Z","title":"Building a Multi-modal Spatiotemporal Expert for Zero-shot Action Recognition with CLIP","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-11T16:41:35.706824Z"},"links":{"citing_paper":"/paper/2412.09895"},"observation_digest":"sha256:f59ca8160e61e66a9d7479c20613b41819d5e43944a926808591b93e60c278f4","observation_id":"c19b2ae5-1b73-46c3-b185-870babd944b3","resolution":{"observed_at":"2026-08-11T16:41:36.236238Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:41:36.217120Z","title":"Sub-action list:","venue":null,"work_id":"5efed472-0d1d-4323-9d82-704067153fa9","year":null},"citing_paper":{"arxiv_id":"2412.09895","last_updated":"2025-02-09T12:42:37Z","snapshot_observed_at":"2026-08-16T09:54:06.241187Z","submitted_at":"2024-12-13T06:30:52Z","title":"Building a Multi-modal Spatiotemporal Expert for Zero-shot Action Recognition with CLIP","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-11T16:41:35.711922Z"},"links":{"citing_paper":"/paper/2412.09895"},"observation_digest":"sha256:7ead921b79f67c1d918bf0994c06f59965caeb200cb8ee58a093a53caae9cb94","observation_id":"6bccac1b-34ee-4e92-bd23-0208af35b7d6","resolution":{"observed_at":"2026-08-11T16:41:36.221966Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:41:36.201943Z","title":null,"venue":null,"work_id":"5467b28d-50b9-4dbe-9ef3-937e3be66dc8","year":null},"citing_paper":{"arxiv_id":"2412.09895","last_updated":"2025-02-09T12:42:37Z","snapshot_observed_at":"2026-08-16T09:54:06.241187Z","submitted_at":"2024-12-13T06:30:52Z","title":"Building a Multi-modal Spatiotemporal Expert for Zero-shot Action Recognition with CLIP","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-11T16:41:35.716236Z"},"links":{"citing_paper":"/paper/2412.09895"},"observation_digest":"sha256:35d4c944a8f2b5b56b3d29b21ac69b2fc3852fe7a49dc80c393aa58a906373cf","observation_id":"2ac87c45-565a-470e-bc54-2ec053dfc9bf","resolution":{"observed_at":"2026-08-11T16:41:36.207027Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:41:36.186904Z","title":null,"venue":null,"work_id":"5f6ac8ff-38c4-4ba0-b073-e206ea29ca77","year":null},"citing_paper":{"arxiv_id":"2412.09895","last_updated":"2025-02-09T12:42:37Z","snapshot_observed_at":"2026-08-16T09:54:06.241187Z","submitted_at":"2024-12-13T06:30:52Z","title":"Building a Multi-modal Spatiotemporal Expert for Zero-shot Action Recognition with CLIP","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-11T16:41:35.720612Z"},"links":{"citing_paper":"/paper/2412.09895"},"observation_digest":"sha256:151a1ca0d18d0b1de75a09ec52a4767cafb8d27dcfd94bcc39ffa4062237ee50","observation_id":"9dbecae1-f80c-41ec-8178-5857411271f3","resolution":{"observed_at":"2026-08-11T16:41:36.191558Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:41:36.173223Z","title":null,"venue":null,"work_id":"b51b1dbe-00c8-4aa3-955a-64b9c523c0f2","year":null},"citing_paper":{"arxiv_id":"2412.09895","last_updated":"2025-02-09T12:42:37Z","snapshot_observed_at":"2026-08-16T09:54:06.241187Z","submitted_at":"2024-12-13T06:30:52Z","title":"Building a Multi-modal Spatiotemporal Expert for Zero-shot Action Recognition with CLIP","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-11T16:41:35.724883Z"},"links":{"citing_paper":"/paper/2412.09895"},"observation_digest":"sha256:fa059ed1f503c276e7fa97687d6ed1a5131abab8a148f2832871840b43e34eec","observation_id":"88f8cd3e-9d23-44be-b1b4-61b21f20c193","resolution":{"observed_at":"2026-08-11T16:41:36.177192Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:41:36.159591Z","title":null,"venue":null,"work_id":"9d166cdc-aafd-43ce-8096-04eff2829f07","year":null},"citing_paper":{"arxiv_id":"2412.09895","last_updated":"2025-02-09T12:42:37Z","snapshot_observed_at":"2026-08-16T09:54:06.241187Z","submitted_at":"2024-12-13T06:30:52Z","title":"Building a Multi-modal Spatiotemporal Expert for Zero-shot Action Recognition with CLIP","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-11T16:41:35.729353Z"},"links":{"citing_paper":"/paper/2412.09895"},"observation_digest":"sha256:229d3506c838d3d4986c112339277f1fe7b2899728dca300f76cf4959007a439","observation_id":"994ac44b-c81e-47e8-8238-0f61e20ab453","resolution":{"observed_at":"2026-08-11T16:41:36.164074Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:41:36.146104Z","title":null,"venue":null,"work_id":"a4070eef-316a-4e72-950f-ec4580dd8a48","year":null},"citing_paper":{"arxiv_id":"2412.09895","last_updated":"2025-02-09T12:42:37Z","snapshot_observed_at":"2026-08-16T09:54:06.241187Z","submitted_at":"2024-12-13T06:30:52Z","title":"Building a Multi-modal Spatiotemporal Expert for Zero-shot Action Recognition with CLIP","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-11T16:41:35.734000Z"},"links":{"citing_paper":"/paper/2412.09895"},"observation_digest":"sha256:3ded377e9c9d1a703e59978e0d3d336fd65564579bdcf089bd64b86b09b52e08","observation_id":"5383e4d2-5546-4226-bd41-b6efc58cadb6","resolution":{"observed_at":"2026-08-11T16:41:36.150134Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:41:36.131848Z","title":null,"venue":null,"work_id":"6a5dc1a2-aa19-4473-b023-cc50cc44b7c8","year":null},"citing_paper":{"arxiv_id":"2412.09895","last_updated":"2025-02-09T12:42:37Z","snapshot_observed_at":"2026-08-16T09:54:06.241187Z","submitted_at":"2024-12-13T06:30:52Z","title":"Building a Multi-modal Spatiotemporal Expert for Zero-shot Action Recognition with CLIP","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-11T16:41:35.740225Z"},"links":{"citing_paper":"/paper/2412.09895"},"observation_digest":"sha256:6a410e62e610045e08a2bdc7b38bd91a436f8f519834982b8e7dff034df45737","observation_id":"56de4781-f5b4-4ce5-9357-2f6d7cd7ac92","resolution":{"observed_at":"2026-08-11T16:41:36.136455Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:41:36.116370Z","title":null,"venue":null,"work_id":"cc0cced8-5dcd-4d1d-b755-0d2cff6c027c","year":null},"citing_paper":{"arxiv_id":"2412.09895","last_updated":"2025-02-09T12:42:37Z","snapshot_observed_at":"2026-08-16T09:54:06.241187Z","submitted_at":"2024-12-13T06:30:52Z","title":"Building a Multi-modal Spatiotemporal Expert for Zero-shot Action Recognition with CLIP","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-11T16:41:35.744329Z"},"links":{"citing_paper":"/paper/2412.09895"},"observation_digest":"sha256:b893380f03d1811648bc9ba1f003b53b24061b3471afe6912a0ee43730dc4246","observation_id":"a976d8ea-9993-4140-93ab-85344d7a0622","resolution":{"observed_at":"2026-08-11T16:41:36.121130Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:41:36.101308Z","title":null,"venue":null,"work_id":"585b6d38-c7ab-4b92-aace-0560de9d0641","year":null},"citing_paper":{"arxiv_id":"2412.09895","last_updated":"2025-02-09T12:42:37Z","snapshot_observed_at":"2026-08-16T09:54:06.241187Z","submitted_at":"2024-12-13T06:30:52Z","title":"Building a Multi-modal Spatiotemporal Expert for Zero-shot Action Recognition with CLIP","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-11T16:41:35.748776Z"},"links":{"citing_paper":"/paper/2412.09895"},"observation_digest":"sha256:f614926b5b038c65fa3d0a29d6df89f944c34fedb057326fbc9253d5730cce89","observation_id":"8ff0ee90-0967-4aa0-a5bb-ad98b5030455","resolution":{"observed_at":"2026-08-11T16:41:36.106517Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:41:36.086037Z","title":null,"venue":null,"work_id":"d51f0423-6560-4d25-baa4-ec875e9159e1","year":null},"citing_paper":{"arxiv_id":"2412.09895","last_updated":"2025-02-09T12:42:37Z","snapshot_observed_at":"2026-08-16T09:54:06.241187Z","submitted_at":"2024-12-13T06:30:52Z","title":"Building a Multi-modal Spatiotemporal Expert for Zero-shot Action Recognition with CLIP","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-11T16:41:35.753751Z"},"links":{"citing_paper":"/paper/2412.09895"},"observation_digest":"sha256:57429b8587353a88eed7511784769331c628c470aabaa04009b4ea693a5318b9","observation_id":"600e6fb0-18a8-43d1-a4f0-ff57bbd78436","resolution":{"observed_at":"2026-08-11T16:41:36.090831Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:41:36.070379Z","title":null,"venue":null,"work_id":"be10ab14-abb1-421e-905e-ba6296c2f8c0","year":null},"citing_paper":{"arxiv_id":"2412.09895","last_updated":"2025-02-09T12:42:37Z","snapshot_observed_at":"2026-08-16T09:54:06.241187Z","submitted_at":"2024-12-13T06:30:52Z","title":"Building a Multi-modal Spatiotemporal Expert for Zero-shot Action Recognition with CLIP","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-11T16:41:35.757928Z"},"links":{"citing_paper":"/paper/2412.09895"},"observation_digest":"sha256:b8592c6fd4edc4a9821196e734ddcab5261cff3aff13f311e73e9f41129995f1","observation_id":"1947000e-f008-4154-9278-f7db4966acf2","resolution":{"observed_at":"2026-08-11T16:41:36.074870Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:41:36.054015Z","title":null,"venue":null,"work_id":"10943012-8cea-4b67-baf2-07395de2bfe5","year":null},"citing_paper":{"arxiv_id":"2412.09895","last_updated":"2025-02-09T12:42:37Z","snapshot_observed_at":"2026-08-16T09:54:06.241187Z","submitted_at":"2024-12-13T06:30:52Z","title":"Building a Multi-modal Spatiotemporal Expert for Zero-shot Action Recognition with CLIP","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-11T16:41:35.761853Z"},"links":{"citing_paper":"/paper/2412.09895"},"observation_digest":"sha256:754ef67822a0e51766ae1590e5f47f6f1c3f656f283705a92d92b594d68c8c1e","observation_id":"d4832963-bdfc-4ba9-a2ca-c9703a2967af","resolution":{"observed_at":"2026-08-11T16:41:36.058938Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:41:36.037798Z","title":null,"venue":null,"work_id":"221fd0f9-3109-4000-9d1c-b16ffd805ad9","year":null},"citing_paper":{"arxiv_id":"2412.09895","last_updated":"2025-02-09T12:42:37Z","snapshot_observed_at":"2026-08-16T09:54:06.241187Z","submitted_at":"2024-12-13T06:30:52Z","title":"Building a Multi-modal Spatiotemporal Expert for Zero-shot Action Recognition with CLIP","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-11T16:41:35.765894Z"},"links":{"citing_paper":"/paper/2412.09895"},"observation_digest":"sha256:8b7df9fc6cd0432991d06575c4acf7d176e3319d2d79a7fae02d88e78c8c4716","observation_id":"0b614176-2cc3-4a8a-86d9-09896f602c06","resolution":{"observed_at":"2026-08-11T16:41:36.043397Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:41:36.021401Z","title":"Sub-action relation triples for temporal text prompts [T]:","venue":null,"work_id":"697a1de8-4e58-44ef-b655-7e3ad843497b","year":null},"citing_paper":{"arxiv_id":"2412.09895","last_updated":"2025-02-09T12:42:37Z","snapshot_observed_at":"2026-08-16T09:54:06.241187Z","submitted_at":"2024-12-13T06:30:52Z","title":"Building a Multi-modal Spatiotemporal Expert for Zero-shot Action Recognition with CLIP","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-11T16:41:35.769936Z"},"links":{"citing_paper":"/paper/2412.09895"},"observation_digest":"sha256:7e5893807b20eb7bb391890411cc66604b710948493f9298e655d582f0a94f9c","observation_id":"0f47195c-4b35-4bdf-b4be-2eeb045cc8ea","resolution":{"observed_at":"2026-08-11T16:41:36.027022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:41:36.005559Z","title":null,"venue":null,"work_id":"a14ca647-d2e7-4c17-934b-c23512aec1fd","year":null},"citing_paper":{"arxiv_id":"2412.09895","last_updated":"2025-02-09T12:42:37Z","snapshot_observed_at":"2026-08-16T09:54:06.241187Z","submitted_at":"2024-12-13T06:30:52Z","title":"Building a Multi-modal Spatiotemporal Expert for Zero-shot Action Recognition with CLIP","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-11T16:41:35.774046Z"},"links":{"citing_paper":"/paper/2412.09895"},"observation_digest":"sha256:3775c4bcd0021cae6fc3361d470d8b53d8e99bc12bb488f9e7f4d34d74234b8b","observation_id":"62da1bdf-4bef-463b-9509-9bc11828d69d","resolution":{"observed_at":"2026-08-11T16:41:36.009686Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:41:35.990871Z","title":null,"venue":null,"work_id":"382fc50d-cf73-40f4-823d-710eae8e94d4","year":null},"citing_paper":{"arxiv_id":"2412.09895","last_updated":"2025-02-09T12:42:37Z","snapshot_observed_at":"2026-08-16T09:54:06.241187Z","submitted_at":"2024-12-13T06:30:52Z","title":"Building a Multi-modal Spatiotemporal Expert for Zero-shot Action Recognition with CLIP","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-11T16:41:35.777983Z"},"links":{"citing_paper":"/paper/2412.09895"},"observation_digest":"sha256:b90fe443cf52e1c5b523e1399358f93d83cf9e9d842ceb98fa9066e10b05b484","observation_id":"918abf29-90e5-486d-a3d9-c4483d0ac1c6","resolution":{"observed_at":"2026-08-11T16:41:35.994903Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:41:35.976343Z","title":null,"venue":null,"work_id":"a7bc56a5-3d5b-4c4b-a321-f94689940a07","year":null},"citing_paper":{"arxiv_id":"2412.09895","last_updated":"2025-02-09T12:42:37Z","snapshot_observed_at":"2026-08-16T09:54:06.241187Z","submitted_at":"2024-12-13T06:30:52Z","title":"Building a Multi-modal Spatiotemporal Expert for Zero-shot Action Recognition with CLIP","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-11T16:41:35.782355Z"},"links":{"citing_paper":"/paper/2412.09895"},"observation_digest":"sha256:2e9f6c7e3ec733d0d4f3f690e2cce89ccb521bb53402ff8555260d48f2a95ed6","observation_id":"16f78237-19b5-48a5-8385-a8228b15cbf3","resolution":{"observed_at":"2026-08-11T16:41:35.980916Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:41:35.961244Z","title":"B Details of Datasets and Evaluation Protocols Datasets We conduct the training process on Kinetics-400 (Kay et al","venue":null,"work_id":"536fece0-5d79-4cf7-b1fc-96ea19b9bbeb","year":null},"citing_paper":{"arxiv_id":"2412.09895","last_updated":"2025-02-09T12:42:37Z","snapshot_observed_at":"2026-08-16T09:54:06.241187Z","submitted_at":"2024-12-13T06:30:52Z","title":"Building a Multi-modal Spatiotemporal Expert for Zero-shot Action Recognition with CLIP","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-11T16:41:35.786825Z"},"links":{"citing_paper":"/paper/2412.09895"},"observation_digest":"sha256:372e9a8031a537d99106a4fa55b4152785f0202be48bc411f800bcffd93391b6","observation_id":"2927d39a-e0fd-471f-83c9-e617c65621fd","resolution":{"observed_at":"2026-08-11T16:41:35.965754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:41:35.944322Z","title":"jump”, “kiss","venue":null,"work_id":"97d3af12-73de-4563-9cd7-c1fbc122d57b","year":2012},"citing_paper":{"arxiv_id":"2412.09895","last_updated":"2025-02-09T12:42:37Z","snapshot_observed_at":"2026-08-16T09:54:06.241187Z","submitted_at":"2024-12-13T06:30:52Z","title":"Building a Multi-modal Spatiotemporal Expert for Zero-shot Action Recognition with CLIP","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-11T16:41:35.791432Z"},"links":{"citing_paper":"/paper/2412.09895"},"observation_digest":"sha256:e45522ad4a30fd2806e497cd33b5be9e4ffbe243f6df4112e8a6009b5ef0d068","observation_id":"20acf465-aae6-4172-8886-cee4e5fbbbc9","resolution":{"observed_at":"2026-08-11T16:41:35.950023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:41:35.925748Z","title":"This can be explained by the fact that larger temporal scales result in sparser interactions for boundary frames during channel mixing","venue":null,"work_id":"57230f0c-17b2-40d1-83e5-db90a43c352d","year":null},"citing_paper":{"arxiv_id":"2412.09895","last_updated":"2025-02-09T12:42:37Z","snapshot_observed_at":"2026-08-16T09:54:06.241187Z","submitted_at":"2024-12-13T06:30:52Z","title":"Building a Multi-modal Spatiotemporal Expert for Zero-shot Action Recognition with CLIP","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-11T16:41:35.796320Z"},"links":{"citing_paper":"/paper/2412.09895"},"observation_digest":"sha256:5d493f270a7333c5ff0d1fabcf07f671e7614c80226905728cbdda9b4289155d","observation_id":"3af675e4-82c9-4254-8a9b-b2d059eaab1d","resolution":{"observed_at":"2026-08-11T16:41:35.932844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:41:37.036616Z","title":"In 2011 International conference on computer vision, 2556–","venue":null,"work_id":"85d13a4d-0e80-4661-a902-25b3bb4ec499","year":2011},"citing_paper":{"arxiv_id":"2412.09895","last_updated":"2025-02-09T12:42:37Z","snapshot_observed_at":"2026-08-16T09:54:06.241187Z","submitted_at":"2024-12-13T06:30:52Z","title":"Building a Multi-modal Spatiotemporal Expert for Zero-shot Action Recognition with CLIP","version":2},"reference_index":2011,"source":"pdf_text","source_observed_at":"2026-08-11T16:41:35.435691Z"},"links":{"citing_paper":"/paper/2412.09895"},"observation_digest":"sha256:8605b517bb97ac8e60c814559c538d6c76bf63f87c7d1546db63d9df4580f3b8","observation_id":"8cae5fb0-5c0b-4c5a-8374-82e7c0d27291","resolution":{"observed_at":"2026-08-11T16:41:37.042145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.06950","last_updated":"2017-05-19T12:07:01Z","snapshot_observed_at":"2026-08-15T11:35:18.832923Z","submitted_at":"2017-05-19T12:07:01Z","title":"The Kinetics Human Action Video Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.06950","snapshot_observed_at":"2026-08-11T16:41:35.431226Z","title":"arXiv preprint arXiv:1705.06950","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.09895","last_updated":"2025-02-09T12:42:37Z","snapshot_observed_at":"2026-08-16T09:54:06.241187Z","submitted_at":"2024-12-13T06:30:52Z","title":"Building a Multi-modal Spatiotemporal Expert for Zero-shot Action Recognition with CLIP","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-11T16:41:35.431226Z"},"links":{"cited_paper":"/paper/1705.06950","citing_paper":"/paper/2412.09895"},"observation_digest":"sha256:339d24e7fdfd354019a1d9c9b885de4249e259aa33eb9002ed5ede0f84ed15a7","observation_id":"3649627a-c22f-4a9b-9bf1-6911b23e172c","resolution":{"observed_at":"2026-08-11T16:41:35.431226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:41:35.420099Z","title":"InProceedings of the IEEE/CVF Con- ference on Computer Vision and Pattern Recognition, 4613–4623","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.09895","last_updated":"2025-02-09T12:42:37Z","snapshot_observed_at":"2026-08-16T09:54:06.241187Z","submitted_at":"2024-12-13T06:30:52Z","title":"Building a Multi-modal Spatiotemporal Expert for Zero-shot Action Recognition with CLIP","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-11T16:41:35.420099Z"},"links":{"citing_paper":"/paper/2412.09895"},"observation_digest":"sha256:b614ca3d4fb9a960241a28bc756225b4db7b197e733a17f53eec6aa641fc32f3","observation_id":"f095a1d2-2ee5-49c7-926c-d9e245a1484c","resolution":{"observed_at":"2026-08-11T16:41:35.420099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T03:30:12.735656Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-11T16:41:35.414650Z","title":"arXiv preprint arXiv:2303.08774","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09895","last_updated":"2025-02-09T12:42:37Z","snapshot_observed_at":"2026-08-16T09:54:06.241187Z","submitted_at":"2024-12-13T06:30:52Z","title":"Building a Multi-modal Spatiotemporal Expert for Zero-shot Action Recognition with CLIP","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-11T16:41:35.414650Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2412.09895"},"observation_digest":"sha256:65d91cb61e59e373146559305c116f750957ad42ed269ab1248e6f150f3a58df","observation_id":"37347fda-c884-4304-88e1-dc77d1cbd936","resolution":{"observed_at":"2026-08-11T16:41:35.414650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:41:37.019401Z","title":"Lee, D.; Lee, J.; and Choi, J","venue":null,"work_id":"390e9203-c26a-4105-9fa7-008d7bb292ce","year":2024},"citing_paper":{"arxiv_id":"2412.09895","last_updated":"2025-02-09T12:42:37Z","snapshot_observed_at":"2026-08-16T09:54:06.241187Z","submitted_at":"2024-12-13T06:30:52Z","title":"Building a Multi-modal Spatiotemporal Expert for Zero-shot Action Recognition with CLIP","version":2},"reference_index":2563,"source":"pdf_text","source_observed_at":"2026-08-11T16:41:35.439885Z"},"links":{"citing_paper":"/paper/2412.09895"},"observation_digest":"sha256:c80203bc38445ae38bd9346d652dadc1dce3db7efd62f521a23efa749908fa1a","observation_id":"55190b9c-e992-4a7c-9057-f09fae1fba50","resolution":{"observed_at":"2026-08-11T16:41:37.025080Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.09895","last_updated":"2025-02-09T12:42:37Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T09:54:06.241187Z","submitted_at":"2024-12-13T06:30:52Z","title":"Building a Multi-modal Spatiotemporal Expert for Zero-shot Action Recognition with CLIP"},"reference_resolution":{"displayed":81,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":5,"unresolved":62,"verified_exact":0,"verified_fuzzy":14},"total_outbound_references":81},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 81 of 81 outbound references and 1 inbound Pith citation observation for arXiv:2412.09895."}