{"as_of":"2026-08-09T16:36:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4bf0bc4268547ee07797f6917b313ba02d59c591f3378c1ae8c4e24fe65a6da7","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T04:37:09.891480Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2502.03549/citation-record","integrity":"/paper/2502.03549/integrity","json":"/paper/2502.03549/citation-record.json","paper":"/paper/2502.03549"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:37:10.572182Z","title":"The low-rank bottleneck is vital, because it may lead to that many rows of the attention map are seriously homogenized","venue":null,"work_id":"41a417eb-c493-4699-a38b-ea1078cd17bc","year":2017},"citing_paper":{"arxiv_id":"2502.03549","last_updated":"2025-02-10T03:28:56Z","snapshot_observed_at":"2026-08-09T04:29:54.346394Z","submitted_at":"2025-02-05T19:03:58Z","title":"Kronecker Mask and Interpretive Prompts are Language-Action Video Learners","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-09T04:37:09.867432Z"},"links":{"citing_paper":"/paper/2502.03549"},"observation_digest":"sha256:216250ef67442aead93dad3b4200f4b9ec6283e3ab25dd6d641e0258cd2f929e","observation_id":"e39f4487-2931-45ab-926b-e28f2997a924","resolution":{"observed_at":"2026-08-09T04:37:10.576953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:37:10.740139Z","title":"Tom Brown, Benjamin Mann, Nick Ryder, Melanie Subbiah, Jared D Kaplan, Prafulla Dhariwal, Arvind Neelakantan, Pranav Shyam, Girish Sastry, Amanda Askell, et al","venue":null,"work_id":"719a214f-9424-4981-8f9e-81cf6cb0616d","year":1901},"citing_paper":{"arxiv_id":"2502.03549","last_updated":"2025-02-10T03:28:56Z","snapshot_observed_at":"2026-08-09T04:29:54.346394Z","submitted_at":"2025-02-05T19:03:58Z","title":"Kronecker Mask and Interpretive Prompts are Language-Action Video Learners","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-09T04:37:09.602158Z"},"links":{"citing_paper":"/paper/2502.03549"},"observation_digest":"sha256:ed3bcb4c064914a2e245f5708b4e9f9692cfd92d6b967f55215cf19851cef457","observation_id":"30e31daa-6937-46b5-b0b1-25fcb9582777","resolution":{"observed_at":"2026-08-09T04:37:10.744593Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:37:10.472615Z","title":"24 Published as a conference paper at ICLR 2025 5","venue":null,"work_id":"680b85a6-3b58-4825-87f6-de95d74cdf48","year":2025},"citing_paper":{"arxiv_id":"2502.03549","last_updated":"2025-02-10T03:28:56Z","snapshot_observed_at":"2026-08-09T04:29:54.346394Z","submitted_at":"2025-02-05T19:03:58Z","title":"Kronecker Mask and Interpretive Prompts are Language-Action Video Learners","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-09T04:37:09.882418Z"},"links":{"citing_paper":"/paper/2502.03549"},"observation_digest":"sha256:0ba457faed467691c6cb121e1f1dbcebd8d9f3c89adea6ee64c914cf92a89004","observation_id":"1e078e8e-1313-4eae-abd3-59f0b552184b","resolution":{"observed_at":"2026-08-09T04:37:10.534172Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:37:10.314701Z","title":"Question to ChatGPT: 1 Cutting in the kitchen","venue":null,"work_id":"afaa3913-f3a5-4730-935c-e047ba2ff8bc","year":2024},"citing_paper":{"arxiv_id":"2502.03549","last_updated":"2025-02-10T03:28:56Z","snapshot_observed_at":"2026-08-09T04:29:54.346394Z","submitted_at":"2025-02-05T19:03:58Z","title":"Kronecker Mask and Interpretive Prompts are Language-Action Video Learners","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-09T04:37:09.886807Z"},"links":{"citing_paper":"/paper/2502.03549"},"observation_digest":"sha256:076107c47eff3d9be8fc6710d77a9642f7cd4019d0e8dbf376fed4f7695d9cfe","observation_id":"29884104-94be-499e-8b19-d477871bdfb4","resolution":{"observed_at":"2026-08-09T04:37:10.385360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.13921","last_updated":"2022-05-12T01:27:40Z","snapshot_observed_at":"2026-08-08T10:08:57.896975Z","submitted_at":"2021-04-28T17:58:57Z","title":"Open-vocabulary Object Detection via Vision and Language Knowledge Distillation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.13921","snapshot_observed_at":"2026-08-09T04:37:09.633834Z","title":"Open-vocabulary object detection via vision and language knowledge distillation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.03549","last_updated":"2025-02-10T03:28:56Z","snapshot_observed_at":"2026-08-09T04:29:54.346394Z","submitted_at":"2025-02-05T19:03:58Z","title":"Kronecker Mask and Interpretive Prompts are Language-Action Video Learners","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-09T04:37:09.633834Z"},"links":{"cited_paper":"/paper/2104.13921","citing_paper":"/paper/2502.03549"},"observation_digest":"sha256:dd8774a5e67b94c59dc915d7316a2f5006ac00ac495388fe8fc8a54e30a65eca","observation_id":"cee28ea6-30d4-404f-8dd0-d0beb9fd9a48","resolution":{"observed_at":"2026-08-09T04:37:09.633834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:37:10.702663Z","title":"Ssan: Separable self-attention network for video representation learning","venue":null,"work_id":"35e195ec-f017-4b75-8539-9cee70c43d54","year":2025},"citing_paper":{"arxiv_id":"2502.03549","last_updated":"2025-02-10T03:28:56Z","snapshot_observed_at":"2026-08-09T04:29:54.346394Z","submitted_at":"2025-02-05T19:03:58Z","title":"Kronecker Mask and Interpretive Prompts are Language-Action Video Learners","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-09T04:37:09.639269Z"},"links":{"citing_paper":"/paper/2502.03549"},"observation_digest":"sha256:b3ef54a913defa5b2c5588c9f5c59bc2274f5b2a5b49c1fa267415bd66e6927a","observation_id":"bf103ac1-24f3-4d49-a753-fbcf689133ba","resolution":{"observed_at":"2026-08-09T04:37:10.707354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09141","last_updated":"2021-06-16T21:36:36Z","snapshot_observed_at":"2026-08-09T09:32:55.082368Z","submitted_at":"2021-06-16T21:36:36Z","title":"Probing Image-Language Transformers for Verb Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09141","snapshot_observed_at":"2026-08-09T04:37:09.644104Z","title":"Probing image-language transformers for verb under- standing","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.03549","last_updated":"2025-02-10T03:28:56Z","snapshot_observed_at":"2026-08-09T04:29:54.346394Z","submitted_at":"2025-02-05T19:03:58Z","title":"Kronecker Mask and Interpretive Prompts are Language-Action Video Learners","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-09T04:37:09.644104Z"},"links":{"cited_paper":"/paper/2106.09141","citing_paper":"/paper/2502.03549"},"observation_digest":"sha256:66d6cfd70f062029997a7d55da3ef020968e501e1adbf748c0a36cf2996791c5","observation_id":"bf8c7b70-2d00-44d5-886a-5f08865214a8","resolution":{"observed_at":"2026-08-09T04:37:09.644104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:37:10.689022Z","title":"Frozen clip models are efficient video learners","venue":null,"work_id":"6d00a694-ab68-4640-9a5b-f0ca5d329ec1","year":2025},"citing_paper":{"arxiv_id":"2502.03549","last_updated":"2025-02-10T03:28:56Z","snapshot_observed_at":"2026-08-09T04:29:54.346394Z","submitted_at":"2025-02-05T19:03:58Z","title":"Kronecker Mask and Interpretive Prompts are Language-Action Video Learners","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-09T04:37:09.659340Z"},"links":{"citing_paper":"/paper/2502.03549"},"observation_digest":"sha256:6c1a5c41cdca9deeaee28e368f0764bad1b33c94f51e8b769e29ee6b45702ec1","observation_id":"d8c7360e-8155-4571-994f-905f8d27a155","resolution":{"observed_at":"2026-08-09T04:37:10.693708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:37:10.674004Z","title":"Fine-tuned clip models are efficient video learners","venue":null,"work_id":"0dadda7d-971a-4549-a137-60443cb277e2","year":2025},"citing_paper":{"arxiv_id":"2502.03549","last_updated":"2025-02-10T03:28:56Z","snapshot_observed_at":"2026-08-09T04:29:54.346394Z","submitted_at":"2025-02-05T19:03:58Z","title":"Kronecker Mask and Interpretive Prompts are Language-Action Video Learners","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-09T04:37:09.688091Z"},"links":{"citing_paper":"/paper/2502.03549"},"observation_digest":"sha256:9ebac7eb73af294eb5407027868edc7595049d43c37dea2cd71e3678a72cd713","observation_id":"8d4a05d5-0734-4cce-81a5-001d1e0bbe43","resolution":{"observed_at":"2026-08-09T04:37:10.679530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1212.0402","last_updated":"2012-12-03T14:45:31Z","snapshot_observed_at":"2026-07-06T03:01:10.229407Z","submitted_at":"2012-12-03T14:45:31Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1212.0402","snapshot_observed_at":"2026-08-09T04:37:09.706572Z","title":"Ucf101: A dataset of 101 human actions classes from videos in the wild","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.03549","last_updated":"2025-02-10T03:28:56Z","snapshot_observed_at":"2026-08-09T04:29:54.346394Z","submitted_at":"2025-02-05T19:03:58Z","title":"Kronecker Mask and Interpretive Prompts are Language-Action Video Learners","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-09T04:37:09.706572Z"},"links":{"cited_paper":"/paper/1212.0402","citing_paper":"/paper/2502.03549"},"observation_digest":"sha256:ab1c467f0daa7d91c9ba8049187dc12ac6c30ec675f8fecdfdee637be8acc75a","observation_id":"17f4bbeb-d622-4727-9fd4-a82cd8d8c95d","resolution":{"observed_at":"2026-08-09T04:37:09.706572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.05743","last_updated":"2019-09-27T21:59:59Z","snapshot_observed_at":"2026-08-07T11:03:21.673722Z","submitted_at":"2019-06-13T15:03:52Z","title":"Learning Video Representations using Contrastive Bidirectional Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.05743","snapshot_observed_at":"2026-08-09T04:37:09.765177Z","title":"Learning video representations using contrastive bidirectional transformer","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2502.03549","last_updated":"2025-02-10T03:28:56Z","snapshot_observed_at":"2026-08-09T04:29:54.346394Z","submitted_at":"2025-02-05T19:03:58Z","title":"Kronecker Mask and Interpretive Prompts are Language-Action Video Learners","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-09T04:37:09.765177Z"},"links":{"cited_paper":"/paper/1906.05743","citing_paper":"/paper/2502.03549"},"observation_digest":"sha256:449b8a0b108262370b263a1952c42d9885bcfc9910bb257d522bdbcd377d2161","observation_id":"4ba2c31b-bb45-4bbd-88b7-a88902eb8966","resolution":{"observed_at":"2026-08-09T04:37:09.765177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-09T04:37:09.784435Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.03549","last_updated":"2025-02-10T03:28:56Z","snapshot_observed_at":"2026-08-09T04:29:54.346394Z","submitted_at":"2025-02-05T19:03:58Z","title":"Kronecker Mask and Interpretive Prompts are Language-Action Video Learners","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-09T04:37:09.784435Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2502.03549"},"observation_digest":"sha256:e633f69c4a59fc2acce463d25cb223f20f3d2c0051735fff8b03efcc974b9cb7","observation_id":"189d7143-2681-42f8-b109-8eeb513f617b","resolution":{"observed_at":"2026-08-09T04:37:09.784435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:37:10.659471Z","title":"Clipasso: Semantically-aware object sketching","venue":null,"work_id":"65eda1cc-adb9-400a-9ee0-1d9e84656911","year":2025},"citing_paper":{"arxiv_id":"2502.03549","last_updated":"2025-02-10T03:28:56Z","snapshot_observed_at":"2026-08-09T04:29:54.346394Z","submitted_at":"2025-02-05T19:03:58Z","title":"Kronecker Mask and Interpretive Prompts are Language-Action Video Learners","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-09T04:37:09.804493Z"},"links":{"citing_paper":"/paper/2502.03549"},"observation_digest":"sha256:1bacfcffe70da27036cb355863d4eb59805a376446feb19eec68d05b2ff24105","observation_id":"4c9f1f86-30b4-46ae-b74c-958f828cef35","resolution":{"observed_at":"2026-08-09T04:37:10.664290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:37:10.644751Z","title":"Alternative semantic representations for zero-shot human action recog- nition","venue":null,"work_id":"981670de-6da5-4e04-b373-da1cad3d52ba","year":2017},"citing_paper":{"arxiv_id":"2502.03549","last_updated":"2025-02-10T03:28:56Z","snapshot_observed_at":"2026-08-09T04:29:54.346394Z","submitted_at":"2025-02-05T19:03:58Z","title":"Kronecker Mask and Interpretive Prompts are Language-Action Video Learners","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-09T04:37:09.824240Z"},"links":{"citing_paper":"/paper/2502.03549"},"observation_digest":"sha256:f814f2238306a7dd5cc04e7b7c39ee70607f38ef6de804a1097910ba168cfb86","observation_id":"1233edc1-6f33-470a-ad29-d29257a74c55","resolution":{"observed_at":"2026-08-09T04:37:10.649678Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.14084","last_updated":"2021-10-01T15:13:27Z","snapshot_observed_at":"2026-08-04T06:58:39.755482Z","submitted_at":"2021-09-28T23:01:51Z","title":"VideoCLIP: Contrastive Pre-training for Zero-shot Video-Text Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.14084","snapshot_observed_at":"2026-08-09T04:37:09.828306Z","title":"Videoclip: Contrastive pre-training for zero-shot video-text understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.03549","last_updated":"2025-02-10T03:28:56Z","snapshot_observed_at":"2026-08-09T04:29:54.346394Z","submitted_at":"2025-02-05T19:03:58Z","title":"Kronecker Mask and Interpretive Prompts are Language-Action Video Learners","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-09T04:37:09.828306Z"},"links":{"cited_paper":"/paper/2109.14084","citing_paper":"/paper/2502.03549"},"observation_digest":"sha256:22b67f45bfe88734cb8f1e5ceba54dd65764f0697b078621eec174c75f3eb928","observation_id":"48be1796-333d-469a-afc5-bb86bdcd62a5","resolution":{"observed_at":"2026-08-09T04:37:09.828306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:37:10.629871Z","title":"Multi-task zero-shot action recognition with prioritised data augmentation","venue":null,"work_id":"1a8eb65d-0f80-48fd-a8cc-bc8161cbf190","year":2016},"citing_paper":{"arxiv_id":"2502.03549","last_updated":"2025-02-10T03:28:56Z","snapshot_observed_at":"2026-08-09T04:29:54.346394Z","submitted_at":"2025-02-05T19:03:58Z","title":"Kronecker Mask and Interpretive Prompts are Language-Action Video Learners","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-09T04:37:09.832884Z"},"links":{"citing_paper":"/paper/2502.03549"},"observation_digest":"sha256:3dfdd1f178665349636fbf6e2fc914dd194908d55d36997be87f76ac524ee1f7","observation_id":"68564d2e-5f15-4512-b3a0-539c2841273a","resolution":{"observed_at":"2026-08-09T04:37:10.634794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.03024","last_updated":"2023-02-06T18:59:17Z","snapshot_observed_at":"2026-08-03T18:56:56.378342Z","submitted_at":"2023-02-06T18:59:17Z","title":"AIM: Adapting Image Models for Efficient Video Action Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.03024","snapshot_observed_at":"2026-08-09T04:37:09.837333Z","title":"Aim: Adapting image models for efficient video action recognition","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.03549","last_updated":"2025-02-10T03:28:56Z","snapshot_observed_at":"2026-08-09T04:29:54.346394Z","submitted_at":"2025-02-05T19:03:58Z","title":"Kronecker Mask and Interpretive Prompts are Language-Action Video Learners","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-09T04:37:09.837333Z"},"links":{"cited_paper":"/paper/2302.03024","citing_paper":"/paper/2502.03549"},"observation_digest":"sha256:1f92ae281774c6caa48bca08ba15debf7885d376367fde7a1f32f2cdb8223715","observation_id":"379eb698-d417-405d-9f65-11510a95ebc1","resolution":{"observed_at":"2026-08-09T04:37:09.837333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.11432","snapshot_observed_at":"2026-08-09T04:37:09.841758Z","title":"Florence: A new foundation model for computer vision","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.03549","last_updated":"2025-02-10T03:28:56Z","snapshot_observed_at":"2026-08-09T04:29:54.346394Z","submitted_at":"2025-02-05T19:03:58Z","title":"Kronecker Mask and Interpretive Prompts are Language-Action Video Learners","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-09T04:37:09.841758Z"},"links":{"cited_paper":"/paper/2111.11432","citing_paper":"/paper/2502.03549"},"observation_digest":"sha256:bc6c17fc1dcb583e21a856844c21392e81dff4677fa1b860b6eaf64301b642e7","observation_id":"2161c4e0-612f-4dcc-a496-766d5770fb8f","resolution":{"observed_at":"2026-08-09T04:37:09.841758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.07175","last_updated":"2021-12-14T05:41:39Z","snapshot_observed_at":"2026-08-09T14:39:26.125187Z","submitted_at":"2021-12-14T05:41:39Z","title":"Co-training Transformer with Videos and Images Improves Action Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.07175","snapshot_observed_at":"2026-08-09T04:37:09.846651Z","title":"Co-training transformer with videos and images improves action recognition","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.03549","last_updated":"2025-02-10T03:28:56Z","snapshot_observed_at":"2026-08-09T04:29:54.346394Z","submitted_at":"2025-02-05T19:03:58Z","title":"Kronecker Mask and Interpretive Prompts are Language-Action Video Learners","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-09T04:37:09.846651Z"},"links":{"cited_paper":"/paper/2112.07175","citing_paper":"/paper/2502.03549"},"observation_digest":"sha256:809d9caf0888be06fa8c2d6d8cfce067d34a06c3e75e4c63a8390d4b41213848","observation_id":"8ff8d952-8172-4892-8a76-e4246122f55e","resolution":{"observed_at":"2026-08-09T04:37:09.846651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:37:10.614207Z","title":"Learning a deep embedding model for zero-shot learning","venue":null,"work_id":"378b2482-26a9-4c8e-9a54-262d21831a66","year":2025},"citing_paper":{"arxiv_id":"2502.03549","last_updated":"2025-02-10T03:28:56Z","snapshot_observed_at":"2026-08-09T04:29:54.346394Z","submitted_at":"2025-02-05T19:03:58Z","title":"Kronecker Mask and Interpretive Prompts are Language-Action Video Learners","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-09T04:37:09.851597Z"},"links":{"citing_paper":"/paper/2502.03549"},"observation_digest":"sha256:d84a7b3289b0b689ee5053cce2cce9108274eafd7167074712c8064c17d0434e","observation_id":"67f53610-4f3e-43d2-8685-a23343577c2d","resolution":{"observed_at":"2026-08-09T04:37:10.619242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:37:10.586751Z","title":"always be full rank","venue":null,"work_id":"6291ffb1-0e16-49ba-b2a6-b0c744bdffc4","year":2025},"citing_paper":{"arxiv_id":"2502.03549","last_updated":"2025-02-10T03:28:56Z","snapshot_observed_at":"2026-08-09T04:29:54.346394Z","submitted_at":"2025-02-05T19:03:58Z","title":"Kronecker Mask and Interpretive Prompts are Language-Action Video Learners","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-09T04:37:09.862379Z"},"links":{"citing_paper":"/paper/2502.03549"},"observation_digest":"sha256:8e21b2212229e6ecc397c1fdf4bb31480010cfab71ce6fa84bd3700b2a3911a9","observation_id":"4ee53428-791e-44c5-b502-350d806c42d2","resolution":{"observed_at":"2026-08-09T04:37:10.590705Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:37:10.557475Z","title":null,"venue":null,"work_id":"c899f239-dd5e-44cf-a2af-b3c38ce19fae","year":2025},"citing_paper":{"arxiv_id":"2502.03549","last_updated":"2025-02-10T03:28:56Z","snapshot_observed_at":"2026-08-09T04:29:54.346394Z","submitted_at":"2025-02-05T19:03:58Z","title":"Kronecker Mask and Interpretive Prompts are Language-Action Video Learners","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-09T04:37:09.872839Z"},"links":{"citing_paper":"/paper/2502.03549"},"observation_digest":"sha256:f909357de3b3e3b218da9bc388e6a0a5b89007a9739d0558f3c6bd60e5870dd1","observation_id":"200f7ef2-5a07-4254-a8fd-6c20240743a9","resolution":{"observed_at":"2026-08-09T04:37:10.561677Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:37:10.206427Z","title":"For cases generated by Imagen, in Fig","venue":null,"work_id":"d0e6dc25-4b43-4da9-989d-32f55c24f852","year":2017},"citing_paper":{"arxiv_id":"2502.03549","last_updated":"2025-02-10T03:28:56Z","snapshot_observed_at":"2026-08-09T04:29:54.346394Z","submitted_at":"2025-02-05T19:03:58Z","title":"Kronecker Mask and Interpretive Prompts are Language-Action Video Learners","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-09T04:37:09.891480Z"},"links":{"citing_paper":"/paper/2502.03549"},"observation_digest":"sha256:fa92dd7ec9a9075126abea031f6accdec108dd92046b3101d3a4150c7403f110","observation_id":"cd7a408c-c186-4d38-9883-ff73944cb9e5","resolution":{"observed_at":"2026-08-09T04:37:10.242416Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:37:10.544092Z","title":"The evaluation is conducted three times","venue":null,"work_id":"92c61bc4-598e-4866-aa7d-2ee5ca173751","year":2024},"citing_paper":{"arxiv_id":"2502.03549","last_updated":"2025-02-10T03:28:56Z","snapshot_observed_at":"2026-08-09T04:29:54.346394Z","submitted_at":"2025-02-05T19:03:58Z","title":"Kronecker Mask and Interpretive Prompts are Language-Action Video Learners","version":3},"reference_index":600,"source":"pdf_text","source_observed_at":"2026-08-09T04:37:09.877802Z"},"links":{"citing_paper":"/paper/2502.03549"},"observation_digest":"sha256:c863ba0b480a0154795a24654ef33bc83e59138c150b66296b81a8167e1b2302","observation_id":"e18cf98f-99a8-4f0d-8d28-d574c381e5b1","resolution":{"observed_at":"2026-08-09T04:37:10.548244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-09T04:37:09.623418Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2502.03549","last_updated":"2025-02-10T03:28:56Z","snapshot_observed_at":"2026-08-09T04:29:54.346394Z","submitted_at":"2025-02-05T19:03:58Z","title":"Kronecker Mask and Interpretive Prompts are Language-Action Video Learners","version":3},"reference_index":2009,"source":"pdf_text","source_observed_at":"2026-08-09T04:37:09.623418Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2502.03549"},"observation_digest":"sha256:15299ce8654d068efb88d59c52c0c65bf6386fbcd3197498a59aae3ea758ebbd","observation_id":"16a8fbbd-67f1-4c20-a0a6-08fdd3b4d172","resolution":{"observed_at":"2026-08-09T04:37:09.623418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.04676","last_updated":"2022-02-08T16:36:12Z","snapshot_observed_at":"2026-08-04T03:00:58.368363Z","submitted_at":"2022-01-12T20:02:32Z","title":"UniFormer: Unified Transformer for Efficient Spatiotemporal Representation Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.04676","snapshot_observed_at":"2026-08-09T04:37:09.654476Z","title":"Unicoder-vl: A universal encoder for vision and language by cross-modal pre-training","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.03549","last_updated":"2025-02-10T03:28:56Z","snapshot_observed_at":"2026-08-09T04:29:54.346394Z","submitted_at":"2025-02-05T19:03:58Z","title":"Kronecker Mask and Interpretive Prompts are Language-Action Video Learners","version":3},"reference_index":2011,"source":"pdf_text","source_observed_at":"2026-08-09T04:37:09.654476Z"},"links":{"cited_paper":"/paper/2201.04676","citing_paper":"/paper/2502.03549"},"observation_digest":"sha256:e5e735fcae27ee5db96a6c0cff4d73a19427121deddeb6fc355c4e9ae3f1ebde","observation_id":"f2dfe5d4-36b7-4d08-9b0b-344002d1ea88","resolution":{"observed_at":"2026-08-09T04:37:09.654476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.08530","last_updated":"2020-02-18T02:59:17Z","snapshot_observed_at":"2026-08-08T09:19:20.381840Z","submitted_at":"2019-08-22T17:59:30Z","title":"VL-BERT: Pre-training of Generic Visual-Linguistic Representations","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.08530","snapshot_observed_at":"2026-08-09T04:37:09.737902Z","title":"Vl-bert: Pre-training of generic visual-linguistic representations","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2502.03549","last_updated":"2025-02-10T03:28:56Z","snapshot_observed_at":"2026-08-09T04:29:54.346394Z","submitted_at":"2025-02-05T19:03:58Z","title":"Kronecker Mask and Interpretive Prompts are Language-Action Video Learners","version":3},"reference_index":2012,"source":"pdf_text","source_observed_at":"2026-08-09T04:37:09.737902Z"},"links":{"cited_paper":"/paper/1908.08530","citing_paper":"/paper/2502.03549"},"observation_digest":"sha256:f732dcc05cad2fef3c7e677b13f49a6a7203d58aa84d58171e478025bb8ca8be","observation_id":"5d69a116-17cb-4aaa-96e2-85e47d273369","resolution":{"observed_at":"2026-08-09T04:37:09.737902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1705.06950","last_updated":"2017-05-19T12:07:01Z","snapshot_observed_at":"2026-08-08T17:46:50.107463Z","submitted_at":"2017-05-19T12:07:01Z","title":"The Kinetics Human Action Video Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.06950","snapshot_observed_at":"2026-08-09T04:37:09.649514Z","title":"The kinetics human action video dataset","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.03549","last_updated":"2025-02-10T03:28:56Z","snapshot_observed_at":"2026-08-09T04:29:54.346394Z","submitted_at":"2025-02-05T19:03:58Z","title":"Kronecker Mask and Interpretive Prompts are Language-Action Video Learners","version":3},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-09T04:37:09.649514Z"},"links":{"cited_paper":"/paper/1705.06950","citing_paper":"/paper/2502.03549"},"observation_digest":"sha256:41d712ec827057898b1d51b660eed96db043d418524d0e6ae5365d6c6ffcc54c","observation_id":"e430e668-dc8c-474e-b363-2c660d5577ae","resolution":{"observed_at":"2026-08-09T04:37:09.649514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.08472","last_updated":"2021-09-17T11:21:34Z","snapshot_observed_at":"2026-07-06T11:48:42.000083Z","submitted_at":"2021-09-17T11:21:34Z","title":"ActionCLIP: A New Paradigm for Video Action Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.08472","snapshot_observed_at":"2026-08-09T04:37:09.819109Z","title":"Actionclip: A new paradigm for video action recognition","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.03549","last_updated":"2025-02-10T03:28:56Z","snapshot_observed_at":"2026-08-09T04:29:54.346394Z","submitted_at":"2025-02-05T19:03:58Z","title":"Kronecker Mask and Interpretive Prompts are Language-Action Video Learners","version":3},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-09T04:37:09.819109Z"},"links":{"cited_paper":"/paper/2109.08472","citing_paper":"/paper/2502.03549"},"observation_digest":"sha256:a7a9694c821ee86bc02907d40f612d87e68a1c1948434c558ac06e069df30e9b","observation_id":"04503e34-8e11-4846-8e67-8a304247919c","resolution":{"observed_at":"2026-08-09T04:37:09.819109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1808.01340","last_updated":"2018-08-03T20:17:05Z","snapshot_observed_at":"2026-07-06T06:54:00.483796Z","submitted_at":"2018-08-03T20:17:05Z","title":"A Short Note about Kinetics-600","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.01340","snapshot_observed_at":"2026-08-09T04:37:09.606955Z","title":"A short note about kinetics-600","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.03549","last_updated":"2025-02-10T03:28:56Z","snapshot_observed_at":"2026-08-09T04:29:54.346394Z","submitted_at":"2025-02-05T19:03:58Z","title":"Kronecker Mask and Interpretive Prompts are Language-Action Video Learners","version":3},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-09T04:37:09.606955Z"},"links":{"cited_paper":"/paper/1808.01340","citing_paper":"/paper/2502.03549"},"observation_digest":"sha256:f3f9a84d318384739833a37ac6d3e1ef8a0bda9a628e8a36d8e06c1365b32b8f","observation_id":"d063b408-6141-46ae-866c-f2d5f89d9bb1","resolution":{"observed_at":"2026-08-09T04:37:09.606955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:37:10.599976Z","title":null,"venue":null,"work_id":"cf287bb0-9728-4608-bf60-121cc2659c89","year":2020},"citing_paper":{"arxiv_id":"2502.03549","last_updated":"2025-02-10T03:28:56Z","snapshot_observed_at":"2026-08-09T04:29:54.346394Z","submitted_at":"2025-02-05T19:03:58Z","title":"Kronecker Mask and Interpretive Prompts are Language-Action Video Learners","version":3},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-09T04:37:09.856868Z"},"links":{"citing_paper":"/paper/2502.03549"},"observation_digest":"sha256:22428af8fc606ebc11165cecaf5aa761c1c03714860de0f49afcc1f758f8b8d0","observation_id":"04db9eee-fad7-499b-953e-b5d3a774339c","resolution":{"observed_at":"2026-08-09T04:37:10.604170Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2008.12432","last_updated":"2020-08-28T01:44:01Z","snapshot_observed_at":"2026-08-08T23:11:53.542523Z","submitted_at":"2020-08-28T01:44:01Z","title":"All About Knowledge Graphs for Actions","version":1},"cited_work":{"arxiv_id":"2008.12432","doi":null,"metadata_source":"pith","pith_arxiv_id":"2008.12432","snapshot_observed_at":"2026-08-09T04:37:10.141048Z","title":"All About Knowledge Graphs for Actions","venue":"cs.CV","work_id":"a085fb70-0662-43a5-81f3-5abb08572e70","year":2020},"citing_paper":{"arxiv_id":"2502.03549","last_updated":"2025-02-10T03:28:56Z","snapshot_observed_at":"2026-08-09T04:29:54.346394Z","submitted_at":"2025-02-05T19:03:58Z","title":"Kronecker Mask and Interpretive Prompts are Language-Action Video Learners","version":3},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-09T04:37:09.628515Z"},"links":{"cited_paper":"/paper/2008.12432","citing_paper":"/paper/2502.03549"},"observation_digest":"sha256:26db26f0b6309920114dc2ccae868fafdde5ae0a169a47405ace28d36580ac9c","observation_id":"7282830b-f4e7-44d8-b555-e2eb1ac68c8b","resolution":{"observed_at":"2026-08-09T04:37:10.148462Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:37:10.725764Z","title":"Ost: Refining text knowledge with optimal spatio-temporal descriptor for general video recognition","venue":null,"work_id":"3db7679e-1de7-444b-acf3-8161e4b51929","year":2025},"citing_paper":{"arxiv_id":"2502.03549","last_updated":"2025-02-10T03:28:56Z","snapshot_observed_at":"2026-08-09T04:29:54.346394Z","submitted_at":"2025-02-05T19:03:58Z","title":"Kronecker Mask and Interpretive Prompts are Language-Action Video Learners","version":3},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-09T04:37:09.612768Z"},"links":{"citing_paper":"/paper/2502.03549"},"observation_digest":"sha256:bf4469e9b6d3e3efc131c8cb91137d6441916cf7f54156f649b170ea69f56987","observation_id":"18879d0e-89d6-4d49-8471-9459c318a785","resolution":{"observed_at":"2026-08-09T04:37:10.730280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-09T04:37:09.663562Z","title":"Gpt-4 technical report, https://arxiv.org/abs/2303.08774,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.03549","last_updated":"2025-02-10T03:28:56Z","snapshot_observed_at":"2026-08-09T04:29:54.346394Z","submitted_at":"2025-02-05T19:03:58Z","title":"Kronecker Mask and Interpretive Prompts are Language-Action Video Learners","version":3},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-09T04:37:09.663562Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2502.03549"},"observation_digest":"sha256:3fb0649f732db0be09ccd7090497f67ed6cbc7c0dc26cfd075654dfc8e0a6193","observation_id":"8d9cb6af-c5f0-49bf-8617-bc48dcad3c95","resolution":{"observed_at":"2026-08-09T04:37:09.663562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:37:09.618483Z","title":"Imagenet: A large-scale hi- erarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2502.03549","last_updated":"2025-02-10T03:28:56Z","snapshot_observed_at":"2026-08-09T04:29:54.346394Z","submitted_at":"2025-02-05T19:03:58Z","title":"Kronecker Mask and Interpretive Prompts are Language-Action Video Learners","version":3},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-09T04:37:09.618483Z"},"links":{"citing_paper":"/paper/2502.03549"},"observation_digest":"sha256:3e59e589ade9beb5fe0a7eec3f7ad88b4552411f823a775c84e389eeb0945f10","observation_id":"34eb9f1f-4ddb-4be1-9c7f-4ddebeba97b8","resolution":{"observed_at":"2026-08-09T04:37:09.618483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-09T04:37:09.596768Z","title":"Zeynep Akata, Florent Perronnin, Zaid Harchaoui, and Cordelia Schmid","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.03549","last_updated":"2025-02-10T03:28:56Z","snapshot_observed_at":"2026-08-09T04:29:54.346394Z","submitted_at":"2025-02-05T19:03:58Z","title":"Kronecker Mask and Interpretive Prompts are Language-Action Video Learners","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-09T04:37:09.596768Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2502.03549"},"observation_digest":"sha256:d3dd49cf2f4a76b0f2a51722188c5c682f4b349c0e8a989e35883940d31de214","observation_id":"63b0ca20-0bfd-4aea-9f86-eb9b99f9e19e","resolution":{"observed_at":"2026-08-09T04:37:09.596768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.03549","last_updated":"2025-02-10T03:28:56Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T04:29:54.346394Z","submitted_at":"2025-02-05T19:03:58Z","title":"Kronecker Mask and Interpretive Prompts are Language-Action Video Learners"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":20,"verified_exact":1,"verified_fuzzy":15},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 0 inbound Pith citation observations for arXiv:2502.03549."}