{"as_of":"2026-08-10T00:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2143107b0d8c0a06d865cde73780269aef8a711970c536b5c041f1e31d9ba4b3","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:42:21.811848Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.16701/citation-record","integrity":"/paper/2506.16701/integrity","json":"/paper/2506.16701/citation-record.json","paper":"/paper/2506.16701"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:22.516651Z","title":"Action genome: Actions as compositions of spatio- temporal scene graphs","venue":null,"work_id":"9e0d2cb3-f7ad-47fc-ada9-2ff568fb36c0","year":2020},"citing_paper":{"arxiv_id":"2506.16701","last_updated":"2025-06-20T02:43:53Z","snapshot_observed_at":"2026-08-06T23:34:49.615098Z","submitted_at":"2025-06-20T02:43:53Z","title":"Language-driven Description Generation and Common Sense Reasoning for Video Action Recognition","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:19.034906Z"},"links":{"citing_paper":"/paper/2506.16701"},"observation_digest":"sha256:d7e33ace9181b7cfb4a6ebf97bc3eb2065f031a6f61d1df43bd90d3a7e52fdca","observation_id":"b72c9351-9ef0-465e-b48e-f1ce3130d5c8","resolution":{"observed_at":"2026-08-06T23:42:22.520530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-08-06T23:42:19.144627Z","title":"OPT: Open pre-trained transformer language models.ArXiv, abs/2205.01068, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.16701","last_updated":"2025-06-20T02:43:53Z","snapshot_observed_at":"2026-08-06T23:34:49.615098Z","submitted_at":"2025-06-20T02:43:53Z","title":"Language-driven Description Generation and Common Sense Reasoning for Video Action Recognition","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:19.144627Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2506.16701"},"observation_digest":"sha256:38d138abb7d4effccd3c6013f121d6b45476f31e9f58cc6fd833a1f648ba4856","observation_id":"33a8dfb9-c426-4331-85c2-628f14f2c224","resolution":{"observed_at":"2026-08-06T23:42:19.144627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-07-31T22:31:37.910868Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-08-06T23:42:19.256942Z","title":"Roberta: A robustly optimized BERT pretraining approach.CoRR, abs/1907.11692, 2019","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2506.16701","last_updated":"2025-06-20T02:43:53Z","snapshot_observed_at":"2026-08-06T23:34:49.615098Z","submitted_at":"2025-06-20T02:43:53Z","title":"Language-driven Description Generation and Common Sense Reasoning for Video Action Recognition","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:19.256942Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2506.16701"},"observation_digest":"sha256:82194122756e23d9f87b992885b4eea36a7cad1cf6b2ffce702e3384da709820","observation_id":"f8c50662-bf37-4081-9d4d-80586bc74098","resolution":{"observed_at":"2026-08-06T23:42:19.256942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:22.505000Z","title":"Chatgpt-4o, 2024","venue":null,"work_id":"5fe21f43-b4d3-40ed-9bfd-9c14900860d1","year":2024},"citing_paper":{"arxiv_id":"2506.16701","last_updated":"2025-06-20T02:43:53Z","snapshot_observed_at":"2026-08-06T23:34:49.615098Z","submitted_at":"2025-06-20T02:43:53Z","title":"Language-driven Description Generation and Common Sense Reasoning for Video Action Recognition","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:19.370286Z"},"links":{"citing_paper":"/paper/2506.16701"},"observation_digest":"sha256:8b3377503f9268b6423a6af09c9e7becd93d8cc7f4bfdf256dfdfec628206f79","observation_id":"78e5ac41-9a02-42fd-9a94-117b65d18d08","resolution":{"observed_at":"2026-08-06T23:42:22.508520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:22.493653Z","title":"Gemini 2.0 flash, 2024","venue":null,"work_id":"d41b1dc2-d9b1-4ed5-a909-e5e7e0bf7026","year":2024},"citing_paper":{"arxiv_id":"2506.16701","last_updated":"2025-06-20T02:43:53Z","snapshot_observed_at":"2026-08-06T23:34:49.615098Z","submitted_at":"2025-06-20T02:43:53Z","title":"Language-driven Description Generation and Common Sense Reasoning for Video Action Recognition","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:19.505819Z"},"links":{"citing_paper":"/paper/2506.16701"},"observation_digest":"sha256:2950a3a48ec0d7562582acb2810dc4573441d0e966033249660d5b338561e964","observation_id":"20c30f0a-6199-46e8-b882-0cbeac9c7b31","resolution":{"observed_at":"2026-08-06T23:42:22.497191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:22.474843Z","title":"Qwen2.5- vl technical report, 2025","venue":null,"work_id":"67f0759b-c4af-4913-bd12-4dd1fc53e47b","year":2025},"citing_paper":{"arxiv_id":"2506.16701","last_updated":"2025-06-20T02:43:53Z","snapshot_observed_at":"2026-08-06T23:34:49.615098Z","submitted_at":"2025-06-20T02:43:53Z","title":"Language-driven Description Generation and Common Sense Reasoning for Video Action Recognition","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:19.665627Z"},"links":{"citing_paper":"/paper/2506.16701"},"observation_digest":"sha256:c081da72e9fdf29a6c87507d1a0405f75c9c72516b297c3a3ddb8898ea4d991a","observation_id":"a01dcf5b-733c-4f47-ad8c-b86ba066d818","resolution":{"observed_at":"2026-08-06T23:42:22.484668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:22.460117Z","title":"Prompting visual-language models for efficient video understanding","venue":null,"work_id":"c2b7d778-0c02-4294-a07a-c69101cb6820","year":2022},"citing_paper":{"arxiv_id":"2506.16701","last_updated":"2025-06-20T02:43:53Z","snapshot_observed_at":"2026-08-06T23:34:49.615098Z","submitted_at":"2025-06-20T02:43:53Z","title":"Language-driven Description Generation and Common Sense Reasoning for Video Action Recognition","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:19.780660Z"},"links":{"citing_paper":"/paper/2506.16701"},"observation_digest":"sha256:118b543a66fab590d0c3d4798b5ec54f16ac15c93e49dea75acb4aeef5525e11","observation_id":"373aa4ee-a0f3-4b4f-af5b-ad4fc7eb3c53","resolution":{"observed_at":"2026-08-06T23:42:22.465022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:22.442414Z","title":"Llms are good action recognizers","venue":null,"work_id":"d9d3733d-6dfe-4053-96e3-bb2347491cdf","year":2024},"citing_paper":{"arxiv_id":"2506.16701","last_updated":"2025-06-20T02:43:53Z","snapshot_observed_at":"2026-08-06T23:34:49.615098Z","submitted_at":"2025-06-20T02:43:53Z","title":"Language-driven Description Generation and Common Sense Reasoning for Video Action Recognition","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:19.851409Z"},"links":{"citing_paper":"/paper/2506.16701"},"observation_digest":"sha256:c065b018ea129e42d982af6183a968315d184b33a3d665c23c25ceaccfe0c39d","observation_id":"239205f9-1874-448e-a453-9ab9238b2366","resolution":{"observed_at":"2026-08-06T23:42:22.451449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:22.426718Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and language models","venue":null,"work_id":"56c4741b-0917-4bff-96f2-f314fd6566c8","year":2024},"citing_paper":{"arxiv_id":"2506.16701","last_updated":"2025-06-20T02:43:53Z","snapshot_observed_at":"2026-08-06T23:34:49.615098Z","submitted_at":"2025-06-20T02:43:53Z","title":"Language-driven Description Generation and Common Sense Reasoning for Video Action Recognition","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:20.001362Z"},"links":{"citing_paper":"/paper/2506.16701"},"observation_digest":"sha256:24ed2842f2e5de879f15a61c2faad48249f8bbe498cdb4a0821e83d9204ad8a0","observation_id":"04db58d5-6d67-424b-bbdd-7b8eff7218e1","resolution":{"observed_at":"2026-08-06T23:42:22.430934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:22.408942Z","title":"M-llm based video frame selec- tion for efficient video understanding","venue":null,"work_id":"73ef788a-e641-48c8-8384-f7c6374c85ac","year":2025},"citing_paper":{"arxiv_id":"2506.16701","last_updated":"2025-06-20T02:43:53Z","snapshot_observed_at":"2026-08-06T23:34:49.615098Z","submitted_at":"2025-06-20T02:43:53Z","title":"Language-driven Description Generation and Common Sense Reasoning for Video Action Recognition","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:20.132309Z"},"links":{"citing_paper":"/paper/2506.16701"},"observation_digest":"sha256:ebfb402593f3b161baad1f8c892700bf74b828a2b7286a93acb6b42e70617955","observation_id":"d9c25835-2ced-4e4d-8a4c-7fafab3cb869","resolution":{"observed_at":"2026-08-06T23:42:22.418534Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.08585","last_updated":"2025-04-24T17:42:16Z","snapshot_observed_at":"2026-08-07T18:43:01.306583Z","submitted_at":"2025-03-11T16:21:23Z","title":"HierarQ: Task-Aware Hierarchical Q-Former for Enhanced Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.08585","snapshot_observed_at":"2026-08-06T23:42:20.273161Z","title":"Hierarq: Task-aware hierarchical q-former for enhanced video understanding.arXiv preprint arXiv:2503.08585, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.16701","last_updated":"2025-06-20T02:43:53Z","snapshot_observed_at":"2026-08-06T23:34:49.615098Z","submitted_at":"2025-06-20T02:43:53Z","title":"Language-driven Description Generation and Common Sense Reasoning for Video Action Recognition","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:20.273161Z"},"links":{"cited_paper":"/paper/2503.08585","citing_paper":"/paper/2506.16701"},"observation_digest":"sha256:e4e767990268bc1d8aa9c1c5e096afb1a904c2be5c8505d34f627c57fe79632f","observation_id":"0db42020-bc5d-4b84-bfe1-195443b6a256","resolution":{"observed_at":"2026-08-06T23:42:20.273161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:22.382064Z","title":"Two-stream con- volutional networks for action recognition in videos","venue":null,"work_id":"2eff8914-cb68-40c2-869c-174b3f6c3a30","year":null},"citing_paper":{"arxiv_id":"2506.16701","last_updated":"2025-06-20T02:43:53Z","snapshot_observed_at":"2026-08-06T23:34:49.615098Z","submitted_at":"2025-06-20T02:43:53Z","title":"Language-driven Description Generation and Common Sense Reasoning for Video Action Recognition","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:20.354728Z"},"links":{"citing_paper":"/paper/2506.16701"},"observation_digest":"sha256:c29f6a4686bcbe73774993753a8136ab7da0b97fa4b32be9695ae6069c8bb182","observation_id":"cb149e37-2dad-424f-9e59-0b8fafce6447","resolution":{"observed_at":"2026-08-06T23:42:22.385943Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:22.369822Z","title":"Temporal segment networks for action recognition in videos.IEEE Transactions on Pattern Analysis and Machine Intelligence, 41(11):2740– 2755, 2019","venue":null,"work_id":"6c5fbe2e-07b7-4603-b6af-7db794491baf","year":2019},"citing_paper":{"arxiv_id":"2506.16701","last_updated":"2025-06-20T02:43:53Z","snapshot_observed_at":"2026-08-06T23:34:49.615098Z","submitted_at":"2025-06-20T02:43:53Z","title":"Language-driven Description Generation and Common Sense Reasoning for Video Action Recognition","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:20.427751Z"},"links":{"citing_paper":"/paper/2506.16701"},"observation_digest":"sha256:a4e0bc2ab9acc7a1f443d6dd9479deac1a9f6e8a1072a1a4cbc97c6aff7a647a","observation_id":"259051f0-9365-45ca-b031-1b99d5ba3968","resolution":{"observed_at":"2026-08-06T23:42:22.374140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:22.355874Z","title":"Learning spatiotemporal features with 3d convolutional networks","venue":null,"work_id":"cf555671-7bd9-4901-84b4-5d57d82f29de","year":2015},"citing_paper":{"arxiv_id":"2506.16701","last_updated":"2025-06-20T02:43:53Z","snapshot_observed_at":"2026-08-06T23:34:49.615098Z","submitted_at":"2025-06-20T02:43:53Z","title":"Language-driven Description Generation and Common Sense Reasoning for Video Action Recognition","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:20.486930Z"},"links":{"citing_paper":"/paper/2506.16701"},"observation_digest":"sha256:9f5e6e0b746132a3e40ac6b32676b42ebc91b424dc14fbb6e255bb2d4ef7b3a4","observation_id":"284c16f2-3140-4f03-9820-0cd072e8dd07","resolution":{"observed_at":"2026-08-06T23:42:22.360639Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:22.343835Z","title":"Quo vadis, action recognition? A new model and the kinetics dataset","venue":null,"work_id":"2efa37d0-2375-42a5-8dcf-5d71893fcec5","year":2017},"citing_paper":{"arxiv_id":"2506.16701","last_updated":"2025-06-20T02:43:53Z","snapshot_observed_at":"2026-08-06T23:34:49.615098Z","submitted_at":"2025-06-20T02:43:53Z","title":"Language-driven Description Generation and Common Sense Reasoning for Video Action Recognition","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:20.570357Z"},"links":{"citing_paper":"/paper/2506.16701"},"observation_digest":"sha256:99c2f25fd9e945a1a9876ca3670f509da2dd22e143c73a230aa7ed852c586fc7","observation_id":"b1b3f256-2266-4cea-bdc4-10175834fbc6","resolution":{"observed_at":"2026-08-06T23:42:22.347775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:22.331846Z","title":"Smeulders","venue":null,"work_id":"3628978b-91d9-40ca-a1e3-bd623c527354","year":2019},"citing_paper":{"arxiv_id":"2506.16701","last_updated":"2025-06-20T02:43:53Z","snapshot_observed_at":"2026-08-06T23:34:49.615098Z","submitted_at":"2025-06-20T02:43:53Z","title":"Language-driven Description Generation and Common Sense Reasoning for Video Action Recognition","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:20.634188Z"},"links":{"citing_paper":"/paper/2506.16701"},"observation_digest":"sha256:0252d1d7d74f5f8ca1c3f604c7d73d45c7459693d5d8f00ffa7948fbf7ca48b8","observation_id":"786b4f0b-98ff-44c7-b9f0-b03b7d76232e","resolution":{"observed_at":"2026-08-06T23:42:22.335524Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:22.317751Z","title":"Slowfast networks for video recognition","venue":null,"work_id":"bba979a9-d5df-4388-bd0e-104ace2b316a","year":2019},"citing_paper":{"arxiv_id":"2506.16701","last_updated":"2025-06-20T02:43:53Z","snapshot_observed_at":"2026-08-06T23:34:49.615098Z","submitted_at":"2025-06-20T02:43:53Z","title":"Language-driven Description Generation and Common Sense Reasoning for Video Action Recognition","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:20.732330Z"},"links":{"citing_paper":"/paper/2506.16701"},"observation_digest":"sha256:1e2388cf02e4ae33e373ee5591cf03c82afd61894c0602aa17fa6e4a7877c510","observation_id":"53831e79-1ec1-4d5f-b53d-b1ce24f67bbb","resolution":{"observed_at":"2026-08-06T23:42:22.322239Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:22.303647Z","title":null,"venue":null,"work_id":"5f3680a9-2fa9-4660-bded-b21e76ab9388","year":2020},"citing_paper":{"arxiv_id":"2506.16701","last_updated":"2025-06-20T02:43:53Z","snapshot_observed_at":"2026-08-06T23:34:49.615098Z","submitted_at":"2025-06-20T02:43:53Z","title":"Language-driven Description Generation and Common Sense Reasoning for Video Action Recognition","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:20.811147Z"},"links":{"citing_paper":"/paper/2506.16701"},"observation_digest":"sha256:d71c9c2b6c9e3e8f8b53f0b1c6f1904856493769b0ad15c286f2120f3b3ef95a","observation_id":"64d244a2-55d8-420c-8cd6-4fdb5da3b246","resolution":{"observed_at":"2026-08-06T23:42:22.308568Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:22.287789Z","title":"Tokenlearner: Adaptive space- time tokenization for videos","venue":null,"work_id":"8a663a3b-1525-4417-8bd6-42610f0ec5c4","year":2021},"citing_paper":{"arxiv_id":"2506.16701","last_updated":"2025-06-20T02:43:53Z","snapshot_observed_at":"2026-08-06T23:34:49.615098Z","submitted_at":"2025-06-20T02:43:53Z","title":"Language-driven Description Generation and Common Sense Reasoning for Video Action Recognition","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:20.821125Z"},"links":{"citing_paper":"/paper/2506.16701"},"observation_digest":"sha256:16a16297f72667e3044d9c4048f423bc449e299d7add9b96380cb14540a6e2d1","observation_id":"44aab4ff-dcef-4ac7-9517-6380c2b044cc","resolution":{"observed_at":"2026-08-06T23:42:22.293076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1612.03975","last_updated":"2018-12-11T16:27:17Z","snapshot_observed_at":"2026-07-06T05:22:25.273447Z","submitted_at":"2016-12-12T23:54:52Z","title":"ConceptNet 5.5: An Open Multilingual Graph of General Knowledge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1612.03975","snapshot_observed_at":"2026-08-06T23:42:20.983666Z","title":"Conceptnet 5.5: An open multilingual graph of general knowledge.CoRR, abs/1612.03975, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.16701","last_updated":"2025-06-20T02:43:53Z","snapshot_observed_at":"2026-08-06T23:34:49.615098Z","submitted_at":"2025-06-20T02:43:53Z","title":"Language-driven Description Generation and Common Sense Reasoning for Video Action Recognition","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:20.983666Z"},"links":{"cited_paper":"/paper/1612.03975","citing_paper":"/paper/2506.16701"},"observation_digest":"sha256:62ca6cf033b1bd042367792d46064a0d82be3e4df3ce91e150803f546d241884","observation_id":"c3ec7672-fe3d-4eb1-97aa-ee2ba973dbd7","resolution":{"observed_at":"2026-08-06T23:42:20.983666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.00146","last_updated":"2019-02-07T19:52:21Z","snapshot_observed_at":"2026-07-06T07:11:55.047580Z","submitted_at":"2018-10-31T22:57:51Z","title":"ATOMIC: An Atlas of Machine Commonsense for If-Then Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.00146","snapshot_observed_at":"2026-08-06T23:42:21.078067Z","title":"Smith, and Yejin Choi","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.16701","last_updated":"2025-06-20T02:43:53Z","snapshot_observed_at":"2026-08-06T23:34:49.615098Z","submitted_at":"2025-06-20T02:43:53Z","title":"Language-driven Description Generation and Common Sense Reasoning for Video Action Recognition","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:21.078067Z"},"links":{"cited_paper":"/paper/1811.00146","citing_paper":"/paper/2506.16701"},"observation_digest":"sha256:a6772a03f0e2bf8d4b9faeab5df36e7e4e183c151b4c9337c113a7fac9014f5c","observation_id":"0a4e7caf-2a1f-4f04-87ff-69fc0c041152","resolution":{"observed_at":"2026-08-06T23:42:21.078067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:22.244436Z","title":"We- bChild 2.0 : Fine-grained commonsense knowledge distilla- tion","venue":null,"work_id":"f6655374-81b3-4941-bc66-4d592b02c1f1","year":2017},"citing_paper":{"arxiv_id":"2506.16701","last_updated":"2025-06-20T02:43:53Z","snapshot_observed_at":"2026-08-06T23:34:49.615098Z","submitted_at":"2025-06-20T02:43:53Z","title":"Language-driven Description Generation and Common Sense Reasoning for Video Action Recognition","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:21.192655Z"},"links":{"citing_paper":"/paper/2506.16701"},"observation_digest":"sha256:ec1c1f9a2a995b399aa013f8c372dbbb34b1f5d20a40a3dea8595db273ae46b3","observation_id":"6e20bce3-48c2-4f9a-a53b-ae7be4ed1c08","resolution":{"observed_at":"2026-08-06T23:42:22.271807Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:22.223011Z","title":"COMET: Com- monsense transformers for automatic knowledge graph con- struction","venue":null,"work_id":"690baad8-a36d-4aa3-a26c-398ac94004d2","year":2019},"citing_paper":{"arxiv_id":"2506.16701","last_updated":"2025-06-20T02:43:53Z","snapshot_observed_at":"2026-08-06T23:34:49.615098Z","submitted_at":"2025-06-20T02:43:53Z","title":"Language-driven Description Generation and Common Sense Reasoning for Video Action Recognition","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:21.287096Z"},"links":{"citing_paper":"/paper/2506.16701"},"observation_digest":"sha256:ad2d51eae530874047f51fa400a7b510e99ea7574854318ae9040d3742ad009d","observation_id":"990f1d3b-7972-4649-bcdb-6f1381f3ae86","resolution":{"observed_at":"2026-08-06T23:42:22.233158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:22.209414Z","title":"Hwang, Liwei Jiang, Ronan Le Bras, Ximing Lu, Sean Welleck, and Yejin Choi","venue":null,"work_id":"ad7141ee-4444-4bc9-95dd-9c428da5928f","year":2022},"citing_paper":{"arxiv_id":"2506.16701","last_updated":"2025-06-20T02:43:53Z","snapshot_observed_at":"2026-08-06T23:34:49.615098Z","submitted_at":"2025-06-20T02:43:53Z","title":"Language-driven Description Generation and Common Sense Reasoning for Video Action Recognition","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:21.306892Z"},"links":{"citing_paper":"/paper/2506.16701"},"observation_digest":"sha256:73abbd77b4aa53098b129c74f28924e342aeee65e490a686270f9cf8c6e13d45","observation_id":"2c46a1d6-4e5e-4fe1-b9bc-faeb99f209f8","resolution":{"observed_at":"2026-08-06T23:42:22.213346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:22.189901Z","title":"Conditional prompt learning for vision-language models","venue":null,"work_id":"f0c2ffb5-da6a-446a-996c-9d691889a4a2","year":2022},"citing_paper":{"arxiv_id":"2506.16701","last_updated":"2025-06-20T02:43:53Z","snapshot_observed_at":"2026-08-06T23:34:49.615098Z","submitted_at":"2025-06-20T02:43:53Z","title":"Language-driven Description Generation and Common Sense Reasoning for Video Action Recognition","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:21.444572Z"},"links":{"citing_paper":"/paper/2506.16701"},"observation_digest":"sha256:ce5ab86977ba9ae70e8c30697d7091d6c4fa1f0c5de3be896ffd657dbe8d1dc0","observation_id":"eb5cccf0-a671-4502-a497-e36f674092a3","resolution":{"observed_at":"2026-08-06T23:42:22.194019Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:22.168411Z","title":"Prompt distribution learning","venue":null,"work_id":"218781c5-30f3-434e-8239-a69f3b8a8e62","year":2022},"citing_paper":{"arxiv_id":"2506.16701","last_updated":"2025-06-20T02:43:53Z","snapshot_observed_at":"2026-08-06T23:34:49.615098Z","submitted_at":"2025-06-20T02:43:53Z","title":"Language-driven Description Generation and Common Sense Reasoning for Video Action Recognition","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:21.544753Z"},"links":{"citing_paper":"/paper/2506.16701"},"observation_digest":"sha256:7baf4794e17fd4cce4a81b1c6f661702b0e6d483249fcbf54c7827574a677deb","observation_id":"6f5971ea-0443-4a1d-95db-f1e2e582866b","resolution":{"observed_at":"2026-08-06T23:42:22.173041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:21.574755Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.16701","last_updated":"2025-06-20T02:43:53Z","snapshot_observed_at":"2026-08-06T23:34:49.615098Z","submitted_at":"2025-06-20T02:43:53Z","title":"Language-driven Description Generation and Common Sense Reasoning for Video Action Recognition","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:21.574755Z"},"links":{"citing_paper":"/paper/2506.16701"},"observation_digest":"sha256:17060f3d537dc3c862eb436f17a1dfa039a1b182a1b9c166ed2ac6beafbe593c","observation_id":"7b6802c2-d0dc-4f3b-a310-e6ab3adf4e31","resolution":{"observed_at":"2026-08-06T23:42:21.574755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:22.146239Z","title":"Denseclip: Language-guided dense prediction with context- aware prompting","venue":null,"work_id":"75696661-ac71-4f8a-8ff5-bcaf42f9c217","year":2022},"citing_paper":{"arxiv_id":"2506.16701","last_updated":"2025-06-20T02:43:53Z","snapshot_observed_at":"2026-08-06T23:34:49.615098Z","submitted_at":"2025-06-20T02:43:53Z","title":"Language-driven Description Generation and Common Sense Reasoning for Video Action Recognition","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:21.633977Z"},"links":{"citing_paper":"/paper/2506.16701"},"observation_digest":"sha256:e709d57d857fef640f48e7bac3c66c3b80d581b49df0d343332e713cf02e0741","observation_id":"b9fe3d8f-922b-4af2-a320-e0060a24cc92","resolution":{"observed_at":"2026-08-06T23:42:22.151063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:22.132856Z","title":"Expanding language-image pretrained models for general video recognition","venue":null,"work_id":"87b06106-8e86-4965-a9d4-9af5b5b384a8","year":2022},"citing_paper":{"arxiv_id":"2506.16701","last_updated":"2025-06-20T02:43:53Z","snapshot_observed_at":"2026-08-06T23:34:49.615098Z","submitted_at":"2025-06-20T02:43:53Z","title":"Language-driven Description Generation and Common Sense Reasoning for Video Action Recognition","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:21.742005Z"},"links":{"citing_paper":"/paper/2506.16701"},"observation_digest":"sha256:11344cdd2713021c3f376154f67c7368e4989cd7fb52af03d6dc3c14aeb99016","observation_id":"58ea54c6-2266-46b1-8fb9-d96decd84584","resolution":{"observed_at":"2026-08-06T23:42:22.137255Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:22.117827Z","title":"Learning to prompt for continual learning","venue":null,"work_id":"307320cf-6b1b-434a-bc75-d4eba19a13d8","year":2022},"citing_paper":{"arxiv_id":"2506.16701","last_updated":"2025-06-20T02:43:53Z","snapshot_observed_at":"2026-08-06T23:34:49.615098Z","submitted_at":"2025-06-20T02:43:53Z","title":"Language-driven Description Generation and Common Sense Reasoning for Video Action Recognition","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:21.745915Z"},"links":{"citing_paper":"/paper/2506.16701"},"observation_digest":"sha256:fb330ecf18fbcd24df2e02eb0a64c3d48326b833a2073340673818701e88608a","observation_id":"e16178ab-908b-460c-8c71-61bebae55ae0","resolution":{"observed_at":"2026-08-06T23:42:22.122393Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:22.105534Z","title":"Visual prompt tuning","venue":null,"work_id":"4ba83b5d-d9b0-4355-8ea5-0d6dce018ae7","year":2022},"citing_paper":{"arxiv_id":"2506.16701","last_updated":"2025-06-20T02:43:53Z","snapshot_observed_at":"2026-08-06T23:34:49.615098Z","submitted_at":"2025-06-20T02:43:53Z","title":"Language-driven Description Generation and Common Sense Reasoning for Video Action Recognition","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:21.749643Z"},"links":{"citing_paper":"/paper/2506.16701"},"observation_digest":"sha256:b3e607d60bf72f3af0b7359b2bdefb89b7f5c9eef3ebc2a51d852cde470794e1","observation_id":"e60e9bb0-1d7c-461e-a67e-361fec39616a","resolution":{"observed_at":"2026-08-06T23:42:22.109828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:22.091422Z","title":"Videobert: A joint model for video and language representation learning","venue":null,"work_id":"7e3b7d68-1e14-4dd9-b7d3-7ee544172390","year":2019},"citing_paper":{"arxiv_id":"2506.16701","last_updated":"2025-06-20T02:43:53Z","snapshot_observed_at":"2026-08-06T23:34:49.615098Z","submitted_at":"2025-06-20T02:43:53Z","title":"Language-driven Description Generation and Common Sense Reasoning for Video Action Recognition","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:21.756955Z"},"links":{"citing_paper":"/paper/2506.16701"},"observation_digest":"sha256:fc47fbce88149db3b3d7631ea7a8590ee962cfdf1876aba9a79e468a7ab22bc7","observation_id":"626eb1b9-c04f-45cf-84c3-95f5616aca36","resolution":{"observed_at":"2026-08-06T23:42:22.096230Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:22.063912Z","title":"Language models are few- shot learners","venue":null,"work_id":"8ad5f283-7c0b-4b10-afba-1650732cf86b","year":1901},"citing_paper":{"arxiv_id":"2506.16701","last_updated":"2025-06-20T02:43:53Z","snapshot_observed_at":"2026-08-06T23:34:49.615098Z","submitted_at":"2025-06-20T02:43:53Z","title":"Language-driven Description Generation and Common Sense Reasoning for Video Action Recognition","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:21.763188Z"},"links":{"citing_paper":"/paper/2506.16701"},"observation_digest":"sha256:bb9ae078f97602b0b60e29555a6df60fc7a69a442b368decce9583b5685b496f","observation_id":"f7615d3c-ec66-474b-b69c-708751fcd5ac","resolution":{"observed_at":"2026-08-06T23:42:22.075878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:22.051242Z","title":"Le, and Christo- pher D","venue":null,"work_id":"5c461c2c-8b90-4b93-962f-368f8f59a3b8","year":2020},"citing_paper":{"arxiv_id":"2506.16701","last_updated":"2025-06-20T02:43:53Z","snapshot_observed_at":"2026-08-06T23:34:49.615098Z","submitted_at":"2025-06-20T02:43:53Z","title":"Language-driven Description Generation and Common Sense Reasoning for Video Action Recognition","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:21.768055Z"},"links":{"citing_paper":"/paper/2506.16701"},"observation_digest":"sha256:f1630549222f0a1fbd385f69632c3d321808483622a95274ea98c234b0ae3a17","observation_id":"edc83934-8674-4252-8dd8-09a0bd6a8aa6","resolution":{"observed_at":"2026-08-06T23:42:22.054885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:22.037958Z","title":"Multimodal few-shot learn- ing with frozen language models.Proc","venue":null,"work_id":"3cc53874-28dc-47e7-91b1-14767fc829e6","year":2021},"citing_paper":{"arxiv_id":"2506.16701","last_updated":"2025-06-20T02:43:53Z","snapshot_observed_at":"2026-08-06T23:34:49.615098Z","submitted_at":"2025-06-20T02:43:53Z","title":"Language-driven Description Generation and Common Sense Reasoning for Video Action Recognition","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:21.772487Z"},"links":{"citing_paper":"/paper/2506.16701"},"observation_digest":"sha256:fecb70156bdea80934d8a3aafc813ca5326774bf3b22ea7942b9d8d9205a7ae0","observation_id":"ad77e2ab-4f84-44c4-9a81-51ecbd5c80a6","resolution":{"observed_at":"2026-08-06T23:42:22.042786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:22.014746Z","title":"UNIFIEDQA: Crossing format boundaries with a single QA system","venue":null,"work_id":"bf997c98-1f1d-4442-9d06-36d5b2c765d2","year":2020},"citing_paper":{"arxiv_id":"2506.16701","last_updated":"2025-06-20T02:43:53Z","snapshot_observed_at":"2026-08-06T23:34:49.615098Z","submitted_at":"2025-06-20T02:43:53Z","title":"Language-driven Description Generation and Common Sense Reasoning for Video Action Recognition","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:21.777249Z"},"links":{"citing_paper":"/paper/2506.16701"},"observation_digest":"sha256:f19fb1187030eb6fa149a46f11ad7ab8996dc79fc04d77111b8a4e6c705808c3","observation_id":"79406379-5f3b-4823-aa3b-eb5e72351b8e","resolution":{"observed_at":"2026-08-06T23:42:22.019630Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:22.001453Z","title":"Few-shot text generation with natural language instructions","venue":null,"work_id":"d9f21715-1bd3-4b7d-8518-36f31bd08381","year":2021},"citing_paper":{"arxiv_id":"2506.16701","last_updated":"2025-06-20T02:43:53Z","snapshot_observed_at":"2026-08-06T23:34:49.615098Z","submitted_at":"2025-06-20T02:43:53Z","title":"Language-driven Description Generation and Common Sense Reasoning for Video Action Recognition","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:21.781863Z"},"links":{"citing_paper":"/paper/2506.16701"},"observation_digest":"sha256:4b0ad14d1270f62810318bdc7c153f7af75a4dc5cf06db50913c13c296da8b93","observation_id":"e08c08b5-1488-4201-afdf-32b8fcefbaaf","resolution":{"observed_at":"2026-08-06T23:42:22.005297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:21.983651Z","title":"Generating action-conditioned prompts for open-vocabulary video action recognition","venue":null,"work_id":"581827aa-25df-4b44-84f5-98e429531c64","year":2024},"citing_paper":{"arxiv_id":"2506.16701","last_updated":"2025-06-20T02:43:53Z","snapshot_observed_at":"2026-08-06T23:34:49.615098Z","submitted_at":"2025-06-20T02:43:53Z","title":"Language-driven Description Generation and Common Sense Reasoning for Video Action Recognition","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:21.786252Z"},"links":{"citing_paper":"/paper/2506.16701"},"observation_digest":"sha256:c76293e9964b465f404afdaaef80e4f3ef18e40e3d910835832715e3f705ade3","observation_id":"67d8d725-f251-4fa0-acce-d060c304a619","resolution":{"observed_at":"2026-08-06T23:42:21.987818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:21.969148Z","title":"Kronecker mask and interpretive prompts are language-action video learners","venue":null,"work_id":"09f3e469-2f9d-4941-aad9-4770cdb8a16f","year":2025},"citing_paper":{"arxiv_id":"2506.16701","last_updated":"2025-06-20T02:43:53Z","snapshot_observed_at":"2026-08-06T23:34:49.615098Z","submitted_at":"2025-06-20T02:43:53Z","title":"Language-driven Description Generation and Common Sense Reasoning for Video Action Recognition","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:21.790912Z"},"links":{"citing_paper":"/paper/2506.16701"},"observation_digest":"sha256:76af35217faebbb1fead10bbb90a2cb88b2e84d1f3d272ab684ccde241b082dd","observation_id":"2e59d9d7-4bd7-43b6-9229-22b0bd086f9c","resolution":{"observed_at":"2026-08-06T23:42:21.973922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:21.956687Z","title":"Visual semantic role labeling for video understanding","venue":null,"work_id":"475c6814-5c48-4b41-85dd-7416a58842aa","year":2021},"citing_paper":{"arxiv_id":"2506.16701","last_updated":"2025-06-20T02:43:53Z","snapshot_observed_at":"2026-08-06T23:34:49.615098Z","submitted_at":"2025-06-20T02:43:53Z","title":"Language-driven Description Generation and Common Sense Reasoning for Video Action Recognition","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:21.794614Z"},"links":{"citing_paper":"/paper/2506.16701"},"observation_digest":"sha256:77e885851ba8ca44b85ca80fbf1aabfb11ef314ed90b83ffa3b7eca0cbcc1297","observation_id":"ad2c47ed-e007-499d-bad7-4a94f141ceae","resolution":{"observed_at":"2026-08-06T23:42:21.960619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00020","last_updated":"2021-02-26T19:04:58Z","snapshot_observed_at":"2026-07-06T10:45:03.059688Z","submitted_at":"2021-02-26T19:04:58Z","title":"Learning Transferable Visual Models From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00020","snapshot_observed_at":"2026-08-06T23:42:21.799058Z","title":"Learning transferable vi- sual models from natural language supervision.ArXiv, abs/2103.00020, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.16701","last_updated":"2025-06-20T02:43:53Z","snapshot_observed_at":"2026-08-06T23:34:49.615098Z","submitted_at":"2025-06-20T02:43:53Z","title":"Language-driven Description Generation and Common Sense Reasoning for Video Action Recognition","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:21.799058Z"},"links":{"cited_paper":"/paper/2103.00020","citing_paper":"/paper/2506.16701"},"observation_digest":"sha256:9855bf9bc1d0533ec0df12243ac84404823b674284264b38321ce731aad49e12","observation_id":"8d9974a3-f7ec-40c7-b23f-fb6a181a81b6","resolution":{"observed_at":"2026-08-06T23:42:21.799058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:21.941652Z","title":"Flava: A foundational language and vision alignment model","venue":null,"work_id":"8ac8af78-2e67-4d51-89be-6b469c425653","year":2022},"citing_paper":{"arxiv_id":"2506.16701","last_updated":"2025-06-20T02:43:53Z","snapshot_observed_at":"2026-08-06T23:34:49.615098Z","submitted_at":"2025-06-20T02:43:53Z","title":"Language-driven Description Generation and Common Sense Reasoning for Video Action Recognition","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:21.807905Z"},"links":{"citing_paper":"/paper/2506.16701"},"observation_digest":"sha256:5273d5b1e59f3954eb8687d369b013c9b4c572827b793affb4886fbd2424e0f6","observation_id":"cb55a17d-2ff0-4de0-9d46-7fc584a684b9","resolution":{"observed_at":"2026-08-06T23:42:21.947281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1604.01753","last_updated":"2016-07-26T22:49:22Z","snapshot_observed_at":"2026-08-05T16:01:24.330553Z","submitted_at":"2016-04-06T19:56:04Z","title":"Hollywood in Homes: Crowdsourcing Data Collection for Activity Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1604.01753","snapshot_observed_at":"2026-08-06T23:42:21.811848Z","title":"close the door","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.16701","last_updated":"2025-06-20T02:43:53Z","snapshot_observed_at":"2026-08-06T23:34:49.615098Z","submitted_at":"2025-06-20T02:43:53Z","title":"Language-driven Description Generation and Common Sense Reasoning for Video Action Recognition","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:21.811848Z"},"links":{"cited_paper":"/paper/1604.01753","citing_paper":"/paper/2506.16701"},"observation_digest":"sha256:39eee6f8f0111dcd906dbf6ccf1488f7ed80cbec169903a5ca85ba40e1bb06cc","observation_id":"83e83f57-78f2-4534-b8fb-0af7dffdfdea","resolution":{"observed_at":"2026-08-06T23:42:21.811848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.16701","last_updated":"2025-06-20T02:43:53Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T23:34:49.615098Z","submitted_at":"2025-06-20T02:43:53Z","title":"Language-driven Description Generation and Common Sense Reasoning for Video Action Recognition"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":9,"verified_exact":0,"verified_fuzzy":34},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 0 inbound Pith citation observations for arXiv:2506.16701."}