{"as_of":"2026-08-18T17:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2b6e48c28ed8f2744f3a7341cb5bd4e92090730685dabb83d2a3ab55f50133c4","coverage":[{"denominator":27,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T17:45:25.588833Z","state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2508.15903/citation-record","integrity":"/paper/2508.15903/integrity","json":"/paper/2508.15903/citation-record.json","paper":"/paper/2508.15903"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:45:29.012933Z","title":"Human action recognition from various data modalities: A review,","venue":null,"work_id":"1d182555-b0e2-46a1-928a-6a53504a8fdf","year":2023},"citing_paper":{"arxiv_id":"2508.15903","last_updated":"2025-08-21T18:03:16Z","snapshot_observed_at":"2026-08-16T16:25:39.563888Z","submitted_at":"2025-08-21T18:03:16Z","title":"VT-LVLM-AR: A Video-Temporal Large Vision-Language Model Adapter for Fine-Grained Action Recognition in Long-Term Videos","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T17:45:23.060592Z"},"links":{"citing_paper":"/paper/2508.15903"},"observation_digest":"sha256:9f40645c81939e201361875c7ac7f7efb628e230e8310fa5622fa04ab054b7e3","observation_id":"30546734-549b-421e-9c22-975274f512e2","resolution":{"observed_at":"2026-08-05T17:45:29.123621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:45:28.873613Z","title":"2d versus 3d convolutional spiking neural networks trained with unsupervised STDP for human ac- tion recognition,","venue":null,"work_id":"456f0196-14dd-425d-b0b4-8abc32f60801","year":2022},"citing_paper":{"arxiv_id":"2508.15903","last_updated":"2025-08-21T18:03:16Z","snapshot_observed_at":"2026-08-16T16:25:39.563888Z","submitted_at":"2025-08-21T18:03:16Z","title":"VT-LVLM-AR: A Video-Temporal Large Vision-Language Model Adapter for Fine-Grained Action Recognition in Long-Term Videos","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T17:45:23.146665Z"},"links":{"citing_paper":"/paper/2508.15903"},"observation_digest":"sha256:4f5615804c6b4d8d5ee6945ff591a82a4e8affb5b7ee4dddbaae2d79a0dd4fc2","observation_id":"d252faa4-4aab-465e-b185-618752afe075","resolution":{"observed_at":"2026-08-05T17:45:28.949894Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:45:28.718038Z","title":"Overview of the transformer-based models for NLP tasks,","venue":null,"work_id":"69de7b0a-2b23-4000-901d-426cb7149629","year":2020},"citing_paper":{"arxiv_id":"2508.15903","last_updated":"2025-08-21T18:03:16Z","snapshot_observed_at":"2026-08-16T16:25:39.563888Z","submitted_at":"2025-08-21T18:03:16Z","title":"VT-LVLM-AR: A Video-Temporal Large Vision-Language Model Adapter for Fine-Grained Action Recognition in Long-Term Videos","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T17:45:23.228078Z"},"links":{"citing_paper":"/paper/2508.15903"},"observation_digest":"sha256:d98df1b9cdc256d5f29074489a8acea971f47923dc68249f5d71c2cf98d624cb","observation_id":"e50b3ee1-68e1-40bf-8e19-38eda428f0c7","resolution":{"observed_at":"2026-08-05T17:45:28.789963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:45:23.362858Z","title":"A survey on large language model (LLM) security and privacy: The good, the bad, and the ugly,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.15903","last_updated":"2025-08-21T18:03:16Z","snapshot_observed_at":"2026-08-16T16:25:39.563888Z","submitted_at":"2025-08-21T18:03:16Z","title":"VT-LVLM-AR: A Video-Temporal Large Vision-Language Model Adapter for Fine-Grained Action Recognition in Long-Term Videos","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T17:45:23.362858Z"},"links":{"citing_paper":"/paper/2508.15903"},"observation_digest":"sha256:bf3ffacb0b6db86ec8e2bbaa83c42b4625bf487e69b9079bbad0b9a463bd0626","observation_id":"75379562-ca53-4ae5-9323-5bcc340240f1","resolution":{"observed_at":"2026-08-05T17:45:23.362858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:45:28.561001Z","title":"Lvlm-ehub: A comprehensive evaluation bench- mark for large vision-language models,","venue":null,"work_id":"eed29d68-8675-4f49-9eae-b07b4d481edb","year":2025},"citing_paper":{"arxiv_id":"2508.15903","last_updated":"2025-08-21T18:03:16Z","snapshot_observed_at":"2026-08-16T16:25:39.563888Z","submitted_at":"2025-08-21T18:03:16Z","title":"VT-LVLM-AR: A Video-Temporal Large Vision-Language Model Adapter for Fine-Grained Action Recognition in Long-Term Videos","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T17:45:23.471682Z"},"links":{"citing_paper":"/paper/2508.15903"},"observation_digest":"sha256:800bf11557070483bf3455c40e7e052c16b2b4f77d14f4f42e0f8145a9050ce3","observation_id":"393296a3-aa62-407b-9c96-27bfb523ed99","resolution":{"observed_at":"2026-08-05T17:45:28.625634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:45:23.600178Z","title":"Visual in-context learning for large vision-language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.15903","last_updated":"2025-08-21T18:03:16Z","snapshot_observed_at":"2026-08-16T16:25:39.563888Z","submitted_at":"2025-08-21T18:03:16Z","title":"VT-LVLM-AR: A Video-Temporal Large Vision-Language Model Adapter for Fine-Grained Action Recognition in Long-Term Videos","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T17:45:23.600178Z"},"links":{"citing_paper":"/paper/2508.15903"},"observation_digest":"sha256:5af47c635b0470d6fc38ffff3c9110bebbedc13a3c3fcc67a6db1b616ec40809","observation_id":"b93cb2b3-2c7e-46dc-a229-4e7af91113e1","resolution":{"observed_at":"2026-08-05T17:45:23.600178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:45:23.702577Z","title":"Weak to strong generalization for large language models with multi-capabilities,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.15903","last_updated":"2025-08-21T18:03:16Z","snapshot_observed_at":"2026-08-16T16:25:39.563888Z","submitted_at":"2025-08-21T18:03:16Z","title":"VT-LVLM-AR: A Video-Temporal Large Vision-Language Model Adapter for Fine-Grained Action Recognition in Long-Term Videos","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T17:45:23.702577Z"},"links":{"citing_paper":"/paper/2508.15903"},"observation_digest":"sha256:489afaf1c552fc15ec90134c84ec3e6d478add2a130454395957ccc08b253d95","observation_id":"9f7e4b3b-4da5-4477-ab48-b442500aef50","resolution":{"observed_at":"2026-08-05T17:45:23.702577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:45:28.358914Z","title":"Llava-more: A comparative study of llms and visual backbones for enhanced visual instruction tuning,","venue":null,"work_id":"2cbe052c-3142-4a6d-9565-30a48df7e112","year":2025},"citing_paper":{"arxiv_id":"2508.15903","last_updated":"2025-08-21T18:03:16Z","snapshot_observed_at":"2026-08-16T16:25:39.563888Z","submitted_at":"2025-08-21T18:03:16Z","title":"VT-LVLM-AR: A Video-Temporal Large Vision-Language Model Adapter for Fine-Grained Action Recognition in Long-Term Videos","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T17:45:23.829216Z"},"links":{"citing_paper":"/paper/2508.15903"},"observation_digest":"sha256:92f8017a7e53c93de6f365af40d22311e40946f7b6c96a9279ef4cd38fec64c3","observation_id":"c2c5cd88-7f4b-4abf-a9a9-6be46a81d246","resolution":{"observed_at":"2026-08-05T17:45:28.462300Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:45:28.143393Z","title":"Adaptive prompt: Unlocking the power of visual prompt tuning,","venue":null,"work_id":"4bff299b-4d3a-4d9f-8948-44dde261aeca","year":2025},"citing_paper":{"arxiv_id":"2508.15903","last_updated":"2025-08-21T18:03:16Z","snapshot_observed_at":"2026-08-16T16:25:39.563888Z","submitted_at":"2025-08-21T18:03:16Z","title":"VT-LVLM-AR: A Video-Temporal Large Vision-Language Model Adapter for Fine-Grained Action Recognition in Long-Term Videos","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T17:45:23.958129Z"},"links":{"citing_paper":"/paper/2508.15903"},"observation_digest":"sha256:2587edcdb11b9478fcc7f73a8181da5418a2514e29c215c2c5abd39cda85a1ec","observation_id":"beb377fc-8139-40d5-8afe-405dedf492f2","resolution":{"observed_at":"2026-08-05T17:45:28.243612Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:45:27.978970Z","title":"NTU RGB+D: A large scale dataset for 3d human activity analysis,","venue":null,"work_id":"072313bc-06fa-44e4-bfbc-37b33786a777","year":2016},"citing_paper":{"arxiv_id":"2508.15903","last_updated":"2025-08-21T18:03:16Z","snapshot_observed_at":"2026-08-16T16:25:39.563888Z","submitted_at":"2025-08-21T18:03:16Z","title":"VT-LVLM-AR: A Video-Temporal Large Vision-Language Model Adapter for Fine-Grained Action Recognition in Long-Term Videos","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T17:45:24.084139Z"},"links":{"citing_paper":"/paper/2508.15903"},"observation_digest":"sha256:075dd17a9156d71d23df3380728a61d4ab964f8c2a6d8db1c6516502338105f0","observation_id":"4bdffa8b-4257-4b3c-b07d-b184751a1123","resolution":{"observed_at":"2026-08-05T17:45:28.046819Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:45:24.168894Z","title":"Human action recognition and prediction: A survey,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.15903","last_updated":"2025-08-21T18:03:16Z","snapshot_observed_at":"2026-08-16T16:25:39.563888Z","submitted_at":"2025-08-21T18:03:16Z","title":"VT-LVLM-AR: A Video-Temporal Large Vision-Language Model Adapter for Fine-Grained Action Recognition in Long-Term Videos","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T17:45:24.168894Z"},"links":{"citing_paper":"/paper/2508.15903"},"observation_digest":"sha256:149640870c830383d92d36b414c42091350b2e2d876fe5309534dbd172c08ff3","observation_id":"4e6dc61f-30be-4c19-9a88-f3b716458e0a","resolution":{"observed_at":"2026-08-05T17:45:24.168894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:45:27.811586Z","title":"A comprehensive study of deep video action recognition,","venue":null,"work_id":"8088ce61-8947-45d7-a6ef-ad0cc767f669","year":2020},"citing_paper":{"arxiv_id":"2508.15903","last_updated":"2025-08-21T18:03:16Z","snapshot_observed_at":"2026-08-16T16:25:39.563888Z","submitted_at":"2025-08-21T18:03:16Z","title":"VT-LVLM-AR: A Video-Temporal Large Vision-Language Model Adapter for Fine-Grained Action Recognition in Long-Term Videos","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T17:45:24.257880Z"},"links":{"citing_paper":"/paper/2508.15903"},"observation_digest":"sha256:74ad9676856c268068eddf1b5216de29c15c7f8da5c5fcb5910ebbed10c6fee9","observation_id":"2361002e-23bb-49df-8111-06a8d05a507e","resolution":{"observed_at":"2026-08-05T17:45:27.884575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:45:27.692981Z","title":"Action recognition based on efficient deep feature learning in the spatio-temporal domain,","venue":null,"work_id":"5cccc4a8-1b1c-4d75-b590-273e8167e730","year":2016},"citing_paper":{"arxiv_id":"2508.15903","last_updated":"2025-08-21T18:03:16Z","snapshot_observed_at":"2026-08-16T16:25:39.563888Z","submitted_at":"2025-08-21T18:03:16Z","title":"VT-LVLM-AR: A Video-Temporal Large Vision-Language Model Adapter for Fine-Grained Action Recognition in Long-Term Videos","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T17:45:24.356694Z"},"links":{"citing_paper":"/paper/2508.15903"},"observation_digest":"sha256:2b56ba6edf27e22cd2f9574bbd1179ff0c5ce5f1ea7763b62b3eb2e55b16a36e","observation_id":"79808f44-f637-4276-a7fe-b7fa2f194032","resolution":{"observed_at":"2026-08-05T17:45:27.720535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:45:24.437028Z","title":"Cross-fiber spatial-temporal co-enhanced networks for video action recognition,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.15903","last_updated":"2025-08-21T18:03:16Z","snapshot_observed_at":"2026-08-16T16:25:39.563888Z","submitted_at":"2025-08-21T18:03:16Z","title":"VT-LVLM-AR: A Video-Temporal Large Vision-Language Model Adapter for Fine-Grained Action Recognition in Long-Term Videos","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T17:45:24.437028Z"},"links":{"citing_paper":"/paper/2508.15903"},"observation_digest":"sha256:5c138a7bb9ded62fa3d0d6eb8d75f7e574f13f5860005ca987db2604c3606694","observation_id":"e7ebe177-7957-4a59-a98a-6e0c5f04b272","resolution":{"observed_at":"2026-08-05T17:45:24.437028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:45:24.563094Z","title":"Mutually reinforced spatio-temporal convolutional tube for human action recognition","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.15903","last_updated":"2025-08-21T18:03:16Z","snapshot_observed_at":"2026-08-16T16:25:39.563888Z","submitted_at":"2025-08-21T18:03:16Z","title":"VT-LVLM-AR: A Video-Temporal Large Vision-Language Model Adapter for Fine-Grained Action Recognition in Long-Term Videos","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T17:45:24.563094Z"},"links":{"citing_paper":"/paper/2508.15903"},"observation_digest":"sha256:ce8f4ba3abb94aa6ff1fba4319bb8a4a1a771b8de3e3f8da839e2342411e1b5c","observation_id":"d38b2284-ef73-454c-8d50-24c3e7f36bde","resolution":{"observed_at":"2026-08-05T17:45:24.563094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:45:24.625203Z","title":"Multi-scale spatial- temporal integration convolutional tube for human action recognition,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.15903","last_updated":"2025-08-21T18:03:16Z","snapshot_observed_at":"2026-08-16T16:25:39.563888Z","submitted_at":"2025-08-21T18:03:16Z","title":"VT-LVLM-AR: A Video-Temporal Large Vision-Language Model Adapter for Fine-Grained Action Recognition in Long-Term Videos","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T17:45:24.625203Z"},"links":{"citing_paper":"/paper/2508.15903"},"observation_digest":"sha256:4ddea4e82da02f34535b51ff86adbfb035e330787089dc143ec01ce67b364b61","observation_id":"1b2ad58e-545b-4a36-8881-17ec5cec0e07","resolution":{"observed_at":"2026-08-05T17:45:24.625203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:45:27.487936Z","title":"Long-term temporal convolutions for action recognition,","venue":null,"work_id":"353f67b8-71b1-4de5-889d-73c4791dee78","year":2018},"citing_paper":{"arxiv_id":"2508.15903","last_updated":"2025-08-21T18:03:16Z","snapshot_observed_at":"2026-08-16T16:25:39.563888Z","submitted_at":"2025-08-21T18:03:16Z","title":"VT-LVLM-AR: A Video-Temporal Large Vision-Language Model Adapter for Fine-Grained Action Recognition in Long-Term Videos","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T17:45:24.707195Z"},"links":{"citing_paper":"/paper/2508.15903"},"observation_digest":"sha256:b7b435d332f5bab2ec9113638f124a27ca06e34cc730c9a3515b9cb320891c47","observation_id":"5a6e302f-a6d6-43c0-a56b-c4ee621fe105","resolution":{"observed_at":"2026-08-05T17:45:27.583506Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:45:27.265289Z","title":"Finegym: A hierarchical video dataset for fine-grained action understanding,","venue":null,"work_id":"a4b92b00-60c4-4ab3-bd8c-680042808d7c","year":2020},"citing_paper":{"arxiv_id":"2508.15903","last_updated":"2025-08-21T18:03:16Z","snapshot_observed_at":"2026-08-16T16:25:39.563888Z","submitted_at":"2025-08-21T18:03:16Z","title":"VT-LVLM-AR: A Video-Temporal Large Vision-Language Model Adapter for Fine-Grained Action Recognition in Long-Term Videos","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T17:45:24.810896Z"},"links":{"citing_paper":"/paper/2508.15903"},"observation_digest":"sha256:d7f3f90bbd511c9b34fddcc1ec214215dc5a0cbce5e5b5d9d84675c3ee3ed666","observation_id":"ec2b4758-7c2f-4a5c-9952-0cd638e80b82","resolution":{"observed_at":"2026-08-05T17:45:27.375395Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:45:27.044252Z","title":"End-to-end video-level representation learning for action recognition,","venue":null,"work_id":"47a7f86c-d7ca-4a30-abe7-cbcef5836341","year":2018},"citing_paper":{"arxiv_id":"2508.15903","last_updated":"2025-08-21T18:03:16Z","snapshot_observed_at":"2026-08-16T16:25:39.563888Z","submitted_at":"2025-08-21T18:03:16Z","title":"VT-LVLM-AR: A Video-Temporal Large Vision-Language Model Adapter for Fine-Grained Action Recognition in Long-Term Videos","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T17:45:24.875343Z"},"links":{"citing_paper":"/paper/2508.15903"},"observation_digest":"sha256:f7bf1355d82a9c7ba1506a01711bae5e45cfa200406b1830875a7746ef0e8d6a","observation_id":"6cc55d62-1891-4051-8279-ad907b4c8366","resolution":{"observed_at":"2026-08-05T17:45:27.153608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:45:26.854165Z","title":"Stnet: Local and global spatial-temporal modeling for action recogni- tion,","venue":null,"work_id":"95d3deef-e8f8-4c2e-9c11-52859463b7fe","year":2019},"citing_paper":{"arxiv_id":"2508.15903","last_updated":"2025-08-21T18:03:16Z","snapshot_observed_at":"2026-08-16T16:25:39.563888Z","submitted_at":"2025-08-21T18:03:16Z","title":"VT-LVLM-AR: A Video-Temporal Large Vision-Language Model Adapter for Fine-Grained Action Recognition in Long-Term Videos","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T17:45:24.943847Z"},"links":{"citing_paper":"/paper/2508.15903"},"observation_digest":"sha256:55892f6b10d750ec6f4a8aa515ede15197584576f6b9e5db088447dea2d09eba","observation_id":"9ba7246f-d83e-48b7-9661-d24dd9c51378","resolution":{"observed_at":"2026-08-05T17:45:26.955176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:45:26.670415Z","title":"A survey on efficient vision-language models,","venue":null,"work_id":"c4ab43c4-ec29-404c-a9c1-d03406d22518","year":2025},"citing_paper":{"arxiv_id":"2508.15903","last_updated":"2025-08-21T18:03:16Z","snapshot_observed_at":"2026-08-16T16:25:39.563888Z","submitted_at":"2025-08-21T18:03:16Z","title":"VT-LVLM-AR: A Video-Temporal Large Vision-Language Model Adapter for Fine-Grained Action Recognition in Long-Term Videos","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T17:45:25.030702Z"},"links":{"citing_paper":"/paper/2508.15903"},"observation_digest":"sha256:982f269043befa18f83cc924f0d70418065b913bba41690186fe5540114fc5ef","observation_id":"f36d86e0-9f0b-4436-b838-d6922f39f59e","resolution":{"observed_at":"2026-08-05T17:45:26.739960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:45:26.503591Z","title":"Cheap and quick: Efficient vision-language instruction tuning for large language models,","venue":null,"work_id":"7e31fa29-3bb8-478f-b726-720e29f00b1f","year":2023},"citing_paper":{"arxiv_id":"2508.15903","last_updated":"2025-08-21T18:03:16Z","snapshot_observed_at":"2026-08-16T16:25:39.563888Z","submitted_at":"2025-08-21T18:03:16Z","title":"VT-LVLM-AR: A Video-Temporal Large Vision-Language Model Adapter for Fine-Grained Action Recognition in Long-Term Videos","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T17:45:25.141410Z"},"links":{"citing_paper":"/paper/2508.15903"},"observation_digest":"sha256:0f8964d039414d4c8d63fe41737268be7cde50bbb6ff0e1b46b75fadf2eef360","observation_id":"60923db0-71b2-4be5-a736-e99c2b677598","resolution":{"observed_at":"2026-08-05T17:45:26.578959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:45:26.300000Z","title":"PEFT A2Z: parameter-efficient fine-tuning survey for large language and vision models,","venue":null,"work_id":"eaf6b551-2c9c-415f-b365-7225b00d5608","year":2025},"citing_paper":{"arxiv_id":"2508.15903","last_updated":"2025-08-21T18:03:16Z","snapshot_observed_at":"2026-08-16T16:25:39.563888Z","submitted_at":"2025-08-21T18:03:16Z","title":"VT-LVLM-AR: A Video-Temporal Large Vision-Language Model Adapter for Fine-Grained Action Recognition in Long-Term Videos","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T17:45:25.221123Z"},"links":{"citing_paper":"/paper/2508.15903"},"observation_digest":"sha256:5628868f29ff50ef2a14f6a885d35f8c69a4abc90fc10e0e3d3c95ca88a694f2","observation_id":"5ea32719-ee71-46ea-b40b-b0638e01085c","resolution":{"observed_at":"2026-08-05T17:45:26.404939Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:45:26.115345Z","title":"Visualgpt: Data- efficient adaptation of pretrained language models for image captioning,","venue":null,"work_id":"07b2b54d-17ad-490c-9931-c75263b8ef34","year":2022},"citing_paper":{"arxiv_id":"2508.15903","last_updated":"2025-08-21T18:03:16Z","snapshot_observed_at":"2026-08-16T16:25:39.563888Z","submitted_at":"2025-08-21T18:03:16Z","title":"VT-LVLM-AR: A Video-Temporal Large Vision-Language Model Adapter for Fine-Grained Action Recognition in Long-Term Videos","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T17:45:25.317266Z"},"links":{"citing_paper":"/paper/2508.15903"},"observation_digest":"sha256:8796cc3d63a3bf54ed0e5f64658146efa1e8f3c5b1fa643df95d36146a31589d","observation_id":"fa2bd55c-8085-4894-a159-46f8e5e017c8","resolution":{"observed_at":"2026-08-05T17:45:26.204200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:45:25.915407Z","title":"Multi-modal large language models are effective vision learners,","venue":null,"work_id":"fe833356-e26f-4fe8-a06b-263e7a81f511","year":2025},"citing_paper":{"arxiv_id":"2508.15903","last_updated":"2025-08-21T18:03:16Z","snapshot_observed_at":"2026-08-16T16:25:39.563888Z","submitted_at":"2025-08-21T18:03:16Z","title":"VT-LVLM-AR: A Video-Temporal Large Vision-Language Model Adapter for Fine-Grained Action Recognition in Long-Term Videos","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T17:45:25.381519Z"},"links":{"citing_paper":"/paper/2508.15903"},"observation_digest":"sha256:c6ca447e30063ebd968f96dde23c067af618ee2acbed394d469bd38f44e20ed6","observation_id":"ed8435e0-1800-4210-b87d-c91cf362d305","resolution":{"observed_at":"2026-08-05T17:45:25.997782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01377","last_updated":"2025-06-02T09:56:36Z","snapshot_observed_at":"2026-08-16T16:25:00.729157Z","submitted_at":"2025-01-02T17:37:20Z","title":"Improving Medical Large Vision-Language Models with Abnormal-Aware Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01377","snapshot_observed_at":"2026-08-05T17:45:25.477587Z","title":"Improving medical large vision- language models with abnormal-aware feedback,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.15903","last_updated":"2025-08-21T18:03:16Z","snapshot_observed_at":"2026-08-16T16:25:39.563888Z","submitted_at":"2025-08-21T18:03:16Z","title":"VT-LVLM-AR: A Video-Temporal Large Vision-Language Model Adapter for Fine-Grained Action Recognition in Long-Term Videos","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T17:45:25.477587Z"},"links":{"cited_paper":"/paper/2501.01377","citing_paper":"/paper/2508.15903"},"observation_digest":"sha256:a8461e791cc5e374a8ee2c132ea26e19a5a9810d2bc78ecba9ac86c5b92b1d97","observation_id":"1280096c-bfe2-4c67-938d-9ca493b7f1bb","resolution":{"observed_at":"2026-08-05T17:45:25.477587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:45:25.723971Z","title":"Aligngpt: Multi-modal large language models with adaptive alignment capability,","venue":null,"work_id":"462a7f37-f765-47d4-b05e-3d4b193d7b82","year":2024},"citing_paper":{"arxiv_id":"2508.15903","last_updated":"2025-08-21T18:03:16Z","snapshot_observed_at":"2026-08-16T16:25:39.563888Z","submitted_at":"2025-08-21T18:03:16Z","title":"VT-LVLM-AR: A Video-Temporal Large Vision-Language Model Adapter for Fine-Grained Action Recognition in Long-Term Videos","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T17:45:25.588833Z"},"links":{"citing_paper":"/paper/2508.15903"},"observation_digest":"sha256:19664fff9034d3258d5bf5bf7d496edb2128b8dc25aaefbe491f58b38d526a72","observation_id":"0e97a3f1-20f4-44d3-a72d-793938ec7988","resolution":{"observed_at":"2026-08-05T17:45:25.836109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.15903","last_updated":"2025-08-21T18:03:16Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T16:25:39.563888Z","submitted_at":"2025-08-21T18:03:16Z","title":"VT-LVLM-AR: A Video-Temporal Large Vision-Language Model Adapter for Fine-Grained Action Recognition in Long-Term Videos"},"reference_resolution":{"displayed":27,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":8,"verified_exact":0,"verified_fuzzy":19},"total_outbound_references":27},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 27 of 27 outbound references and 0 inbound Pith citation observations for arXiv:2508.15903."}