Pith. sign in

Paper Citation Record · LEDGER

VideoLLM Benchmarks and Evaluation: A Survey

As of 21 August 2026, this Paper Citation Record lists 77 of 77 outbound references and 0 inbound Pith citation observations for arXiv:2505.03829.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2505.03829 v1

Coverage vector

measured 77 of 77 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-16T04:10:57.491105Z

measured 77 of 77 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-20T06:33:59.587034+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

77 of 77 outbound references displayed

  • verified exact1
  • verified fuzzy49
  • unresolved27
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 0457cecf-8f81-4e45-bb37-3fb973083e06 · outbound

This paper cites Frozen i n time: A joint video and image encoder for end-to-end retriev al,.

VideoLLM Benchmarks and Evaluation: A Survey Frozen i n time: A joint video and image encoder for end-to-end retriev al,

Reference 1

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T04:10:58.703017Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-16T04:10:57.208332Z digest=sha256:89d8c42af4801f936a88aafa3c1cdb238a6ea2d2e476911dd1d06de0fd27325e

Observation 08461a35-ad1d-4559-8d15-2fd6d89cff1a · outbound

This paper cites Scale invariant feature transform,.

VideoLLM Benchmarks and Evaluation: A Survey Scale invariant feature transform,

Reference 2

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T04:10:58.691096Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-16T04:10:57.212724Z digest=sha256:a882a80d06bbba09f0955625bbded08c52c520c5a211cc7f6c20587603f19879

Observation f47cd2e7-f2a0-4bea-82c1-7e31ea624775 · outbound

This paper cites Speeded-u p ro- bust features (surf),.

VideoLLM Benchmarks and Evaluation: A Survey Speeded-u p ro- bust features (surf),

Reference 3

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T04:10:58.678497Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-16T04:10:57.216370Z digest=sha256:8e08a179daf131ca9862d85638a753b4029ff14061f6ae30c0b5ebda3da6a028

Observation d9163e71-2ed7-4c94-a706-223aa3952cf9 · outbound

This paper cites Histograms of oriented gradient s for human detection,.

VideoLLM Benchmarks and Evaluation: A Survey Histograms of oriented gradient s for human detection,

Reference 4

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T04:10:58.665742Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-16T04:10:57.220205Z digest=sha256:3b834e1da20edf949bb8733d5656613f5addd256febec263b84a68520a2b4b26

Observation c413d45f-92cf-49bd-8da6-6fbfd18877e0 · outbound

This paper cites Large-scale video classification with conv olu- tional neural networks,.

VideoLLM Benchmarks and Evaluation: A Survey Large-scale video classification with conv olu- tional neural networks,

Reference 5

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T04:10:58.651998Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-16T04:10:57.223893Z digest=sha256:8912bd312022890d2522e5d29bf9d202106dfc7d4a7b21d43989ba0bace7d28a

Observation 3be2e011-c426-4941-bea1-b8889489d7e1 · outbound

This paper cites Convoluti onal two-stream network fusion for video action recognition,.

VideoLLM Benchmarks and Evaluation: A Survey Convoluti onal two-stream network fusion for video action recognition,

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T04:10:58.640500Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-16T04:10:57.227558Z digest=sha256:12ddd4a901fbab7f745f4d778f3281aa16ddbb12aa8ffdd40b08e8155905b81e

Observation 7a15fdf0-f206-4377-9ab6-0c3dfe524e7c · outbound

This paper cites Videobert: A joint model for video and language representa - tion learning,.

VideoLLM Benchmarks and Evaluation: A Survey Videobert: A joint model for video and language representa - tion learning,

Reference 7

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T04:10:58.628095Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-16T04:10:57.231096Z digest=sha256:96d1cc627af0fd1f0741d518a88255c8cc4416e94db5ffac821e53669d3d8009

Observation cc9c0b22-75d0-42a1-9682-af326be4f67b · outbound

This paper cites Videomae: Masked autoencoders are data-efficient learners for self-supervi sed video pre-training,.

VideoLLM Benchmarks and Evaluation: A Survey Videomae: Masked autoencoders are data-efficient learners for self-supervi sed video pre-training,

Reference 8

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T04:10:58.615844Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-16T04:10:57.235248Z digest=sha256:74eef7f95322e4051ca70b1b7ed03102699ff0066e5bc78955b0991612038320

Observation b3cbbc0d-6946-45bb-b1f7-40f56455398b · outbound

This paper cites Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding.

VideoLLM Benchmarks and Evaluation: A Survey Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-16T04:10:57.238581Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:10:57.238581Z digest=sha256:770d216eb4ab2f31703c8637beb348d93cee5435fad34209977afc89a1cbe3ef

Observation 41a4c077-2842-4e92-b2c1-95f2903988ef · outbound

This paper cites VideoChat: Chat-Centric Video Understanding.

VideoLLM Benchmarks and Evaluation: A Survey VideoChat: Chat-Centric Video Understanding

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-16T04:10:57.242459Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:10:57.242459Z digest=sha256:16d924419e17ab4b8af30d8835f934bb486e27b93ed9885b2f0d51400bf8ed7a

Observation 30905b2d-f513-41b6-a5b6-a3fb1bc79228 · outbound

This paper cites Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models.

VideoLLM Benchmarks and Evaluation: A Survey Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-16T04:10:57.246180Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:10:57.246180Z digest=sha256:9887d61d3baed0ab90d863fbb4c1723d445fdee6f71e58f1557ae2ab73421c31

Observation 7ffd5089-4f02-4cc0-9353-71b6d8632fed · outbound

This paper cites Video understanding with large language models: A survey,.

VideoLLM Benchmarks and Evaluation: A Survey Video understanding with large language models: A survey,

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-16T04:10:57.250137Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:10:57.250137Z digest=sha256:9c2d9c6baa51cca2abf865193ad54b42808422161cc55e74b0d6a363a3dc1f4f

Observation 9a52db01-2d9f-4b38-850f-5d805656a4a6 · outbound

This paper cites Video question answering via gradually refined attention o ver appearance and motion,.

VideoLLM Benchmarks and Evaluation: A Survey Video question answering via gradually refined attention o ver appearance and motion,

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T04:10:58.602266Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-16T04:10:57.253389Z digest=sha256:e96d08ee2166dc68cef4bd105b94f64cc826f05502f001c87363bf047dd5b9cc

Observation 0c4efde5-f176-4d14-9ce3-6a915556c71a · outbound

This paper cites Tgif-qa: Toward spatio-temporal reasoning in visual question answering,.

VideoLLM Benchmarks and Evaluation: A Survey Tgif-qa: Toward spatio-temporal reasoning in visual question answering,

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T04:10:58.590327Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-16T04:10:57.256649Z digest=sha256:8f00ab1a6de4bbac2a994bb77fcbfb7ebe9393df9abd4b6a3874fb3924692058

Observation 0af542e8-025b-4f0c-9876-975dac7eafbd · outbound

This paper cites Activitynet-qa: A dataset for understanding complex web videos via question answering,.

VideoLLM Benchmarks and Evaluation: A Survey Activitynet-qa: A dataset for understanding complex web videos via question answering,

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T04:10:58.577932Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-16T04:10:57.259980Z digest=sha256:6356e1728ed9e85b290fa37b80080cda4d9faf8992c564f3eebda70a80a46efa

Observation 989723b7-7e4a-43e2-8960-6215ec44ad74 · outbound

This paper cites Tvqa: Localized , compositional video question answering,.

VideoLLM Benchmarks and Evaluation: A Survey Tvqa: Localized , compositional video question answering,

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T04:10:58.564643Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-16T04:10:57.263310Z digest=sha256:01845919671ba5d3b37cf07af3ee83495daab603e33bc0c15a71df51ae7f485f

Observation a7584a48-4dff-44f8-b212-2f08c75fafcc · outbound

This paper cites Mvbench: A comprehensive multi-modal video understanding benchmark,.

VideoLLM Benchmarks and Evaluation: A Survey Mvbench: A comprehensive multi-modal video understanding benchmark,

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T04:10:58.552326Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-16T04:10:57.266599Z digest=sha256:3a9933c268ade8b9cc4022f7f8eea22b60f9a0c80de35016771b907f34943e1f

Observation c5e18990-fa29-4d29-abe7-3ec904d7cc23 · outbound

This paper cites Video-Bench: A Comprehensive Benchmark and Toolkit for Evaluating Video-based Large Language Models.

VideoLLM Benchmarks and Evaluation: A Survey Video-Bench: A Comprehensive Benchmark and Toolkit for Evaluating Video-based Large Language Models

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-16T04:10:57.270051Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:10:57.270051Z digest=sha256:5266bb388c8fa293e0387d9dc6ed14885190c1f61bfd97bb0b7b50c0c8b78b40

Observation 7827d522-bce2-400e-8df6-f4151b52fb7f · outbound

This paper cites VideoVista: A Versatile Benchmark for Video Understanding and Reasoning.

VideoLLM Benchmarks and Evaluation: A Survey VideoVista: A Versatile Benchmark for Video Understanding and Reasoning

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-16T04:10:57.273744Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:10:57.273744Z digest=sha256:e057cc17193291500562bdbbe6859e1b5a72b7e127caff607b72251785774e8e

Observation c93d0d5f-e557-431d-a3fc-a6eb6398a25a · outbound

This paper cites CinePile: A Long Video Question Answering Dataset and Benchmark.

VideoLLM Benchmarks and Evaluation: A Survey CinePile: A Long Video Question Answering Dataset and Benchmark

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-16T04:10:57.278096Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:10:57.278096Z digest=sha256:e9c11a2754eada3fb060141d28e3ef3ae64721a6827819d6444b31d856e30b31

Observation 2f64fe3f-2e34-4a4d-a9d6-34680788f4f0 · outbound

This paper cites Infinibench: A comprehensive benchmark for large multimodal models in very long video understanding,.

VideoLLM Benchmarks and Evaluation: A Survey Infinibench: A comprehensive benchmark for large multimodal models in very long video understanding,

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-16T04:10:57.281659Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:10:57.281659Z digest=sha256:31b6c0e115fd3ad216fc5bdc8d12949d0a50a9e5dd5df637992a960f3431dbbb

Observation e5c30a6e-22c3-471e-9472-771585ae9e31 · outbound

This paper cites TempCompass: Do Video LLMs Really Understand Videos?.

VideoLLM Benchmarks and Evaluation: A Survey TempCompass: Do Video LLMs Really Understand Videos?

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-16T04:10:57.285229Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:10:57.285229Z digest=sha256:20af86cbe7c147a627f71cd12ba72c78c6c7ebcc70b4dcf83635504245beec51

Observation 9af3a1e1-5d5b-44c1-aca3-b62ad2d63219 · outbound

This paper cites Her o: Hierarchical encoder for video+ language omni-representa tion pre-training,.

VideoLLM Benchmarks and Evaluation: A Survey Her o: Hierarchical encoder for video+ language omni-representa tion pre-training,

Reference 23

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T04:10:58.539725Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-16T04:10:57.288735Z digest=sha256:8ed4f465de7ae74f77d4f40bca0a048cecffcd5a77ee714956460b029502661a

Observation a38e6837-e11d-4e71-910b-0a895c294139 · outbound

This paper cites Star: A benchmark for situated reasonin g in real-world videos,.

VideoLLM Benchmarks and Evaluation: A Survey Star: A benchmark for situated reasonin g in real-world videos,

Reference 24

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T04:10:58.527959Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-16T04:10:57.292147Z digest=sha256:7025c83bbc7e17fa4e192b6de2ebe7158526a68bf0dae3353d1eb798451cfad2

Observation 2942772e-a2f3-4211-b5d8-6c2a222f5199 · outbound

This paper cites EgoSchema: A Diagnostic Benchmark for Very Long-form Video Language Understanding.

VideoLLM Benchmarks and Evaluation: A Survey EgoSchema: A Diagnostic Benchmark for Very Long-form Video Language Understanding

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-16T04:10:57.295597Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:10:57.295597Z digest=sha256:523ea0d04f48c2d867a480c49851ca38fef8039cf5d5ae23ad4a099ba48feb2d

Observation 53072aab-6734-4f68-9aa4-25c5fdc9f789 · outbound

This paper cites Autoeval-video : An automatic benchmark for assessing large vision language mo d- els in open-ended video question answering,.

VideoLLM Benchmarks and Evaluation: A Survey Autoeval-video : An automatic benchmark for assessing large vision language mo d- els in open-ended video question answering,

Reference 26

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T04:10:58.515745Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-16T04:10:57.299508Z digest=sha256:7b724f838a999c2ac5b89a58417208fa8adabee1f30540742966588341d035f4

Observation cdde5b75-7588-402e-a959-a055637c308a · outbound

This paper cites Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis.

VideoLLM Benchmarks and Evaluation: A Survey Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-16T04:10:57.302910Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:10:57.302910Z digest=sha256:0c77b7fcb94a794ce3abbd02988ba3841376f41eb1e44f95b484eeee2a9de2e2

Observation 1ffb5038-5031-4671-9b6f-8c6c32ed87b6 · outbound

This paper cites Sok-bench: A situated video reasoning bench - mark with aligned open-world knowledge,.

VideoLLM Benchmarks and Evaluation: A Survey Sok-bench: A situated video reasoning bench - mark with aligned open-world knowledge,

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T04:10:58.502546Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-16T04:10:57.306568Z digest=sha256:abf287ec9d0566d39d3cff813743c5948b8d674b63afa1f80354f7caef173647

Observation 96461d7b-a7ae-465d-9552-ea619cb64dde · outbound

This paper cites Long Story Short: Story-level Video Understanding from 20K Short Films.

VideoLLM Benchmarks and Evaluation: A Survey Long Story Short: Story-level Video Understanding from 20K Short Films

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-16T04:10:57.310180Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:10:57.310180Z digest=sha256:8bad445c9f0c8c9c56d7c4119465d8eb5b464163bf99f21db76f1257985fd02e

Observation e7847b22-1578-4fe9-9df3-5e32153a7437 · outbound

This paper cites MLVU: Benchmarking Multi-task Long Video Understanding.

VideoLLM Benchmarks and Evaluation: A Survey MLVU: Benchmarking Multi-task Long Video Understanding

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-16T04:10:57.313889Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:10:57.313889Z digest=sha256:bdb97cc4e11d968c10d3503e2b86e474ff02346842d258a03bd59497215166ac

Observation bb73934b-8e76-4fc1-ad34-f7ff3b48399b · outbound

This paper cites MMWorld: Towards Multi-discipline Multi-faceted World Model Evaluation in Videos.

VideoLLM Benchmarks and Evaluation: A Survey MMWorld: Towards Multi-discipline Multi-faceted World Model Evaluation in Videos

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-16T04:10:57.317505Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:10:57.317505Z digest=sha256:e1984f94b9d744468dcc20da7ea0d22533b6e7a1fa08584b2b7d3aeeff26e116

Observation 26e35818-4686-46ba-bc00-b8fa21d25181 · outbound

This paper cites VELOCITI: Benchmarking Video-Language Compositional Reasoning with Strict Entailment.

VideoLLM Benchmarks and Evaluation: A Survey VELOCITI: Benchmarking Video-Language Compositional Reasoning with Strict Entailment

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-16T04:10:57.321005Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:10:57.321005Z digest=sha256:c6de894faf0ab0e6285856d64294944882d141e78c76af33f764e3852c40a0a9

Observation 3f093539-0a41-4e41-8255-28fbf86fa408 · outbound

This paper cites Next-qa: Next phase of question-answering to explaining temporal action s,.

VideoLLM Benchmarks and Evaluation: A Survey Next-qa: Next phase of question-answering to explaining temporal action s,

Reference 33

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T04:10:58.490657Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-16T04:10:57.325091Z digest=sha256:de252ac73e708975f85e5742fd0764141b1f76df0d8f5ca13b9c641366abc984

Observation 4ff75dd1-8b15-4161-9509-23de8554df3d · outbound

This paper cites Beyond Raw Videos: Understanding Edited Videos with Large Multimodal Model.

VideoLLM Benchmarks and Evaluation: A Survey Beyond Raw Videos: Understanding Edited Videos with Large Multimodal Model

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-16T04:10:57.328774Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:10:57.328774Z digest=sha256:27af85c8f34baefac5309a5f9f084997d168261469db3c6b1292b098551e5308

Observation a0758e65-dd60-454b-98ff-1f843bd22dc0 · outbound

This paper cites Cider : Consensus-based image description evaluation,.

VideoLLM Benchmarks and Evaluation: A Survey Cider : Consensus-based image description evaluation,

Reference 35

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T04:10:58.479156Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-16T04:10:57.332438Z digest=sha256:47d282a871c5b086322a20fd416243d8a0cde22f24427a22cfeacca1eb9261ea

Observation b2f1fe92-9012-40ad-9d96-a9bd2b7d64bb · outbound

This paper cites Meteor: An automatic metric f or mt evaluation with improved correlation with human judgments ,.

VideoLLM Benchmarks and Evaluation: A Survey Meteor: An automatic metric f or mt evaluation with improved correlation with human judgments ,

Reference 36

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T04:10:58.466039Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-16T04:10:57.336309Z digest=sha256:8e6e640fef3d3027e2fcd9485ba53c1dc66e838a8546aa94ca7aac9626195063

Observation 8aaee166-238b-4fa2-97d3-7415a0172be5 · outbound

This paper cites Rouge: A package for automatic evaluation o f summaries,.

VideoLLM Benchmarks and Evaluation: A Survey Rouge: A package for automatic evaluation o f summaries,

Reference 37

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T04:10:58.453481Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-16T04:10:57.340100Z digest=sha256:143b952af54783b57c6ed61f599f9bf52f6b6385cec1591609355e54379143a3

Observation 10154545-9f00-4c87-ac65-3385c473647a · outbound

This paper cites Spi ce: Semantic propositional image caption evaluation,.

VideoLLM Benchmarks and Evaluation: A Survey Spi ce: Semantic propositional image caption evaluation,

Reference 38

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T04:10:58.439700Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-16T04:10:57.343546Z digest=sha256:6e9ed512f87eae194e9797a9e6b28b112a9302bde9d413aaeacabdbce06b3e32

Observation fd49f749-fda1-418d-b0aa-5a11e99e2bac · outbound

This paper cites PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning.

VideoLLM Benchmarks and Evaluation: A Survey PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-16T04:10:57.348050Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:10:57.348050Z digest=sha256:cc2aa17072d90ea72a613746df003e9179e218a16b4111ed5387de46d831ed35

Observation c8bdc7b7-d4f6-42e8-a55c-a5f99ed9d973 · outbound

This paper cites An image grid can be worth a video: Zero-shot video question answering using a vl m,.

VideoLLM Benchmarks and Evaluation: A Survey An image grid can be worth a video: Zero-shot video question answering using a vl m,

Reference 40

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T04:10:58.426279Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-16T04:10:57.351876Z digest=sha256:7512ca659a04a8bccdeeb67216d325132eea963e0ccf1bb8626f53bc1f636cfa

Observation 1551d931-4d42-4c77-a1fa-faee1b5e021d · outbound

This paper cites ST-LLM: Large Language Models Are Effective Temporal Learners.

VideoLLM Benchmarks and Evaluation: A Survey ST-LLM: Large Language Models Are Effective Temporal Learners

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-16T04:10:57.360169Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:10:57.360169Z digest=sha256:1558a1220192c394753c74c04e11295a9cfdf4e4794f642291691572e94aeb72

Observation a25d3613-5ba0-47bf-8b3b-1bf2ccbb4ac0 · outbound

This paper cites Large Language Models Know Your Contextual Search Intent: A Prompting Framework for Conversational Search.

VideoLLM Benchmarks and Evaluation: A Survey Large Language Models Know Your Contextual Search Intent: A Prompting Framework for Conversational Search

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-16T04:10:57.363973Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:10:57.363973Z digest=sha256:5128d22fcffbbdd5d3dceb9d41eab2d16b86c913e94b1bad33d9771127ffc2a4

Observation 97e10699-b042-47b8-bdf9-ceb03bcaac73 · outbound

This paper cites Prompting visual-language models for efficient video understanding,.

VideoLLM Benchmarks and Evaluation: A Survey Prompting visual-language models for efficient video understanding,

Reference 43

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T04:10:58.401414Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-16T04:10:57.367703Z digest=sha256:350aa2e703f6768a1e71f7883d21eed4f9125da7ea61e739d16576dbea5b67e0

Observation 2c694bcf-fb46-454a-a33d-b2ea7fe61535 · outbound

This paper cites Vid2seq: Large-scale pr e- training of a visual language model for dense video captioni ng,.

VideoLLM Benchmarks and Evaluation: A Survey Vid2seq: Large-scale pr e- training of a visual language model for dense video captioni ng,

Reference 44

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T04:10:58.387048Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-16T04:10:57.370935Z digest=sha256:3bcd69cee49cc892d7bde1a31f35be2ba4412cf5fd1656cb293cbbe8b66a7ee2

Observation 7a2d283b-0723-4264-bda1-06c3f4fa4d38 · outbound

This paper cites Lea rning video representations from large language models,.

VideoLLM Benchmarks and Evaluation: A Survey Lea rning video representations from large language models,

Reference 45

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T04:10:58.375575Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-16T04:10:57.374152Z digest=sha256:7d69ec716d3f2e56919c9ec4cf255a82b65a320c52cac5a0cba6d75ba61c31ae

Observation dd2bf198-3261-463e-9b15-da47f779f920 · outbound

This paper cites Text-Video Retrieval with Disentangled Conceptualization and Set-to-Set Alignment.

VideoLLM Benchmarks and Evaluation: A Survey Text-Video Retrieval with Disentangled Conceptualization and Set-to-Set Alignment

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-16T04:10:57.377738Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:10:57.377738Z digest=sha256:35b1e961cd33877a412637993f801c0f37c17a8c023e084f758162ec86c18498

Observation cff9b54f-1fd1-4f1a-b1c0-b7d5f4637841 · outbound

This paper cites DiffusionRet: Generative Text-Video Retrieval with Diffusion Model.

VideoLLM Benchmarks and Evaluation: A Survey DiffusionRet: Generative Text-Video Retrieval with Diffusion Model

Reference 47

Resolution
verified exact
local_arxiv, observed 2026-08-16T04:10:57.621559Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-16T04:10:57.381159Z digest=sha256:50c8a94b77f86250620e53fd294a7858c1473e20fd54db8f383bd211480e6faa

Observation 632fe7bf-dc07-41d9-bc93-a9f8f9c48c9d · outbound

This paper cites Egovlpv2: Egocentric vid eo- language pre-training with fusion in the backbone,.

VideoLLM Benchmarks and Evaluation: A Survey Egovlpv2: Egocentric vid eo- language pre-training with fusion in the backbone,

Reference 48

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T04:10:58.354358Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-16T04:10:57.384947Z digest=sha256:326fc9b6fda30be3530e49fdf295ed7a69c0e8d6bc2fc5ebd4e2e470b2d97ae4

Observation a5c85418-434c-423a-b6db-6a8a8141fbf2 · outbound

This paper cites Large Language Models in Education: Vision and Opportunities.

VideoLLM Benchmarks and Evaluation: A Survey Large Language Models in Education: Vision and Opportunities

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-16T04:10:57.389050Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:10:57.389050Z digest=sha256:f6fa8e62371f6a9a89682ffe84b6879227f1cd9265f754110e59bb81d8441a63

Observation f6de4c2e-beb7-459c-bb93-36834d7552ca · outbound

This paper cites A Survey on Deep Multi-modal Learning for Body Language Recognition and Generation.

VideoLLM Benchmarks and Evaluation: A Survey A Survey on Deep Multi-modal Learning for Body Language Recognition and Generation

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-16T04:10:57.392691Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:10:57.392691Z digest=sha256:8109139da2b81000904925261d24d5e9c7c14730e77c2720ae68ca3c0d3b945e

Observation 8c8c58cb-9c19-452d-b9ac-4f52344f1e7a · outbound

This paper cites Machine translation from signed to spoken lan- guages: State of the art and challenges,.

VideoLLM Benchmarks and Evaluation: A Survey Machine translation from signed to spoken lan- guages: State of the art and challenges,

Reference 51

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T04:10:58.339055Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-16T04:10:57.396186Z digest=sha256:8080540a7705fdee65dbd6d9cc1b3e5d0d69d450f070bf80f49b16113e5ee2e2

Observation 6a583ddb-c0bb-45c5-af0f-16802d2cc2e7 · outbound

This paper cites Generating video game quests from storie s,.

VideoLLM Benchmarks and Evaluation: A Survey Generating video game quests from storie s,

Reference 52

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T04:10:58.325720Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-16T04:10:57.399555Z digest=sha256:49d25003043953f235421b989a88bb19a2b6c1cca70f31d4bb57cafae6a4daa6

Observation 2b6d144f-71e8-4bca-baf9-e27bb6d3d6d5 · outbound

This paper cites Text generation for quests in multiplayer r ole- playing video games,.

VideoLLM Benchmarks and Evaluation: A Survey Text generation for quests in multiplayer r ole- playing video games,

Reference 53

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T04:10:58.313403Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-16T04:10:57.402915Z digest=sha256:b86e51d3386b53ae5a19aa05d6e3d589db6701ed7d73dbdc0ae228c54bca634d

Observation fa00f981-94d5-49b8-bf36-108fb955f490 · outbound

This paper cites The role of artificial intelligence and robotic solution technologies in metaverse design,.

VideoLLM Benchmarks and Evaluation: A Survey The role of artificial intelligence and robotic solution technologies in metaverse design,

Reference 54

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T04:10:58.301198Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-16T04:10:57.406452Z digest=sha256:1fe0ab8f3ef14810abb9ecf2f63e44522b881649ee0cc1bb50709d95df966ee8

Observation 38d1517d-d868-411a-93f5-6e9df3ab346d · outbound

This paper cites Jung and M.

VideoLLM Benchmarks and Evaluation: A Survey Jung and M

Reference 55

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T04:10:58.289191Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-16T04:10:57.409962Z digest=sha256:daa83bfc238145816bfae70b62bf0fcac752d52a94e4dc8be539b042df186951

Observation 03b6e04c-908e-4e08-8cd0-44e0d4ecfe61 · outbound

This paper cites PromptFix: You Prompt and We Fix the Photo.

VideoLLM Benchmarks and Evaluation: A Survey PromptFix: You Prompt and We Fix the Photo

Reference 56

Resolution
unresolved
no resolver link, observed 2026-08-16T04:10:57.414062Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:10:57.414062Z digest=sha256:cd2fcd68cb8e491e62d571d678af5d4f6248784a7181aaae36f8d4430bda33c5

Observation c134139c-ac6a-4450-98f7-d5590369b4a2 · outbound

This paper cites Egocentric audio - visual object localization,.

VideoLLM Benchmarks and Evaluation: A Survey Egocentric audio - visual object localization,

Reference 57

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T04:10:58.277305Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-16T04:10:57.418116Z digest=sha256:ccf8fe098ff4ef9c68b30a1f6fce56c582309fa4f6789a6d86647ba2df3858c7

Observation abc99f2a-1a97-4173-b087-98960b9c1f2a · outbound

This paper cites Misar: A multimodal instructional system with augmented reality,.

VideoLLM Benchmarks and Evaluation: A Survey Misar: A multimodal instructional system with augmented reality,

Reference 58

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T04:10:58.264739Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-16T04:10:57.421836Z digest=sha256:b504a61a7f39d3655b2cfb128eeaa95f9047127209b18fb593d03b871c4665c2

Observation 123e926d-2a69-4728-9ee5-95ae57077aa7 · outbound

This paper cites Sayplan: Grounding large language models using 3d scene graphs for scalable robot task planning,.

VideoLLM Benchmarks and Evaluation: A Survey Sayplan: Grounding large language models using 3d scene graphs for scalable robot task planning,

Reference 59

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T04:10:58.252034Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-16T04:10:57.426486Z digest=sha256:cae9e51be2e6e454250e9dd8d3f20cd0c226bfbd14d15169cde2626295bc1d75

Observation 84041543-f715-41ec-bf3a-d5a94720c217 · outbound

This paper cites The role of chatgpt, generative language models, and artificial intelligence in medical education: a con- versation with chatgpt and a call for papers,.

VideoLLM Benchmarks and Evaluation: A Survey The role of chatgpt, generative language models, and artificial intelligence in medical education: a con- versation with chatgpt and a call for papers,

Reference 60

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T04:10:58.239305Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-16T04:10:57.430221Z digest=sha256:b123ab6f605f35076e900d355645e3b573def56f5d38bfa492e9d9f6305e1357

Observation b699bdf1-e3ec-4f01-b360-88270bb966f3 · outbound

This paper cites Beat: A large-scale semantic and emotional multi-modal dataset for conversational gestures synthesi s,.

VideoLLM Benchmarks and Evaluation: A Survey Beat: A large-scale semantic and emotional multi-modal dataset for conversational gestures synthesi s,

Reference 61

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T04:10:58.225749Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-16T04:10:57.434122Z digest=sha256:05be3fe485928ece3fbba756a6448bd46276980a10a5d76c12110dd198d5bfaf

Observation f21a76c5-1eef-4af4-8019-227a4c0556d3 · outbound

This paper cites Disco: Disentangled implicit content and rhythm learning for diverse co-speech gestures synthesis,.

VideoLLM Benchmarks and Evaluation: A Survey Disco: Disentangled implicit content and rhythm learning for diverse co-speech gestures synthesis,

Reference 62

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T04:10:58.212875Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-16T04:10:57.438175Z digest=sha256:c539c49f33411968eeaedb9e75a109749e530b392eefde2e7ed07d5a4596d4c7

Observation fb50e9a4-e2e1-4316-bc52-5881bca592d5 · outbound

This paper cites Emage: Towards uni- fied holistic co-speech gesture generation via expressive m asked audio gesture modeling,.

VideoLLM Benchmarks and Evaluation: A Survey Emage: Towards uni- fied holistic co-speech gesture generation via expressive m asked audio gesture modeling,

Reference 63

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T04:10:58.198635Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-16T04:10:57.442033Z digest=sha256:a0c56b4190c5e415435995c212bc99d8dd7d9a2dc71ee9dd2a57f1c47101b6b5

Observation 087c594f-de19-4643-8fa2-ac170830ed03 · outbound

This paper cites LLaVA-Med: Training a Large Language-and-Vision Assistant for Biomedicine in One Day.

VideoLLM Benchmarks and Evaluation: A Survey LLaVA-Med: Training a Large Language-and-Vision Assistant for Biomedicine in One Day

Reference 64

Resolution
unresolved
no resolver link, observed 2026-08-16T04:10:57.445714Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:10:57.445714Z digest=sha256:e310091fe230afc846ab895e5dd32b57704bec2d018bdb1fd3ce18103374cd42

Observation 06414b93-953f-4053-9c7d-8f9bec932fbf · outbound

This paper cites Chatgpt for cybersecurity: practical applications, challenges, a nd future directions,.

VideoLLM Benchmarks and Evaluation: A Survey Chatgpt for cybersecurity: practical applications, challenges, a nd future directions,

Reference 65

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T04:10:58.185033Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-16T04:10:57.450162Z digest=sha256:95b58461f1c81393aa8af8bf7e9aff5e9ee0fd9de2b1dbab201a52fa01a45478

Observation 0c1196e5-1cc2-4c52-bc9e-6e5129f94096 · outbound

This paper cites Modelling language for cyber security incide nt handling for critical infrastructures,.

VideoLLM Benchmarks and Evaluation: A Survey Modelling language for cyber security incide nt handling for critical infrastructures,

Reference 66

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T04:10:58.171783Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-16T04:10:57.454103Z digest=sha256:f077a5d522ad5bb9f87b8d5a15ee4b35086708842c89f5bc519d8e02bba3da06

Observation d9c89dbe-87da-40c5-965a-458ee2a764e3 · outbound

This paper cites Socratic video un- derstanding on unmanned aerial vehicles,.

VideoLLM Benchmarks and Evaluation: A Survey Socratic video un- derstanding on unmanned aerial vehicles,

Reference 67

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T04:10:58.159088Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-16T04:10:57.457788Z digest=sha256:89046daf8a58b0e27eda52dda6d189cf4af2aa3df79ba65013c1f339ec4ce765

Observation 337893e5-e600-47d2-901a-5c5eb9b5bce4 · outbound

This paper cites Lanobert: System log anomal y detection based on bert masked language model,.

VideoLLM Benchmarks and Evaluation: A Survey Lanobert: System log anomal y detection based on bert masked language model,

Reference 68

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T04:10:58.146125Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-16T04:10:57.461676Z digest=sha256:3ba4c9fc1e600807da79d0fc46529a49fa49fa879b5136b0ae5f9a4396eb3cda

Observation 9e006d68-503a-4a62-846d-b3740f65e80e · outbound

This paper cites Logfit : Log anomaly detection using fine-tuned language models,.

VideoLLM Benchmarks and Evaluation: A Survey Logfit : Log anomaly detection using fine-tuned language models,

Reference 69

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T04:10:58.132101Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-16T04:10:57.465491Z digest=sha256:3bb33b362b9a46f93d28c4c4a92fd182e36ecdb0cf727bb71c62aaefa6e2a9e1

Observation 51c40cc3-ebe4-498a-bd32-9c912e6b9c82 · outbound

This paper cites GraphGPT: Graph Instruction Tuning for Large Language Models.

VideoLLM Benchmarks and Evaluation: A Survey GraphGPT: Graph Instruction Tuning for Large Language Models

Reference 70

Resolution
unresolved
no resolver link, observed 2026-08-16T04:10:57.469272Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:10:57.469272Z digest=sha256:a85215cf3c711c4f365159b7597b910878d2fbd0e0b366d014a090ee2d2ef2a8

Observation 16a4d9ce-1d6a-4f39-92a9-8840ec38568d · outbound

This paper cites Drive as you speak: Enabling human-like interaction with large lan- guage models in autonomous vehicles,.

VideoLLM Benchmarks and Evaluation: A Survey Drive as you speak: Enabling human-like interaction with large lan- guage models in autonomous vehicles,

Reference 71

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T04:10:58.119702Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-16T04:10:57.473276Z digest=sha256:1fe0da4300b8c34d840e29964779fed49d440ea0026e388c3473a6d94eb8b8f7

Observation 873ee204-4992-4a7a-922b-a62edde51234 · outbound

This paper cites Otter: A Multi-Modal Model with In-Context Instruction Tuning.

VideoLLM Benchmarks and Evaluation: A Survey Otter: A Multi-Modal Model with In-Context Instruction Tuning

Reference 72

Resolution
unresolved
no resolver link, observed 2026-08-16T04:10:57.477036Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:10:57.477036Z digest=sha256:4b5da3c870ea040648e12598b1a1b80be617833e2c7948bd1b827a9ff366debd

Observation 16568131-7681-421b-bfb1-1c9a22c477e4 · outbound

This paper cites LISA: Reasoning Segmentation via Large Language Model.

VideoLLM Benchmarks and Evaluation: A Survey LISA: Reasoning Segmentation via Large Language Model

Reference 73

Resolution
unresolved
no resolver link, observed 2026-08-16T04:10:57.480975Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:10:57.480975Z digest=sha256:037c10617d104de32696a8c5ac1ed78daa9ac2f1464d5c3a7dac8c51946f6915

Observation f2741f88-e54a-40dc-9562-72d60aef8840 · outbound

This paper cites How retail video analytics enhances cust omer experience,.

VideoLLM Benchmarks and Evaluation: A Survey How retail video analytics enhances cust omer experience,

Reference 74

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T04:10:58.106588Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-16T04:10:57.484416Z digest=sha256:8c4655c3213e278dad8da4d6fd3ae4d60b5f4cb6ab3fcaedc89d701bef6e9e8c

Observation 720ed770-7920-462c-9723-62462dbb55b4 · outbound

This paper cites How video analytics is transform ing the luxury retail experience,.

VideoLLM Benchmarks and Evaluation: A Survey How video analytics is transform ing the luxury retail experience,

Reference 75

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T04:10:58.093348Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-16T04:10:57.487821Z digest=sha256:7365e0d51cd43df43e56cfcb9f5556865891a53f75cbc8725902d2617691c8a4

Observation 83ca2291-8e1f-48e6-aa14-dad7416d4a75 · outbound

This paper cites Visual search and its growing influence on e-commerce,.

VideoLLM Benchmarks and Evaluation: A Survey Visual search and its growing influence on e-commerce,

Reference 76

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T04:10:58.079736Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-16T04:10:57.491105Z digest=sha256:15185aa384ae3264f3e40a19488512a886371ffaa437956f13a375a3e37f4944

Observation 34ed7320-45fb-4f0c-8dae-03e4858cd505 · outbound

This paper cites Available: https://arxiv.org/abs/2403.

VideoLLM Benchmarks and Evaluation: A Survey Available: https://arxiv.org/abs/2403

Reference 2024

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T04:10:58.414170Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-16T04:10:57.356168Z digest=sha256:79f7f7f373640a0c7a5f354a49eb89a17bea28295a01e941a32f5abc78cc8d2d

Pith citing papers

No inbound Pith citation observations are available.