Pith. sign in

Paper Citation Record · LEDGER

AutoEval-Video: An Automatic Benchmark for Assessing Large Vision Language Models in Open-Ended Video Question Answering

As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 11 inbound Pith citation observations for arXiv:2311.14906.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2311.14906 v2

Coverage vector

measured 0 of 0 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links

measured 11 of 11 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-09T06:31:02.800959+00:00

measured 11 of 11 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-07T12:45:44.538343Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-05-23T16:58:12.041594Z

Reference resolution

0 of 0 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved0
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

No outbound reference observations are available for this paper version.

Pith citing papers

Observation fd508577-b090-436e-8665-a04db08674df · inbound

TempCompass: Do Video LLMs Really Understand Videos? cites this paper.

TempCompass: Do Video LLMs Really Understand Videos? AutoEval-Video: An Automatic Benchmark for Assessing Large Vision Language Models in Open-Ended Video Question Answering

Reference 77

Resolution
verified exact
arxiv_id, observed 2026-05-17T02:46:16.798635Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=arxiv_source observed=2026-05-17T02:46:16.632743Z digest=sha256:03e5d6d133e9033350de44e29eb4618df3f5ec64ce8fe4c1d1615162eaeb0ecc

Observation 6851c591-6483-4e0f-a6fc-f27d274db70f · inbound

VidHal: Benchmarking Temporal Hallucinations in Vision LLMs cites this paper.

VidHal: Benchmarking Temporal Hallucinations in Vision LLMs AutoEval-Video: An Automatic Benchmark for Assessing Large Vision Language Models in Open-Ended Video Question Answering

Reference 5

Resolution
verified exact
arxiv_id, observed 2026-05-23T16:58:12.044960Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-05-23T16:57:12.821916Z digest=sha256:f1bde8decfa42f0304094c9830f53634226ed3051c7867769ec3d9303e9e6b30

Observation 4ac5d072-6c4a-4676-a54d-b8366ee7b2da · inbound

MotionBench: Benchmarking and Improving Fine-grained Video Motion Understanding for Vision Language Models cites this paper.

MotionBench: Benchmarking and Improving Fine-grained Video Motion Understanding for Vision Language Models AutoEval-Video: An Automatic Benchmark for Assessing Large Vision Language Models in Open-Ended Video Question Answering

Reference 4

Resolution
verified exact
arxiv_id, observed 2026-05-23T05:45:28.290269Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-05-23T05:44:31.546843Z digest=sha256:ff738818cc2387ad8806dd0e5c21e61004645e7e896710e8bfba02cb909bd52c

Observation adcbb1ca-eb72-4683-9220-a3db179f0bc8 · inbound

Video-MMMU: Evaluating Knowledge Acquisition from Multi-Discipline Professional Videos cites this paper.

Video-MMMU: Evaluating Knowledge Acquisition from Multi-Discipline Professional Videos AutoEval-Video: An Automatic Benchmark for Assessing Large Vision Language Models in Open-Ended Video Question Answering

Reference 5

Resolution
verified exact
arxiv_id, observed 2026-05-14T00:32:41.157897Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-05-14T00:32:41.059558Z digest=sha256:8e675fb90ddc3752f71f4e2c08683f53ebd652084ed26b807c44ffff8fe5f90b

Observation 48ded090-d928-45ea-8b60-f677fc3e38e5 · inbound

VF-Eval: Evaluating Multimodal LLMs for Generating Feedback on AIGC Videos cites this paper.

VF-Eval: Evaluating Multimodal LLMs for Generating Feedback on AIGC Videos AutoEval-Video: An Automatic Benchmark for Assessing Large Vision Language Models in Open-Ended Video Question Answering

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-07T12:45:44.538343Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T12:45:44.538343Z digest=sha256:c745092a47d41b377dcf049ede705df9ad5d4bde6bf7e1f44ec9e1c9aadd713e

Observation 29312749-d544-4313-a39f-c76c0a07fece · inbound

Iterative Zoom-In: Temporal Interval Exploration for Long Video Understanding cites this paper.

Iterative Zoom-In: Temporal Interval Exploration for Long Video Understanding AutoEval-Video: An Automatic Benchmark for Assessing Large Vision Language Models in Open-Ended Video Question Answering

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-06T21:59:15.758936Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T21:59:15.758936Z digest=sha256:92912cda54bd49832dfe872946bb467296c8f48dca3e80ff4ea34157629665eb

Observation d34b630c-e942-4ef4-8a8a-0d5a9c2c5151 · inbound

GLIMPSE: Do Large Vision-Language Models Truly Think With Videos or Just Glimpse at Them? cites this paper.

GLIMPSE: Do Large Vision-Language Models Truly Think With Videos or Just Glimpse at Them? AutoEval-Video: An Automatic Benchmark for Assessing Large Vision Language Models in Open-Ended Video Question Answering

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-06T17:58:27.085682Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T17:58:27.085682Z digest=sha256:b04be5d9d84136a40427b5b409fed24664e1f2bda21e7411193b13ad4aacaac1

Observation 15aa2a3b-5e70-45df-922d-dd1d97003e78 · inbound

AURA: A Fine-Grained Benchmark and Decomposed Metric for Audio-Visual Reasoning cites this paper.

AURA: A Fine-Grained Benchmark and Decomposed Metric for Audio-Visual Reasoning AutoEval-Video: An Automatic Benchmark for Assessing Large Vision Language Models in Open-Ended Video Question Answering

Reference 2022

Resolution
unresolved
no resolver link, observed 2026-08-05T22:09:14.941204Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T22:09:14.941204Z digest=sha256:9f482ca3c6ca1478bb5f8c9aaa8e2d02a37b49599277408a6196a6b0451e79b4

Observation f00fbaaa-f3e7-4a16-bfad-882965ba957d · inbound

AdsQA: Towards Advertisement Video Understanding cites this paper.

AdsQA: Towards Advertisement Video Understanding AutoEval-Video: An Automatic Benchmark for Assessing Large Vision Language Models in Open-Ended Video Question Answering

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-04T20:20:36.673624Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T20:20:36.673624Z digest=sha256:ddae18f739b21c7f4b4eafe98989f6e2c761bff40278894b57d112a0976ff25b

Observation cd3f0892-6c73-48f1-889a-4904043f5d95 · inbound

VideoThinker: Building Agentic VideoLLMs with LLM-Guided Tool Reasoning cites this paper.

VideoThinker: Building Agentic VideoLLMs with LLM-Guided Tool Reasoning AutoEval-Video: An Automatic Benchmark for Assessing Large Vision Language Models in Open-Ended Video Question Answering

Reference 3

Resolution
verified exact
arxiv_id, observed 2026-05-16T12:17:51.920232Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-05-16T12:17:42.135851Z digest=sha256:6d4d649875fccce82457d0c05adaaf1548a1ba0683211ce3b2a232fbe7342182

Observation 094e8e61-1e43-49b3-81c5-8f1d23def8a5 · inbound

Toward Annotation-Efficient Continuous Emotion Arousal Quantification via Group-Level EEG Dynamic Neural Synchrony cites this paper.

Toward Annotation-Efficient Continuous Emotion Arousal Quantification via Group-Level EEG Dynamic Neural Synchrony AutoEval-Video: An Automatic Benchmark for Assessing Large Vision Language Models in Open-Ended Video Question Answering

Reference 83

Resolution
unresolved
no resolver link, observed 2026-07-31T14:47:01.681295Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-07-31T14:47:01.681295Z digest=sha256:1723dfa910098eafb7497bc96496d857c90e7c084bc6ae8b1df69d7f7d7aa8d2