Pith. sign in

Paper Citation Record · LEDGER

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos

As of 21 August 2026, this Paper Citation Record lists 100 of 122 outbound references and 11 inbound Pith citation observations for arXiv:2506.10857.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2506.10857 v2

Coverage vector

measured 100 of 122 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-07T04:22:56.139701Z

measured 111 of 111 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-20T06:33:59.587034+00:00

measured 11 of 11 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-03T20:23:08.702909Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-04T00:49:17.495045Z

Reference resolution

100 of 122 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved100
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 67bf88f4-239b-4a02-b712-e4ca6827f655 · outbound

This paper cites Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.794507Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.794507Z digest=sha256:550e493031280593e44ede92322b993cddc4a47add7226721c24217c87bef7db

Observation 6e9ab553-3fcc-48c8-9150-e56adf8fecbb · outbound

This paper cites Qwen2.5-VL Technical Report.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Qwen2.5-VL Technical Report

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.798358Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.798358Z digest=sha256:31eff5a2584f61af1c8ae25c7356f240fa3b93b9fe2cd56442df210d4a370c45

Observation cd844921-0989-4044-aa69-dbffdb445ed8 · outbound

This paper cites InternLM2 Technical Report.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos InternLM2 Technical Report

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.801744Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.801744Z digest=sha256:42d0df89d48abbad147eb6ddbfc067ef24e35f98425c321d01e3c786a3011a8c

Observation aa3c841a-826e-4063-b441-59d7aee0678b · outbound

This paper cites CG-Bench: Clue-grounded Question Answering Benchmark for Long Video Understanding.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos CG-Bench: Clue-grounded Question Answering Benchmark for Long Video Understanding

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.805315Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.805315Z digest=sha256:5c71b10fac2cf4a85faeb1c1b6244e981f0e4faf02d9f0435eb32179e871f72f

Observation db6db4af-9926-4f46-9e83-3b382a3516cf · outbound

This paper cites TheoremQA: A Theorem-driven Question Answering dataset.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos TheoremQA: A Theorem-driven Question Answering dataset

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.808811Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.808811Z digest=sha256:0fb11ced2c32cff36e2533cbfd619ff7ab64e89b8cc1d08a575d279f89e704c8

Observation 9acc9133-3f9c-41c5-a370-c8ca38e496ea · outbound

This paper cites Autoeval-video: An automatic benchmark for assessing large vision language models in open-ended video question answering.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Autoeval-video: An automatic benchmark for assessing large vision language models in open-ended video question answering

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.812841Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.812841Z digest=sha256:a7a879506b74c6ef55e94f4093602a936d838f77980727d09111e66c3e164d47

Observation 4eef8657-de74-4207-a670-d3d40a65939f · outbound

This paper cites Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.815725Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.815725Z digest=sha256:69d399490db8ef08885a606ddaf55c2cba26b72a994572b373feeefcba34830c

Observation 5ee2aabb-d15d-4471-8307-85557ae27857 · outbound

This paper cites Training Verifiers to Solve Math Word Problems.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Training Verifiers to Solve Math Word Problems

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.819219Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.819219Z digest=sha256:e0a3e08b2de11534cf116357d5dba0f6d061cd421aa2f57db0c1407065a735b8

Observation 3f7009cb-616d-44a6-bd44-2b6e59c6e59e · outbound

This paper cites Lost in Time: A New Temporal Benchmark for VideoLLMs.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Lost in Time: A New Temporal Benchmark for VideoLLMs

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.823070Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.823070Z digest=sha256:39a50c7a35a62dcc509740982b1804657627b28829fca544f062e475bd6779be

Observation f75212c6-a201-462d-8cf5-5bfabcb1e49c · outbound

This paper cites EXAMS-V: A Multi-Discipline Multilingual Multimodal Exam Benchmark for Evaluating Vision Language Models.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos EXAMS-V: A Multi-Discipline Multilingual Multimodal Exam Benchmark for Evaluating Vision Language Models

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.826579Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.826579Z digest=sha256:56e6995fde1e4000b3a3e37d245a026afe88b40ddc27fec03deca286401858e0

Observation 37ddbae0-b8c6-41f9-935a-b57fe314946b · outbound

This paper cites Deepl translate: The world’s most accurate trans- lator.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Deepl translate: The world’s most accurate trans- lator

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.829651Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.829651Z digest=sha256:bb7f7100d2b53490376415fd2cfcbd71011fdb87011a247c02353822430c26d2

Observation a950fbf6-7e2b-427b-a098-4b7e970c0926 · outbound

This paper cites Gemini 2.0 flash thinking.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Gemini 2.0 flash thinking

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.832779Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.832779Z digest=sha256:622ee51601679050dae806d10939efa58e2bcc20be088386de77e339bca77f67

Observation 5e3f8b0f-833d-40b8-a89f-00cee31d231b · outbound

This paper cites Mmbench-video: A long-form multi-shot benchmark for holistic video under- standing.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Mmbench-video: A long-form multi-shot benchmark for holistic video under- standing

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.835477Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.835477Z digest=sha256:3d04b2c787f51bf43c520eaf12d2a940b8b73140482fd1a6c8fcc7191df38cbb

Observation 9675d94b-f65d-4fbb-a217-82b0059f9647 · outbound

This paper cites Video-of-Thought: Step-by-Step Video Reasoning from Perception to Cognition.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Video-of-Thought: Step-by-Step Video Reasoning from Perception to Cognition

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.838095Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.838095Z digest=sha256:0749fd401db9aacfa2150d816c50e8acbeb9f24cd042333da2793b4efda6af2e

Observation 753a87c7-a443-46e3-9bce-90ba8d4e2f5c · outbound

This paper cites Sciknoweval: Evaluating multi- level scientific knowledge of large language models.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Sciknoweval: Evaluating multi- level scientific knowledge of large language models

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.841030Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.841030Z digest=sha256:c9e36d37a2773645a959ffdbfc5cb6fd0269d3eafe4a5fa64930092634a3c96a

Observation 0849dd15-06d7-43fd-adfe-969771bbac93 · outbound

This paper cites Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.843902Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.843902Z digest=sha256:517d04e9f3189f14b58e7882bd120b9530792ffb33cce10f645fe499cf20369b

Observation 2695ae24-3a76-4e1f-a39a-35dc60f54fbe · outbound

This paper cites H2OVL-Mississippi Vision Language Models Technical Report.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos H2OVL-Mississippi Vision Language Models Technical Report

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.846897Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.846897Z digest=sha256:79df8fa18b80c883cdfebb859055dc3ce2e3b15f58a68112411134239e6b418a

Observation c4859939-007a-444d-aa0b-c725f89ac507 · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.849759Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.849759Z digest=sha256:b0de93ad764c81d36ac651d7d629fab8f726ec9aa468b1a6e5e4ee851fe8918f

Observation 7c58fbad-de91-4d02-b625-61d4030b97fa · outbound

This paper cites VideoEspresso: A Large-Scale Chain-of-Thought Dataset for Fine-Grained Video Reasoning via Core Frame Selection.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos VideoEspresso: A Large-Scale Chain-of-Thought Dataset for Fine-Grained Video Reasoning via Core Frame Selection

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.852974Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.852974Z digest=sha256:4d899de6b959eae27fdc8cb146d04924ede67ca1163674324b0282849f69b960

Observation 4f68f3c2-48fb-4c88-9dc4-c9e4b0a985d6 · outbound

This paper cites MMWorld: Towards Multi-discipline Multi-faceted World Model Evaluation in Videos.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos MMWorld: Towards Multi-discipline Multi-faceted World Model Evaluation in Videos

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.856234Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.856234Z digest=sha256:a6971944e4d0a01c6918f15ed8b662c4a76673c78b14a84eb685fde0f37211f8

Observation c0f4926b-9b3f-4e21-967e-b95936779a4a · outbound

This paper cites Measuring Massive Multitask Language Understanding.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Measuring Massive Multitask Language Understanding

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.859652Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.859652Z digest=sha256:998a51a5a53cfd36288a1f795a6210c3f7b55051225195f4a63e5aab15c11e23

Observation 23b5364e-be60-48e2-8e6d-77a1ca0006f8 · outbound

This paper cites Video-MMMU: Evaluating Knowledge Acquisition from Multi-Discipline Professional Videos.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Video-MMMU: Evaluating Knowledge Acquisition from Multi-Discipline Professional Videos

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.863069Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.863069Z digest=sha256:bccab36cdbe96d15a68a12436fd2819a92c5a27908dd491b3d881778610e79d0

Observation 495389a9-ed4f-40c5-a39a-4467210737a0 · outbound

This paper cites C-eval: A multi-level multi-discipline chinese evaluation suite for foundation models.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos C-eval: A multi-level multi-discipline chinese evaluation suite for foundation models

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.866065Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.866065Z digest=sha256:2111178b4982b5f99e3d5c692a1852d63088732d255112de6ae1be724193e4d3

Observation aa0582dd-d1da-43cb-af60-a13f67595808 · outbound

This paper cites Vbench: Comprehensive bench- mark suite for video generative models.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Vbench: Comprehensive bench- mark suite for video generative models

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.869308Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.869308Z digest=sha256:19d9b3bef96bb08188ca1437875e836f818540c4f9a2630f698d36512bf0434f

Observation 251dc541-9fc2-4f9d-9e0f-43a43d65d45b · outbound

This paper cites Olympicarena: Benchmark- ing multi-discipline cognitive reasoning for superintelligent ai.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Olympicarena: Benchmark- ing multi-discipline cognitive reasoning for superintelligent ai

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.872434Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.872434Z digest=sha256:0b85e2b2139a758aa3ae4c5f07619b8c5ff02761af6a3b993eb5775072c77d50

Observation bb48fda0-189a-4e90-a294-989e03148d7a · outbound

This paper cites LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.875498Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.875498Z digest=sha256:82a4db6d526a3d8577834cd987bc48e79cd2c9779660b5b6c5c54d824931443d

Observation 172d0c3b-4e7a-4db9-adac-bce723c074a9 · outbound

This paper cites VisScience: An Extensive Benchmark for Evaluating K12 Educational Multi-modal Scientific Reasoning.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos VisScience: An Extensive Benchmark for Evaluating K12 Educational Multi-modal Scientific Reasoning

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.878707Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.878707Z digest=sha256:d6414d25c8def5ed3d05c63b7d930de4e087eb22f2268e0dae913a1dd205e610

Observation 7eae764e-27d8-42d7-a2e7-8a04c60c7397 · outbound

This paper cites TVQA: Localized, Compositional Video Question Answering.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos TVQA: Localized, Compositional Video Question Answering

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.882019Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.882019Z digest=sha256:0ce82a3f7a1b008f2afcbeacd0736cb1d69ba696c0987b407c070e12fc6ba808

Observation dd312b7a-59eb-4997-941c-a8f1f084af16 · outbound

This paper cites Veu-bench: Towards comprehensive under- standing of video editing.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Veu-bench: Towards comprehensive under- standing of video editing

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.885036Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.885036Z digest=sha256:fac66696bcb5bd28c2a865aa6a3b1c96d2a5081a3058937796797018ef52b649

Observation bdeedada-c8a1-4732-8f62-8830251ce4c6 · outbound

This paper cites Aria: An Open Multimodal Native Mixture-of-Experts Model.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Aria: An Open Multimodal Native Mixture-of-Experts Model

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.888224Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.888224Z digest=sha256:0d3486fa8f10a2de34bcf7601fbcf477dcce028895903f0099b60c0fd466d7a5

Observation f76134e5-71df-41ac-80c0-b4b20c61c9f5 · outbound

This paper cites Mvbench: A comprehensive multi-modal video understand- ing benchmark.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Mvbench: A comprehensive multi-modal video understand- ing benchmark

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.891513Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.891513Z digest=sha256:1d6dedb466cebb7eba686ae9b21e4882c23a0147993b1fc621bdf04fce7d001b

Observation 464c5e5e-07f5-46f0-ae02-fcf6e2b9ff09 · outbound

This paper cites VideoChat-Flash: Hierarchical Compression for Long-Context Video Modeling.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos VideoChat-Flash: Hierarchical Compression for Long-Context Video Modeling

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.894485Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.894485Z digest=sha256:9c284377daebc52d3b31f91879db389556a3c40ab58e0a242ad2667fd9c4b87e

Observation 96a7f6a6-d097-497d-887f-4378e5386efb · outbound

This paper cites VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.898375Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.898375Z digest=sha256:3a4159745d7b2acac2054af90c12d2ac79ce31c87a4888a824c54ef3b83ba14a

Observation 72944cf2-74c2-4dd2-91fa-073fcf1672fa · outbound

This paper cites VideoVista: A Versatile Benchmark for Video Understanding and Reasoning.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos VideoVista: A Versatile Benchmark for Video Understanding and Reasoning

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.901902Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.901902Z digest=sha256:aedd22adcb407cb81f12cdfca4e93727fb44fb3e9c54fb9446d1c67a693daa41

Observation 8d67a2a2-fdbe-4af4-ba1b-bf14d005537b · outbound

This paper cites Mmsci: A multimodal multi-discipline dataset for phd-level scientific comprehen- sion.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Mmsci: A multimodal multi-discipline dataset for phd-level scientific comprehen- sion

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.905354Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.905354Z digest=sha256:eb8c7cd67066b275651a2c855d729b6916530cdc726b43de51d7d837818c43a5

Observation 777b0caa-5f9e-4163-8fe5-9811e7a48d40 · outbound

This paper cites SceMQA: A Scientific College Entrance Level Multimodal Question Answering Benchmark.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos SceMQA: A Scientific College Entrance Level Multimodal Question Answering Benchmark

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.908709Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.908709Z digest=sha256:2ab730cbfe26bf69c9116389e38bcbef80433ff1c63d3e9c01f2d4e1ebe3d2a1

Observation d3686116-b77e-4086-86e6-93a127e3afbf · outbound

This paper cites Vila: On pre-training for vi- sual language models.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Vila: On pre-training for vi- sual language models

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.912456Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.912456Z digest=sha256:6251772d08f6d42d429777a83f8438b2b9fadb1678f283c648017422e39bdd63

Observation 4a99a1ed-4c12-4cf3-b715-9a75287a794a · outbound

This paper cites DeepSeek-V3 Technical Report.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos DeepSeek-V3 Technical Report

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.915660Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.915660Z digest=sha256:a5479235013c95c70e4534137a66e7c0ea070e127dc7a72594e6cd738cb5fecb

Observation b4aacb62-809e-4ff1-8917-6c9b2db81e35 · outbound

This paper cites TempCompass: Do Video LLMs Really Understand Videos?.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos TempCompass: Do Video LLMs Really Understand Videos?

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.919117Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.919117Z digest=sha256:a9cb7e637615b170a86394557bb749587942703f059978e5092c134a67585d79

Observation ca08579a-f769-47a9-87cc-a7bb7a4e650c · outbound

This paper cites E.T. Bench: Towards Open-Ended Event-Level Video-Language Understanding.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos E.T. Bench: Towards Open-Ended Event-Level Video-Language Understanding

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.922688Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.922688Z digest=sha256:846cd27b8d2d8978abbd8bb57a61fc2e28aa8a41f18a4c4654002eedeb216f38

Observation ea1b2c88-4fb8-4786-841f-074d073c603c · outbound

This paper cites Llama-3.3-70b-instruct.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Llama-3.3-70b-instruct

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.926445Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.926445Z digest=sha256:47600070bc51606ba3e0134128ddbf6a7b248c934dd88311374d34109a9b9b61

Observation cafefa2f-9f66-49de-9955-28857541679a · outbound

This paper cites MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.929946Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.929946Z digest=sha256:64c1d6377a23fd82e89b85fb7be7078ffb12f4abd8bdb18bdb99e34da0900636

Observation 4bc8e262-74ec-44bc-ae1e-02b2b7c087ab · outbound

This paper cites Egoschema: A diagnostic benchmark for very long- form video language understanding.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Egoschema: A diagnostic benchmark for very long- form video language understanding

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.933948Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.933948Z digest=sha256:43593d3fb01abb636aeeece52b100b4843b0a7ba2078912393d6b12382f5e332

Observation 4288717a-c077-4503-8d0f-6b943dc16086 · outbound

This paper cites ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.937385Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.937385Z digest=sha256:49893d042117cda999853a4a88053bdc6cf26db0d02c6bc263f1f947b108de88

Observation f4dd8165-bd5e-4613-a574-b558d5fe57e6 · outbound

This paper cites Plotqa: Reasoning over scientific plots.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Plotqa: Reasoning over scientific plots

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.941480Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.941480Z digest=sha256:27ad7c0fe1d54ca850e0e22c85bb77c8d35fd4e09e7ee1315213840fa7690b78

Observation ad1ab0a5-8d56-42b7-abc7-9ab6202c0e16 · outbound

This paper cites Video-Bench: A Comprehensive Benchmark and Toolkit for Evaluating Video-based Large Language Models.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Video-Bench: A Comprehensive Benchmark and Toolkit for Evaluating Video-based Large Language Models

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.944763Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.944763Z digest=sha256:9263c45d62bfef380678377b831234b4c49eac8605f77a16ba25aa43b4f0fe81

Observation 90e2f9bc-4a34-40b3-b521-86f6f1ad70c6 · outbound

This paper cites Hello gpt4-o.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Hello gpt4-o

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.948741Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.948741Z digest=sha256:cf38c3b6c14bcf9542ad206f20761fb3904b887f62ddf24dc42c7e54ed224b77

Observation 9514c253-91e1-4207-9685-bde03caf9b22 · outbound

This paper cites Introducing openai o1.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Introducing openai o1

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.951948Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.951948Z digest=sha256:5a0ffa88496846673d28c1e4d0883b949eb1228754223c98b56074b1d55423a4

Observation f039a56a-1291-4aa6-8310-e8a13a0b95b8 · outbound

This paper cites Openai o3-mini.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Openai o3-mini

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.955676Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.955676Z digest=sha256:42612c02819559cbaea21723643cbad4b5fd58acad27c97ab19bd5d84ebd71fb

Observation e8356cf3-7c1c-489f-b74f-cd3836ef58e5 · outbound

This paper cites Per- ception test: A diagnostic benchmark for multimodal video models.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Per- ception test: A diagnostic benchmark for multimodal video models

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.959241Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.959241Z digest=sha256:092da6a0aa3d831402f9f97603e3b5b50e9a10edd19d3fc7078a8496b984c4e6

Observation 8456456e-a978-4287-883a-6bb39db100b2 · outbound

This paper cites Robust speech recognition via large-scale weak supervision.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Robust speech recognition via large-scale weak supervision

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.962613Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.962613Z digest=sha256:703c0f0b75db1ac3cb8ddb4063e05b86ba29d0b911c75cb0661cac6b0d409241

Observation 248a203e-e894-4ac2-9ce7-d528e407e952 · outbound

This paper cites Direct preference optimization: Your language model is secretly a reward model.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Direct preference optimization: Your language model is secretly a reward model

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.965834Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.965834Z digest=sha256:260e5b888dcbf9eca27e7ef08a63847f5e1cb102304048493e976aff7894b6d7

Observation 2bce9224-a4cb-41a3-853a-88f33fd1a58b · outbound

This paper cites CinePile: A Long Video Question Answering Dataset and Benchmark.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos CinePile: A Long Video Question Answering Dataset and Benchmark

Reference 53

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.969084Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.969084Z digest=sha256:8b55eb4fad84721da785388f9bac4853f8b1dd4b76045bf6cd0348c2cbecda43

Observation 0403ef84-b2cc-4ba8-b7ea-606cd2b175b1 · outbound

This paper cites Scienceqa: A novel resource for question answering on scholarly articles.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Scienceqa: A novel resource for question answering on scholarly articles

Reference 54

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.972753Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.972753Z digest=sha256:2253b8e05aafdba78f1d5d0514b32249824afad0cd5246afd508fcab0015ebe9

Observation b7567d2a-afe6-49ac-87b3-75bdf9b6cba0 · outbound

This paper cites Proximal Policy Optimization Algorithms.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Proximal Policy Optimization Algorithms

Reference 55

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.976330Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.976330Z digest=sha256:a3f05ae370570054fd69a09962894a130eca0c8cdbe351548b27b572a9173080

Observation d67660f1-c14d-4565-a888-d47027a2f72c · outbound

This paper cites Moviechat: From dense token to sparse memory for long video understanding.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Moviechat: From dense token to sparse memory for long video understanding

Reference 56

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.979783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.979783Z digest=sha256:c276270f3bf897ff5be29d5d1334f0847e2ad71f7794216c9b6b20109e7f70fb

Observation 91aa0012-efe1-4a8b-ba32-15907154c07b · outbound

This paper cites Scieval: A multi-level large language model evaluation benchmark for scientific re- search.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Scieval: A multi-level large language model evaluation benchmark for scientific re- search

Reference 57

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.983472Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.983472Z digest=sha256:a5d3a7eaf10d2af9f3c7084ec8d8baba2d01c2f46ae33abdf0a017ba5306fd71

Observation 20738237-2470-4115-95df-50ad77de4008 · outbound

This paper cites Movieqa: Understanding stories in movies through question- answering.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Movieqa: Understanding stories in movies through question- answering

Reference 58

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.986695Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.986695Z digest=sha256:84b63267ee8a07f904299fa268473f57132dec23976861b8952ada86bcb41ece

Observation a2c0df03-ede1-4de7-8286-ca5772f806c0 · outbound

This paper cites Claude Team.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Claude Team

Reference 59

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.990171Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.990171Z digest=sha256:3aa3737f5b8bf3cd5d746acc4e6329dff1be44107ae568058bb5bb2d3748a95a

Observation 61343ccd-0658-4382-8a41-57d7baedba20 · outbound

This paper cites MiMo-VL Technical Report.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos MiMo-VL Technical Report

Reference 60

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.993691Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.993691Z digest=sha256:63f2e470d343670bfcf3ea201851a8026a7b0add7154eb18aac8b8e209aafa3f

Observation 0fc8315a-a995-42eb-a74d-b37f89622c28 · outbound

This paper cites Gemini: A Family of Highly Capable Multimodal Models.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Gemini: A Family of Highly Capable Multimodal Models

Reference 61

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.997443Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.997443Z digest=sha256:d4060955312601f68c6749fc31bcb6a6a0e4d6ed8a68481acaa7000b8c1fef4e

Observation 223a5ac8-47d9-4218-9aed-c491e5c2d770 · outbound

This paper cites Kimi-VL Technical Report.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Kimi-VL Technical Report

Reference 62

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:56.001192Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:56.001192Z digest=sha256:b67e07062e17321f4eccd0fb27eab5a4c3783c209ff111a9fc501c4b14a93a0d

Observation 574deb97-d5bb-408c-a6d8-0403b5d74e9d · outbound

This paper cites Kwai Keye-VL Technical Report.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Kwai Keye-VL Technical Report

Reference 63

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:56.004930Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:56.004930Z digest=sha256:d00e3ada6e86e456ab3b9e18e076fc2ef464602f8ab57a8f402d296e531c1406

Observation a8ba791d-667a-4b4d-a2bf-a7ef871bb11d · outbound

This paper cites Qwq: Reflect deeply on the boundaries of the unknown.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Qwq: Reflect deeply on the boundaries of the unknown

Reference 64

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:56.008810Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:56.008810Z digest=sha256:9ab34705c08af7cd1f34c84c43ef809cac21909aa2fa070ddbea9ebb2863ee8e

Observation 0cc786e6-eb01-4356-9800-19c9bfa5dc5f · outbound

This paper cites Qwq-32b: Embracing the power of reinforce- ment learning.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Qwq-32b: Embracing the power of reinforce- ment learning

Reference 65

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:56.012332Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:56.012332Z digest=sha256:d72270b60aa160c22a27d48dd2743b164085dbcc1736d2dd57e555b3eb26aa45

Observation 998bdf44-fffa-4ad1-a2a1-5fda2aa5c176 · outbound

This paper cites LlamaV-o1: Rethinking Step-by-step Visual Reasoning in LLMs.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos LlamaV-o1: Rethinking Step-by-step Visual Reasoning in LLMs

Reference 66

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:56.015726Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:56.015726Z digest=sha256:8b42c83d28dfc1ea5db793d9668cae6661a7428839eade47565564d42e2f79a2

Observation 12d08530-1010-4849-ad8f-3a52100a62b0 · outbound

This paper cites Mea- suring multimodal mathematical reasoning with math-vision dataset.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Mea- suring multimodal mathematical reasoning with math-vision dataset

Reference 67

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:56.019503Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:56.019503Z digest=sha256:6cd80fe3efad84bd754603edb8a81fc4a49acc7574353c5bce060b0ca386331e

Observation a733ad3b-02c9-4ce9-ab71-cf3ee71ca713 · outbound

This paper cites Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution

Reference 68

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:56.022809Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:56.022809Z digest=sha256:a0eaa2eba14474fd214d105da37168e82fbe447ee295ca7fbea7cbda09da40bc

Observation b61e18b8-a4b4-41a3-9831-f60c6e691041 · outbound

This paper cites Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization

Reference 69

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:56.026472Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:56.026472Z digest=sha256:cd5ebf803187822b902f445ab70e5d4df427687d3ca51c410ae0b5804c2128d2

Observation 9c63bfad-d6e4-44f8-a6d1-0365e150803d · outbound

This paper cites LVBench: An Extreme Long Video Understanding Benchmark.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos LVBench: An Extreme Long Video Understanding Benchmark

Reference 70

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:56.029698Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:56.029698Z digest=sha256:1b25b1557737c78996b3443bc89cf0035fbe663f681899e5836421140871bcc1

Observation 7721589c-31dc-49cd-85bc-14090328f51d · outbound

This paper cites Internvideo2: Scaling foundation models for mul- timodal video understanding.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Internvideo2: Scaling foundation models for mul- timodal video understanding

Reference 71

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:56.033273Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:56.033273Z digest=sha256:a1f837b4957230182f3fc36115c77a3f3d9f667a23d4d9a3c9252db2bf55cde2

Observation 35576631-0d20-440c-93e9-b78340cdeae2 · outbound

This paper cites Mmlu-pro: A more robust and challenging multi-task language understanding benchmark.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Mmlu-pro: A more robust and challenging multi-task language understanding benchmark

Reference 72

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:56.036599Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:56.036599Z digest=sha256:58a6f91ddb60e3e10cf916e8f312fef8db8d06c5b8711b38fecf4d6663766f6d

Observation a8c1bebf-3b71-4951-8ed2-20c1839bf3c5 · outbound

This paper cites InternVideo2.5: Empowering Video MLLMs with Long and Rich Context Modeling.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos InternVideo2.5: Empowering Video MLLMs with Long and Rich Context Modeling

Reference 73

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:56.040389Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:56.040389Z digest=sha256:cd1ae5201b6c7600b18a7352f7d6353427a1e1a1d61ddd68328a7abe302884e4

Observation d70a7195-8eeb-4046-a743-304badfbdd03 · outbound

This paper cites Charxiv: Charting gaps in realistic chart understanding in multimodal llms.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Charxiv: Charting gaps in realistic chart understanding in multimodal llms

Reference 74

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:56.044092Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:56.044092Z digest=sha256:5c1319d86ecf2e8e026f97b62d4f91789d10e28d4c487f8f7db40210083b2c21

Observation 80c7b20b-7eaa-440d-a569-3db0431d1f06 · outbound

This paper cites Chain-of-thought prompting elicits reasoning in large lan- guage models.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Chain-of-thought prompting elicits reasoning in large lan- guage models

Reference 75

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:56.048025Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:56.048025Z digest=sha256:c1fad4f87e8288d6ac5a1e503d930b7385f1f67f5e87e678d141d7c17ce1ef4a

Observation 9a8e578c-f3ed-4db6-b45f-5eba1d035eca · outbound

This paper cites STAR: A Benchmark for Situated Reasoning in Real-World Videos.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos STAR: A Benchmark for Situated Reasoning in Real-World Videos

Reference 76

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:56.051254Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:56.051254Z digest=sha256:b61e5fc96087cde0d01f04057b022a72e8bfc79d1a983b306dd0bf4bbfcd366e

Observation 09d024e8-859c-4f80-b3c1-2e52fbef5d7b · outbound

This paper cites Longvideobench: A benchmark for long-context interleaved video-language understanding.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Longvideobench: A benchmark for long-context interleaved video-language understanding

Reference 77

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:56.054587Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:56.054587Z digest=sha256:598f29015e3d8b37086a05b501d72cea1ee4d6fa4688820388589426753cec3e

Observation 48a6e6e0-2b1a-4f35-8642-cb8ada73e42d · outbound

This paper cites ChartInsights: Evaluating Multimodal Large Language Models for Low-Level Chart Question Answering.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos ChartInsights: Evaluating Multimodal Large Language Models for Low-Level Chart Question Answering

Reference 78

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:56.057630Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:56.057630Z digest=sha256:bec43f4643b8a35a7389c7d1818b682e7658c21af2007efa4ce13b20d137d1ef

Observation c9615c86-c7a2-4a34-872b-ee5f4d09608c · outbound

This paper cites DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding

Reference 79

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:56.061641Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:56.061641Z digest=sha256:aa6cff425fc5399ca28f608bb094c26f6f184b4957deaa76d5ad05c14ff72b2a

Observation 34c6a477-35c9-4891-a79d-16c5ff0e1c75 · outbound

This paper cites Next-qa: Next phase of question-answering to explaining temporal actions.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Next-qa: Next phase of question-answering to explaining temporal actions

Reference 80

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:56.065135Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:56.065135Z digest=sha256:e97221652d46bcf99f8ebd16d0a8cf458de36c5ea35f66b5be22024e6dcdf2d3

Observation f499c913-d804-40f1-819d-bf2eaee718d1 · outbound

This paper cites LLaVA-CoT: Let Vision Language Models Reason Step-by-Step.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos LLaVA-CoT: Let Vision Language Models Reason Step-by-Step

Reference 81

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:56.068528Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:56.068528Z digest=sha256:dc9a328597210414cdd49ff8411c2f2d57ff30fc65eb5e49d52ad40518cdc174

Observation 9e523dc1-8827-4b22-a657-8ce90271cccb · outbound

This paper cites Qwen2 Technical Report.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Qwen2 Technical Report

Reference 82

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:56.072007Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:56.072007Z digest=sha256:8c3b421ef7e36df8c07d2a357840e9c2ffec0ea022850439ac160127ad01968c

Observation baf03061-74b5-4672-9873-f22e3c60fa29 · outbound

This paper cites Qwen2.5 Technical Report.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Qwen2.5 Technical Report

Reference 83

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:56.075817Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:56.075817Z digest=sha256:90780751f9dd1240fa388f1348974fd78ac7c17d481ff3b14e0b8f88331ac8f4

Observation 63efaa54-d18b-432f-8376-97fd9af0a511 · outbound

This paper cites Vript: A video is worth thousands of words.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Vript: A video is worth thousands of words

Reference 84

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:56.079943Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:56.079943Z digest=sha256:69f50ab5c7f5e3bf4eb5019da7c785e01f786cd4ca84da698459803d71582679

Observation b5a02474-e2ec-4826-bc43-a1a96178e9c0 · outbound

This paper cites Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for ex- pert agi.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for ex- pert agi

Reference 85

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:56.083505Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:56.083505Z digest=sha256:bc44b2b0f2cc8f4798b0c21f08489883762111067b69b3655ca4a7c48eac371b

Observation 9c644f51-4323-42f6-9942-e752d92768b3 · outbound

This paper cites MMMU-Pro: A More Robust Multi-discipline Multimodal Understanding Benchmark.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos MMMU-Pro: A More Robust Multi-discipline Multimodal Understanding Benchmark

Reference 86

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:56.086963Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:56.086963Z digest=sha256:5e04cfbc6d0e7f2aa5a142307af888355cbfac3dcae625d17accca5f59425035

Observation 3352a403-d713-4bc4-8714-334ec1debcbf · outbound

This paper cites MR-GSM8K: A Meta-Reasoning Benchmark for Large Language Model Evaluation.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos MR-GSM8K: A Meta-Reasoning Benchmark for Large Language Model Evaluation

Reference 87

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:56.090625Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:56.090625Z digest=sha256:a32e5461b96add4fc4f57727c49db67224dd7dabafc884f44a668c4f275cf07b

Observation 425c0e8d-d767-487e-9278-d7c6bfd58ae2 · outbound

This paper cites VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding

Reference 88

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:56.094091Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:56.094091Z digest=sha256:b76d82e0ffbf75ee5b2e07b005c9c699cfba9d5037ec5965c9df87ab34eeb79f

Observation 5aff777f-413d-4142-9836-e8741bc8053b · outbound

This paper cites CMMMU: A Chinese Massive Multi-discipline Multimodal Understanding Benchmark.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos CMMMU: A Chinese Massive Multi-discipline Multimodal Understanding Benchmark

Reference 89

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:56.098198Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:56.098198Z digest=sha256:19c94d3b676c87ad16a1fc6d7cca96d3cb0d6f728463e441a66e18edc5eb4d32

Observation 636a398c-4161-4ff9-b1c1-fda5a06ae8a4 · outbound

This paper cites LvBench: A Benchmark for Long-form Video Understanding with Versatile Multi-modal Question Answering.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos LvBench: A Benchmark for Long-form Video Understanding with Versatile Multi-modal Question Answering

Reference 90

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:56.102015Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:56.102015Z digest=sha256:48ff26c110550c41c6b4c182a99f9c6c1750ef91eff2fb0a38bd1fefdc6c6a90

Observation 780e01ce-6412-459e-9e7b-5403e03752ce · outbound

This paper cites Long Context Transfer from Language to Vision.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Long Context Transfer from Language to Vision

Reference 91

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:56.105590Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:56.105590Z digest=sha256:1a329a193a73bb123930d72887d9475623013cfeb67a05566af5c753582516fc

Observation 737f9633-f141-463b-b19e-f15e39a533b1 · outbound

This paper cites MMVU: Measuring Expert-Level Multi-Discipline Video Understanding.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos MMVU: Measuring Expert-Level Multi-Discipline Video Understanding

Reference 92

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:56.109578Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:56.109578Z digest=sha256:7b1bca2914cadccdae28ef0d845aaec382b04c4aae30b6f5af814f8dc358481d

Observation aae769e7-ed42-4d67-b01c-f74bb405cab7 · outbound

This paper cites MLVU: Benchmarking Multi-task Long Video Understanding.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos MLVU: Benchmarking Multi-task Long Video Understanding

Reference 93

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:56.113344Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:56.113344Z digest=sha256:93f240d8c12479ff7e530098e8981c8dff02d8073051aacd3c04c17ad289fad1

Observation 759fdcf6-4d27-45f7-b53b-2c2bedb2cbd5 · outbound

This paper cites Au- toshot: A short video dataset and state-of-the-art shot bound- ary detection.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Au- toshot: A short video dataset and state-of-the-art shot bound- ary detection

Reference 94

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:56.117140Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:56.117140Z digest=sha256:a5f4f7a5c980cf0ec16de80dbb065f06f57657b61ad5fd8428f947efc90bb0db

Observation c9b0cd36-2a4d-4ce0-b797-719a13978b05 · outbound

This paper cites • Multi-step process 1: A → B → C → D.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos • Multi-step process 1: A → B → C → D

Reference 95

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:56.121263Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:56.121263Z digest=sha256:0996ba8931cef6f2b995cc1bba92f9192c05c85094bc3eb53b8d86271377cf1c

Observation d2abdced-fcf3-4473-80e9-510a730d7196 · outbound

This paper cites • Multi-step process 1: A → B → C → D.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos • Multi-step process 1: A → B → C → D

Reference 96

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:56.124805Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:56.124805Z digest=sha256:5ac983c7058e70defca3c627ea3cb70c03ddfd291030573fd15127106bf4682e

Observation 054d7390-470b-43cd-8851-e4691ff87b5e · outbound

This paper cites • Multi-step process: D → C → B → A.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos • Multi-step process: D → C → B → A

Reference 97

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:56.128206Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:56.128206Z digest=sha256:2f803c92c55bc3fcbabe9eba540c75b82c2252db8bccd6779400554c5f7773b5

Observation b8bd4edb-813b-4535-9876-4ea20b8ee2d5 · outbound

This paper cites • Multi-step process: D → C → B → A.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos • Multi-step process: D → C → B → A

Reference 98

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:56.132146Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:56.132146Z digest=sha256:6a56804200d9df7823de0e946cfda70b263d0de77470cf449161205a24ae2823

Observation ee36e1ad-397c-49c7-8fa2-1440431e6943 · outbound

This paper cites • Multi-step process: A → C → D → B.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos • Multi-step process: A → C → D → B

Reference 99

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:56.135839Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:56.135839Z digest=sha256:5a7a9d10a7d8c108dcd4fcd1ebb2f70f2ca6679db81351151dc796c490b429ab

Observation 1081268f-4dd7-4e6c-a68f-7147abad3086 · outbound

This paper cites an unresolved cited work.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Unresolved cited work

Reference 100

Resolution
unresolved
raw_fallback, observed 2026-08-07T04:22:57.184540Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-07T04:22:56.139701Z digest=sha256:181189b7bcbb9b3a37334952737bd13ffa66345b26b0aa60a1f1abc9478db5b5

Pith citing papers

Observation f7cca12f-0ef3-48ae-8da9-24c49c949add · inbound

VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs cites this paper.

VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos

Reference 106

Resolution
unresolved
no resolver link, observed 2026-08-03T20:23:08.702909Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T20:23:08.702909Z digest=sha256:760992c3369029b9e5cb5266bd7e5f652a7dbd440118420765afd1de02245dab

Observation 26f4061c-be93-4ade-b1a7-a088468f27ca · inbound

Watching, Reasoning, and Searching: A Video Deep Research Benchmark on Open Web for Agentic Video Reasoning cites this paper.

Watching, Reasoning, and Searching: A Video Deep Research Benchmark on Open Web for Agentic Video Reasoning VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos

Reference 16

Resolution
verified exact
arxiv_id, observed 2026-05-21T16:40:22.769581Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-05-21T16:35:24.557809Z digest=sha256:d284c67eb3fd5c60faea54d84a61d997049377f5269bd4d56f3152cfdd8df969

Observation ca25f97a-b15e-4692-acc8-dac577a40f42 · inbound

Diagnosing Long-Video Quantitative Reasoning in Multimodal LLMs via Enumeration and Counting cites this paper.

Diagnosing Long-Video Quantitative Reasoning in Multimodal LLMs via Enumeration and Counting VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos

Reference 52

Resolution
unresolved
no resolver link, observed 2026-07-13T15:29:31.834566Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T15:29:31.834566Z digest=sha256:82101fedcce82aea2bb80aeb60b679b5bf7e047bd3810f82fd6bcc2964f641a2

Observation 73a3b076-d662-48e9-9632-ba373fc1cdd5 · inbound

Chain-of-Glimpse: Search-Guided Progressive Object-Grounded Reasoning for Video Understanding cites this paper.

Chain-of-Glimpse: Search-Guided Progressive Object-Grounded Reasoning for Video Understanding VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos

Reference 53

Resolution
verified exact
arxiv_id, observed 2026-05-10T12:05:22.183158Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-05-10T12:03:09.408019Z digest=sha256:e306672bc36ca131d3b6a8be7019c9b5c9bff3b05cdcc2c787e7c97332bfd831

Observation 80897de9-8c46-48d2-a396-247283b3bc12 · inbound

Chain-of-Glimpse: Search-Guided Progressive Object-Grounded Reasoning for Video Understanding cites this paper.

Chain-of-Glimpse: Search-Guided Progressive Object-Grounded Reasoning for Video Understanding VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos

Reference 53

Resolution
verified exact
arxiv_id, observed 2026-05-19T17:37:41.712156Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-05-19T17:34:10.344111Z digest=sha256:4e71ea9b00458f5a0945f4ebe030da07ffc09b37fdf2cea72a52ad80be37a823

Observation 606a425b-9f9f-4c25-bfa8-494342b57fef · inbound

Towards Temporal Compositional Reasoning in Long-Form Sports Videos cites this paper.

Towards Temporal Compositional Reasoning in Long-Form Sports Videos VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos

Reference 49

Resolution
unresolved
no resolver link, observed 2026-07-14T19:27:29.843866Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T19:27:29.843866Z digest=sha256:be63ec09efae2302b5de39ebff63fffff62c6d107939526fa57e2857dd1763ce

Observation a78e151e-b2dd-460d-a4f0-a06fc516a95f · inbound

CaST-Bench: Benchmarking Causal Chain-Grounded Spatio-Temporal Reasoning for Video Question Answering cites this paper.

CaST-Bench: Benchmarking Causal Chain-Grounded Spatio-Temporal Reasoning for Video Question Answering VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos

Reference 42

Resolution
verified exact
arxiv_id, observed 2026-05-25T04:55:23.211651Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-05-25T04:54:23.077914Z digest=sha256:d153af946723c428ea6885efd731796c07c4bd7c14b00c49a6f46cfa6e8194d4

Observation b8993290-6c4d-4334-9dc6-93555f599665 · inbound

CaST-Bench: Benchmarking Causal Chain-Grounded Spatio-Temporal Reasoning for Video Question Answering cites this paper.

CaST-Bench: Benchmarking Causal Chain-Grounded Spatio-Temporal Reasoning for Video Question Answering VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos

Reference 42

Resolution
verified exact
arxiv_id, observed 2026-07-04T00:49:17.498640Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-07-04T00:41:02.284215Z digest=sha256:3c83dc979a63e0ef3f64027e067351efda95fc90a1575e66aad8d4ef666c5136

Observation 8827aa6c-7368-48d9-bb61-1f90ba55de1a · inbound

SagaQA: A Multi-hop Reasoning Benchmark for Long-form Narrative Understanding in TV Series cites this paper.

SagaQA: A Multi-hop Reasoning Benchmark for Long-form Narrative Understanding in TV Series VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos

Reference 5

Resolution
verified exact
arxiv_id, observed 2026-07-02T03:16:33.477641Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-06-28T10:14:48.103490Z digest=sha256:6a9264f7916c25d4643e839c1dc60a49b3842bdb6bf012cde12ffac042371b8b

Observation 6c116fb8-6802-400d-9428-98c7b1178a58 · inbound

StoryVideoQA: Scaling Deep Video Understanding with a Large-Scale, Multi-Genre and Auto-Generated Dataset cites this paper.

StoryVideoQA: Scaling Deep Video Understanding with a Large-Scale, Multi-Genre and Auto-Generated Dataset VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos

Reference 32

Resolution
metadata mismatch
arxiv_id, observed 2026-07-02T12:26:57.158892Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-06-28T02:05:47.810096Z digest=sha256:a04ccf015abc8ddfaa5b713a304b5ac9fec8450768dd80aa95bf595032cbb7e6

Observation 97e2e6a3-bea5-46fb-bea7-8b7f1ff6b6a4 · inbound

Watch, Remember, Reason: Human-View Video Understanding with MLLMs cites this paper.

Watch, Remember, Reason: Human-View Video Understanding with MLLMs VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos

Reference 279

Resolution
verified exact
arxiv_id, observed 2026-07-02T17:27:15.118543Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-06-27T22:00:28.350003Z digest=sha256:16ca2d7257b857ac3e6f51892b8683a55c81d08f204ad7c863d4c7ea8cf36166