Pith. sign in

Paper Citation Record · LEDGER

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos

As of 7 August 2026, this Paper Citation Record lists 100 of 122 outbound references and 11 inbound Pith citation observations for arXiv:2506.10857.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2506.10857 v2

Coverage vector

measured 100 of 122 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-07T04:22:56.139701Z

measured 111 of 111 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-07T06:34:17.273281+00:00

measured 11 of 11 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-03T20:23:08.702909Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-04T00:49:17.495045Z

Reference resolution

100 of 122 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved100
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 67bf88f4-239b-4a02-b712-e4ca6827f655 · outbound

This paper cites Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.794507Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.794507Z digest=sha256:bd1d1671f5a57d18f1fd4f4e3bca922889fc73ce23050e8ee3c60c0f58933d04

Observation 6e9ab553-3fcc-48c8-9150-e56adf8fecbb · outbound

This paper cites Qwen2.5-VL Technical Report.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Qwen2.5-VL Technical Report

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.798358Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.798358Z digest=sha256:b3e0ec38d52c75486035d91ac4db989a2a72b9a6afee5accfb209ac9724f2d2f

Observation cd844921-0989-4044-aa69-dbffdb445ed8 · outbound

This paper cites InternLM2 Technical Report.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos InternLM2 Technical Report

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.801744Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.801744Z digest=sha256:1519a7d8a1d060c283a0f82855322780ee35d4fae59d736df5bb4d7430cfc297

Observation aa3c841a-826e-4063-b441-59d7aee0678b · outbound

This paper cites CG-Bench: Clue-grounded Question Answering Benchmark for Long Video Understanding.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos CG-Bench: Clue-grounded Question Answering Benchmark for Long Video Understanding

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.805315Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.805315Z digest=sha256:c530bd5dffe45ec3216051413b8b9842360ab5a68a1ab89b1570c2caa09ac4ec

Observation db6db4af-9926-4f46-9e83-3b382a3516cf · outbound

This paper cites TheoremQA: A Theorem-driven Question Answering dataset.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos TheoremQA: A Theorem-driven Question Answering dataset

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.808811Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.808811Z digest=sha256:1da557a54b3e78767ce678464bd330d0739a15c7abfd18545df0d73c50bf185d

Observation 9acc9133-3f9c-41c5-a370-c8ca38e496ea · outbound

This paper cites Autoeval-video: An automatic benchmark for assessing large vision language models in open-ended video question answering.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Autoeval-video: An automatic benchmark for assessing large vision language models in open-ended video question answering

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.812841Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.812841Z digest=sha256:875b1f4f755a6e185cbbb24c99db309f608ede7cb22cc3f8f939537ed381e3cb

Observation 4eef8657-de74-4207-a670-d3d40a65939f · outbound

This paper cites Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.815725Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.815725Z digest=sha256:4031d9a33c889886819731b120b7536312a25eac991c46168bf5128793aad7ba

Observation 5ee2aabb-d15d-4471-8307-85557ae27857 · outbound

This paper cites Training Verifiers to Solve Math Word Problems.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Training Verifiers to Solve Math Word Problems

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.819219Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.819219Z digest=sha256:c2e830cad8c2ceff67e75554f4507af16f3728dacb781f61abb920115e57c5b1

Observation 3f7009cb-616d-44a6-bd44-2b6e59c6e59e · outbound

This paper cites Lost in Time: A New Temporal Benchmark for VideoLLMs.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Lost in Time: A New Temporal Benchmark for VideoLLMs

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.823070Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.823070Z digest=sha256:c4c64689aea3d2d7dbd8ad9a2f1806f8f450631306d402b970308673070b7819

Observation f75212c6-a201-462d-8cf5-5bfabcb1e49c · outbound

This paper cites EXAMS-V: A Multi-Discipline Multilingual Multimodal Exam Benchmark for Evaluating Vision Language Models.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos EXAMS-V: A Multi-Discipline Multilingual Multimodal Exam Benchmark for Evaluating Vision Language Models

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.826579Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.826579Z digest=sha256:a7eecd4d7f12185423051670677f6b24e9d3dbabd59f18d991028ae14d5e2beb

Observation 37ddbae0-b8c6-41f9-935a-b57fe314946b · outbound

This paper cites Deepl translate: The world’s most accurate trans- lator.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Deepl translate: The world’s most accurate trans- lator

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.829651Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.829651Z digest=sha256:5d3ef09042505c59ae3f26e61010ca106f3415f353c16fa30671455f630efc43

Observation a950fbf6-7e2b-427b-a098-4b7e970c0926 · outbound

This paper cites Gemini 2.0 flash thinking.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Gemini 2.0 flash thinking

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.832779Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.832779Z digest=sha256:ac9b6bc07a9e4ba0eec3362383b39a26d9bccb616e63d8e6d1e8b92f3d9b5e56

Observation 5e3f8b0f-833d-40b8-a89f-00cee31d231b · outbound

This paper cites Mmbench-video: A long-form multi-shot benchmark for holistic video under- standing.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Mmbench-video: A long-form multi-shot benchmark for holistic video under- standing

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.835477Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.835477Z digest=sha256:ff27afb08d23716f6328933431cfb3bd0b49d5e0e8ad3259a49ba8b8f4da11a0

Observation 9675d94b-f65d-4fbb-a217-82b0059f9647 · outbound

This paper cites Video-of-Thought: Step-by-Step Video Reasoning from Perception to Cognition.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Video-of-Thought: Step-by-Step Video Reasoning from Perception to Cognition

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.838095Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.838095Z digest=sha256:f2b867bc1ad19662e05b7704bf27cfd2eee2b610dba9521303ee02a2954cf882

Observation 753a87c7-a443-46e3-9bce-90ba8d4e2f5c · outbound

This paper cites Sciknoweval: Evaluating multi- level scientific knowledge of large language models.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Sciknoweval: Evaluating multi- level scientific knowledge of large language models

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.841030Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.841030Z digest=sha256:5c909f62429928f9e3e9ee7d1c6bdc33e696b3f1de6dd3b4c302f83d4c51f94f

Observation 0849dd15-06d7-43fd-adfe-969771bbac93 · outbound

This paper cites Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.843902Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.843902Z digest=sha256:53e5cc114af02a0b88f3a7629fa5b5d021239d77ca4820b9bec07ee2a491091d

Observation 2695ae24-3a76-4e1f-a39a-35dc60f54fbe · outbound

This paper cites H2OVL-Mississippi Vision Language Models Technical Report.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos H2OVL-Mississippi Vision Language Models Technical Report

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.846897Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.846897Z digest=sha256:d4b1913949fb3fbee2da2f82274eb50336e2101c07aceff71185ab1062ed0986

Observation c4859939-007a-444d-aa0b-c725f89ac507 · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.849759Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.849759Z digest=sha256:526b0ce0095b4af3252892ff9a013489ecdee1d63d9a6d2aaacc6dfd4540ed25

Observation 7c58fbad-de91-4d02-b625-61d4030b97fa · outbound

This paper cites VideoEspresso: A Large-Scale Chain-of-Thought Dataset for Fine-Grained Video Reasoning via Core Frame Selection.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos VideoEspresso: A Large-Scale Chain-of-Thought Dataset for Fine-Grained Video Reasoning via Core Frame Selection

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.852974Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.852974Z digest=sha256:95caa38107b9d282ba402c90547ef2d9b00851dddb25cc4372b591e3fc201d09

Observation 4f68f3c2-48fb-4c88-9dc4-c9e4b0a985d6 · outbound

This paper cites MMWorld: Towards Multi-discipline Multi-faceted World Model Evaluation in Videos.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos MMWorld: Towards Multi-discipline Multi-faceted World Model Evaluation in Videos

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.856234Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.856234Z digest=sha256:ceaf43b58bcb81d30dd6ee2553955b7e3bf777e25852e1225cba8ace2ba5b0dd

Observation c0f4926b-9b3f-4e21-967e-b95936779a4a · outbound

This paper cites Measuring Massive Multitask Language Understanding.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Measuring Massive Multitask Language Understanding

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.859652Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.859652Z digest=sha256:4710e022c2b2f0974c2b66b9938c3f2d1bffd0b40a6d63c8f42f0f6b2fa2dc76

Observation 23b5364e-be60-48e2-8e6d-77a1ca0006f8 · outbound

This paper cites Video-MMMU: Evaluating Knowledge Acquisition from Multi-Discipline Professional Videos.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Video-MMMU: Evaluating Knowledge Acquisition from Multi-Discipline Professional Videos

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.863069Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.863069Z digest=sha256:68bc02efe1b4a4cfacd058fc871a491a05321ac27f45594fc448d2d61ae4c651

Observation 495389a9-ed4f-40c5-a39a-4467210737a0 · outbound

This paper cites C-eval: A multi-level multi-discipline chinese evaluation suite for foundation models.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos C-eval: A multi-level multi-discipline chinese evaluation suite for foundation models

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.866065Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.866065Z digest=sha256:69dc5bcb1adbed8640470fad7c42f8754885bd0af2cdd1594dba91ec703eadf1

Observation aa0582dd-d1da-43cb-af60-a13f67595808 · outbound

This paper cites Vbench: Comprehensive bench- mark suite for video generative models.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Vbench: Comprehensive bench- mark suite for video generative models

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.869308Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.869308Z digest=sha256:10c3bae141f3d62e5a3e639c7db52d59433177702369127c8ce60fb3166e3c47

Observation 251dc541-9fc2-4f9d-9e0f-43a43d65d45b · outbound

This paper cites Olympicarena: Benchmark- ing multi-discipline cognitive reasoning for superintelligent ai.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Olympicarena: Benchmark- ing multi-discipline cognitive reasoning for superintelligent ai

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.872434Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.872434Z digest=sha256:21ba98af776f6ebe1c56d51aafa9a936d8892d1d9c59077d42e553bb782035c0

Observation bb48fda0-189a-4e90-a294-989e03148d7a · outbound

This paper cites LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.875498Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.875498Z digest=sha256:ced915e9c9be8c7f95db9c5ce6f2c488dcf444166523114d1529c35be222087a

Observation 172d0c3b-4e7a-4db9-adac-bce723c074a9 · outbound

This paper cites VisScience: An Extensive Benchmark for Evaluating K12 Educational Multi-modal Scientific Reasoning.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos VisScience: An Extensive Benchmark for Evaluating K12 Educational Multi-modal Scientific Reasoning

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.878707Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.878707Z digest=sha256:963f1937f05e69678c992fb2b6a467955f5c4e80f7760fe2ff306af75bd873bb

Observation 7eae764e-27d8-42d7-a2e7-8a04c60c7397 · outbound

This paper cites TVQA: Localized, Compositional Video Question Answering.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos TVQA: Localized, Compositional Video Question Answering

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.882019Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.882019Z digest=sha256:db850b275c649bc0cc288809389e9b2c34a4759d4e49ebd8f1a35ca64f538bf3

Observation dd312b7a-59eb-4997-941c-a8f1f084af16 · outbound

This paper cites Veu-bench: Towards comprehensive under- standing of video editing.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Veu-bench: Towards comprehensive under- standing of video editing

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.885036Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.885036Z digest=sha256:4b7691dba34caaa97106d20baa4124aa4aed7446b9eb28077b36f7e5fdb16fd7

Observation bdeedada-c8a1-4732-8f62-8830251ce4c6 · outbound

This paper cites Aria: An Open Multimodal Native Mixture-of-Experts Model.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Aria: An Open Multimodal Native Mixture-of-Experts Model

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.888224Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.888224Z digest=sha256:22bd3377b3a47b87d2f1c7ed87fb171563ef3188ba87f3b163770bc65f1b6a41

Observation f76134e5-71df-41ac-80c0-b4b20c61c9f5 · outbound

This paper cites Mvbench: A comprehensive multi-modal video understand- ing benchmark.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Mvbench: A comprehensive multi-modal video understand- ing benchmark

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.891513Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.891513Z digest=sha256:8075ea1f09460f5cddd8b0d9beeadba507899f73ef6abbe04b95e6f536972af4

Observation 464c5e5e-07f5-46f0-ae02-fcf6e2b9ff09 · outbound

This paper cites VideoChat-Flash: Hierarchical Compression for Long-Context Video Modeling.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos VideoChat-Flash: Hierarchical Compression for Long-Context Video Modeling

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.894485Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.894485Z digest=sha256:f5df20c775db45bfd17e5d4e5d367d7fe469215c5f83a137c057f81d80876959

Observation 96a7f6a6-d097-497d-887f-4378e5386efb · outbound

This paper cites VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.898375Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.898375Z digest=sha256:93273b7620dc05e0b94df228aa718764c96b95e265b128acd086359033a83e44

Observation 72944cf2-74c2-4dd2-91fa-073fcf1672fa · outbound

This paper cites VideoVista: A Versatile Benchmark for Video Understanding and Reasoning.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos VideoVista: A Versatile Benchmark for Video Understanding and Reasoning

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.901902Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.901902Z digest=sha256:40717b5534310419db283e3c6ac84ef0bff3e382ef7978fdb9be9b9101bd1c25

Observation 8d67a2a2-fdbe-4af4-ba1b-bf14d005537b · outbound

This paper cites Mmsci: A multimodal multi-discipline dataset for phd-level scientific comprehen- sion.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Mmsci: A multimodal multi-discipline dataset for phd-level scientific comprehen- sion

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.905354Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.905354Z digest=sha256:48d987c9b40c204d86651b890d251b3a314f5fdb251db398b5be2500173ffd10

Observation 777b0caa-5f9e-4163-8fe5-9811e7a48d40 · outbound

This paper cites SceMQA: A Scientific College Entrance Level Multimodal Question Answering Benchmark.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos SceMQA: A Scientific College Entrance Level Multimodal Question Answering Benchmark

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.908709Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.908709Z digest=sha256:4c8dfc3e2d2983a0f0f12fb2147f06039a6a92a1ca0ad072bd3cce3da74b39c9

Observation d3686116-b77e-4086-86e6-93a127e3afbf · outbound

This paper cites Vila: On pre-training for vi- sual language models.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Vila: On pre-training for vi- sual language models

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.912456Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.912456Z digest=sha256:db43e8352d0cc1a7cac88327c767ac9841532357a3486107b3721c55d616f9e2

Observation 4a99a1ed-4c12-4cf3-b715-9a75287a794a · outbound

This paper cites DeepSeek-V3 Technical Report.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos DeepSeek-V3 Technical Report

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.915660Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.915660Z digest=sha256:22a232f9f3736fc5359529e7e90e90dbeda4cd61e5c8347b2b02e8bd6e88b711

Observation b4aacb62-809e-4ff1-8917-6c9b2db81e35 · outbound

This paper cites TempCompass: Do Video LLMs Really Understand Videos?.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos TempCompass: Do Video LLMs Really Understand Videos?

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.919117Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.919117Z digest=sha256:8979602eef630e2ffd8023181bd49e5530d96ea064b98a85b92c3d4124b3ddb7

Observation ca08579a-f769-47a9-87cc-a7bb7a4e650c · outbound

This paper cites E.T. Bench: Towards Open-Ended Event-Level Video-Language Understanding.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos E.T. Bench: Towards Open-Ended Event-Level Video-Language Understanding

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.922688Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.922688Z digest=sha256:5bafc83ae8eff0f3bcf721177d0ee29d153e0f171fb30cc7133ccf085dcc0e5f

Observation ea1b2c88-4fb8-4786-841f-074d073c603c · outbound

This paper cites Llama-3.3-70b-instruct.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Llama-3.3-70b-instruct

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.926445Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.926445Z digest=sha256:3e5ace90cccfb0499547b782d4b6cb7905466715cbdea7c4fd7b3b473c4c3d4e

Observation cafefa2f-9f66-49de-9955-28857541679a · outbound

This paper cites MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.929946Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.929946Z digest=sha256:7f174556f12dc5319f632cd2a8abc79c8f9dd76780200714d60628996d2bf746

Observation 4bc8e262-74ec-44bc-ae1e-02b2b7c087ab · outbound

This paper cites Egoschema: A diagnostic benchmark for very long- form video language understanding.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Egoschema: A diagnostic benchmark for very long- form video language understanding

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.933948Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.933948Z digest=sha256:2b8a38a76eb40ee9abcff6d8f86726e9edde939c9cd71f5eb3e951cc9655a38d

Observation 4288717a-c077-4503-8d0f-6b943dc16086 · outbound

This paper cites ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.937385Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.937385Z digest=sha256:2d15563df06c3cc6a781290b942b6e501f14494ce86a8f225f1ce282bc9b0448

Observation f4dd8165-bd5e-4613-a574-b558d5fe57e6 · outbound

This paper cites Plotqa: Reasoning over scientific plots.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Plotqa: Reasoning over scientific plots

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.941480Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.941480Z digest=sha256:d09a47c1ed9b781b880547224f1fec80d887d0f026b3e79ef036f9ba9f565bd4

Observation ad1ab0a5-8d56-42b7-abc7-9ab6202c0e16 · outbound

This paper cites Video-Bench: A Comprehensive Benchmark and Toolkit for Evaluating Video-based Large Language Models.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Video-Bench: A Comprehensive Benchmark and Toolkit for Evaluating Video-based Large Language Models

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.944763Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.944763Z digest=sha256:b2d770533819293bc8a794cb7eca45d7bbd66cd06b1cb915279876c9146d07f0

Observation 90e2f9bc-4a34-40b3-b521-86f6f1ad70c6 · outbound

This paper cites Hello gpt4-o.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Hello gpt4-o

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.948741Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.948741Z digest=sha256:5d78aed34a19a547cf5b73cdf275a6d04be4cefcafbf1beb6635bea0f0a8e002

Observation 9514c253-91e1-4207-9685-bde03caf9b22 · outbound

This paper cites Introducing openai o1.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Introducing openai o1

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.951948Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.951948Z digest=sha256:f6580f2cfe0603cb2d1988e1fbfc886842ad0a5a8b2d78dd748779e11c8e4faa

Observation f039a56a-1291-4aa6-8310-e8a13a0b95b8 · outbound

This paper cites Openai o3-mini.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Openai o3-mini

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.955676Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.955676Z digest=sha256:847e1a206dc6e30863e9a00b061d7fe5f36d545e73fa25e309aa34da0da185fe

Observation e8356cf3-7c1c-489f-b74f-cd3836ef58e5 · outbound

This paper cites Per- ception test: A diagnostic benchmark for multimodal video models.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Per- ception test: A diagnostic benchmark for multimodal video models

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.959241Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.959241Z digest=sha256:d9dc8433657358ca76bcd4bb3da32176e3e0373a586d301033d3e6fc2805e597

Observation 8456456e-a978-4287-883a-6bb39db100b2 · outbound

This paper cites Robust speech recognition via large-scale weak supervision.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Robust speech recognition via large-scale weak supervision

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.962613Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.962613Z digest=sha256:1bd7ee6417239f17d233707b35ad112458af2de3576679d84dc45f57679178eb

Observation 248a203e-e894-4ac2-9ce7-d528e407e952 · outbound

This paper cites Direct preference optimization: Your language model is secretly a reward model.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Direct preference optimization: Your language model is secretly a reward model

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.965834Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.965834Z digest=sha256:c646160ec861f94e5c75f63a04fe4572926cacd868c0bb1bec1815e3ff2ffeb1

Observation 2bce9224-a4cb-41a3-853a-88f33fd1a58b · outbound

This paper cites CinePile: A Long Video Question Answering Dataset and Benchmark.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos CinePile: A Long Video Question Answering Dataset and Benchmark

Reference 53

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.969084Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.969084Z digest=sha256:6c061d17f78335fb9ba890a0d0cc2ce12d361b4626490b8433055a6b6125ace2

Observation 0403ef84-b2cc-4ba8-b7ea-606cd2b175b1 · outbound

This paper cites Scienceqa: A novel resource for question answering on scholarly articles.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Scienceqa: A novel resource for question answering on scholarly articles

Reference 54

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.972753Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.972753Z digest=sha256:8fb54a65a9eb692045ce4dc09b55ca462a4a57048896720efe54cbac76b34fb9

Observation b7567d2a-afe6-49ac-87b3-75bdf9b6cba0 · outbound

This paper cites Proximal Policy Optimization Algorithms.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Proximal Policy Optimization Algorithms

Reference 55

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.976330Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.976330Z digest=sha256:2df853d358c6c1e1cd09d72653878b0bd408bc0c4bad59793d15e30319b0f863

Observation d67660f1-c14d-4565-a888-d47027a2f72c · outbound

This paper cites Moviechat: From dense token to sparse memory for long video understanding.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Moviechat: From dense token to sparse memory for long video understanding

Reference 56

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.979783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.979783Z digest=sha256:2bdc6eb54c5d74ecc7c11b6008899ee5c62c7528a14f3e58c0161fd3fe3315bf

Observation 91aa0012-efe1-4a8b-ba32-15907154c07b · outbound

This paper cites Scieval: A multi-level large language model evaluation benchmark for scientific re- search.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Scieval: A multi-level large language model evaluation benchmark for scientific re- search

Reference 57

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.983472Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.983472Z digest=sha256:bf4cc2d2e6d39cb3a5ad3f5e82191bceb5d9e45b4c66755003a07e49b849ebcb

Observation 20738237-2470-4115-95df-50ad77de4008 · outbound

This paper cites Movieqa: Understanding stories in movies through question- answering.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Movieqa: Understanding stories in movies through question- answering

Reference 58

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.986695Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.986695Z digest=sha256:43cdc9e5fb628e62865bd2ecefc2bba1cf21529776ab98ea472c8cbbb996da42

Observation a2c0df03-ede1-4de7-8286-ca5772f806c0 · outbound

This paper cites Claude Team.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Claude Team

Reference 59

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.990171Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.990171Z digest=sha256:806308c67c3506075ba61a400e8bedaea8ada39bcc90f917a83984aa632d9db9

Observation 61343ccd-0658-4382-8a41-57d7baedba20 · outbound

This paper cites MiMo-VL Technical Report.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos MiMo-VL Technical Report

Reference 60

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.993691Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.993691Z digest=sha256:42d8a698cf014932d8283acfcc7273e6c026bed7f5a01bedff7f82a9a6238a03

Observation 0fc8315a-a995-42eb-a74d-b37f89622c28 · outbound

This paper cites Gemini: A Family of Highly Capable Multimodal Models.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Gemini: A Family of Highly Capable Multimodal Models

Reference 61

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:55.997443Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:55.997443Z digest=sha256:615330249f0e5db134eb859b3935ad459832f2754244dfddafb4b497c200f5fa

Observation 223a5ac8-47d9-4218-9aed-c491e5c2d770 · outbound

This paper cites Kimi-VL Technical Report.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Kimi-VL Technical Report

Reference 62

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:56.001192Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:56.001192Z digest=sha256:48529a9cec16288b4f75ebb13f91c6977c51ac88b48cf16325f2b427c1b542ec

Observation 574deb97-d5bb-408c-a6d8-0403b5d74e9d · outbound

This paper cites Kwai Keye-VL Technical Report.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Kwai Keye-VL Technical Report

Reference 63

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:56.004930Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:56.004930Z digest=sha256:c60ef0a2ebf47670313dccc67e273ebabb9cb61e56e5c720ecc9406778402b57

Observation a8ba791d-667a-4b4d-a2bf-a7ef871bb11d · outbound

This paper cites Qwq: Reflect deeply on the boundaries of the unknown.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Qwq: Reflect deeply on the boundaries of the unknown

Reference 64

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:56.008810Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:56.008810Z digest=sha256:3046d90c589f11482b7c20f0d45eb23cebbdc49c9d681d95f386b1756ed5d60c

Observation 0cc786e6-eb01-4356-9800-19c9bfa5dc5f · outbound

This paper cites Qwq-32b: Embracing the power of reinforce- ment learning.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Qwq-32b: Embracing the power of reinforce- ment learning

Reference 65

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:56.012332Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:56.012332Z digest=sha256:3004c552c38ca17eb404228fde940613ab8198a09368b0c00c21d3971d7e5fbb

Observation 998bdf44-fffa-4ad1-a2a1-5fda2aa5c176 · outbound

This paper cites LlamaV-o1: Rethinking Step-by-step Visual Reasoning in LLMs.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos LlamaV-o1: Rethinking Step-by-step Visual Reasoning in LLMs

Reference 66

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:56.015726Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:56.015726Z digest=sha256:6f916fba335dc04c4f4180ccbb9a4ce6cca8990e39d8f569b00c454b9228d466

Observation 12d08530-1010-4849-ad8f-3a52100a62b0 · outbound

This paper cites Mea- suring multimodal mathematical reasoning with math-vision dataset.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Mea- suring multimodal mathematical reasoning with math-vision dataset

Reference 67

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:56.019503Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:56.019503Z digest=sha256:e4e2a2c3858b769f266426bbda5ca24265da0cbcd0b0d13bff5ae37cc8da5eb9

Observation a733ad3b-02c9-4ce9-ab71-cf3ee71ca713 · outbound

This paper cites Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution

Reference 68

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:56.022809Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:56.022809Z digest=sha256:45a398b0893f91a199ea38ddf1f1e2332ce5dcedd57a70842b025f969e36095e

Observation b61e18b8-a4b4-41a3-9831-f60c6e691041 · outbound

This paper cites Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization

Reference 69

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:56.026472Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:56.026472Z digest=sha256:c74e6a42a129f7329f1ab673c342f24f9e23413726375136f35e2ad74ddaccc3

Observation 9c63bfad-d6e4-44f8-a6d1-0365e150803d · outbound

This paper cites LVBench: An Extreme Long Video Understanding Benchmark.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos LVBench: An Extreme Long Video Understanding Benchmark

Reference 70

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:56.029698Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:56.029698Z digest=sha256:0762e1607811dcfa97d454133cadbda46fd99d25ca6c6d9058e4be5986e27512

Observation 7721589c-31dc-49cd-85bc-14090328f51d · outbound

This paper cites Internvideo2: Scaling foundation models for mul- timodal video understanding.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Internvideo2: Scaling foundation models for mul- timodal video understanding

Reference 71

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:56.033273Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:56.033273Z digest=sha256:025a69f616302bf47b2141833e5b54f1a9c4125a6f55b2e01b032db2f61c5fda

Observation 35576631-0d20-440c-93e9-b78340cdeae2 · outbound

This paper cites Mmlu-pro: A more robust and challenging multi-task language understanding benchmark.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Mmlu-pro: A more robust and challenging multi-task language understanding benchmark

Reference 72

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:56.036599Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:56.036599Z digest=sha256:7958fcbc7633a7bf22760b7ffb6ca43d5bdfc1db7b7cbb29b2253203fa05f2c9

Observation a8c1bebf-3b71-4951-8ed2-20c1839bf3c5 · outbound

This paper cites InternVideo2.5: Empowering Video MLLMs with Long and Rich Context Modeling.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos InternVideo2.5: Empowering Video MLLMs with Long and Rich Context Modeling

Reference 73

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:56.040389Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:56.040389Z digest=sha256:de88c239457ef95cd44c5c18dd33eeeb8ad69d4891223f24201ca55e10432620

Observation d70a7195-8eeb-4046-a743-304badfbdd03 · outbound

This paper cites Charxiv: Charting gaps in realistic chart understanding in multimodal llms.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Charxiv: Charting gaps in realistic chart understanding in multimodal llms

Reference 74

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:56.044092Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:56.044092Z digest=sha256:873a5b96f3a22612fb63449291ee182a6b6d17cdb68473dd4235457b1204e2d8

Observation 80c7b20b-7eaa-440d-a569-3db0431d1f06 · outbound

This paper cites Chain-of-thought prompting elicits reasoning in large lan- guage models.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Chain-of-thought prompting elicits reasoning in large lan- guage models

Reference 75

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:56.048025Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:56.048025Z digest=sha256:d96a0eb93bf78d354f78aa5a27b093c4e07a00ab93078de656f30916d137009f

Observation 9a8e578c-f3ed-4db6-b45f-5eba1d035eca · outbound

This paper cites STAR: A Benchmark for Situated Reasoning in Real-World Videos.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos STAR: A Benchmark for Situated Reasoning in Real-World Videos

Reference 76

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:56.051254Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:56.051254Z digest=sha256:ff529c708d55d84ca1921de5c9da461830e493e53a10fd416fc1c1b28691b5a6

Observation 09d024e8-859c-4f80-b3c1-2e52fbef5d7b · outbound

This paper cites Longvideobench: A benchmark for long-context interleaved video-language understanding.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Longvideobench: A benchmark for long-context interleaved video-language understanding

Reference 77

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:56.054587Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:56.054587Z digest=sha256:06f95844f2c98af6b5102ae72bf9409f12c19dc2889717c6927171ecdd54c55a

Observation 48a6e6e0-2b1a-4f35-8642-cb8ada73e42d · outbound

This paper cites ChartInsights: Evaluating Multimodal Large Language Models for Low-Level Chart Question Answering.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos ChartInsights: Evaluating Multimodal Large Language Models for Low-Level Chart Question Answering

Reference 78

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:56.057630Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:56.057630Z digest=sha256:2e552c87c6447efb73a7be19a4b918d71e13e5dede18cacfad15886b45d325db

Observation c9615c86-c7a2-4a34-872b-ee5f4d09608c · outbound

This paper cites DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding

Reference 79

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:56.061641Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:56.061641Z digest=sha256:e6d46b5f7e014cb95c8b7f0805494ca0c6b5e8d30e402c7f154d094c1106ee2d

Observation 34c6a477-35c9-4891-a79d-16c5ff0e1c75 · outbound

This paper cites Next-qa: Next phase of question-answering to explaining temporal actions.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Next-qa: Next phase of question-answering to explaining temporal actions

Reference 80

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:56.065135Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:56.065135Z digest=sha256:7375b0c3b9990e5422386f71f9216ddc444d38f709a68621e8625e90d13608b7

Observation f499c913-d804-40f1-819d-bf2eaee718d1 · outbound

This paper cites LLaVA-CoT: Let Vision Language Models Reason Step-by-Step.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos LLaVA-CoT: Let Vision Language Models Reason Step-by-Step

Reference 81

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:56.068528Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:56.068528Z digest=sha256:35995dacb8839f5caee6f7a4cddc74182e8a281933e5ebc9a68ebb148124521a

Observation 9e523dc1-8827-4b22-a657-8ce90271cccb · outbound

This paper cites Qwen2 Technical Report.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Qwen2 Technical Report

Reference 82

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:56.072007Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:56.072007Z digest=sha256:0b4dd4f036b41986f9f7136a690b9ddfd6ddc3dd58df50de08213071519aa7e6

Observation baf03061-74b5-4672-9873-f22e3c60fa29 · outbound

This paper cites Qwen2.5 Technical Report.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Qwen2.5 Technical Report

Reference 83

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:56.075817Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:56.075817Z digest=sha256:d4b6defdb19f2396ad66d2bb7505cb0e57bc8694caa2e400ad2bd07f957579e0

Observation 63efaa54-d18b-432f-8376-97fd9af0a511 · outbound

This paper cites Vript: A video is worth thousands of words.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Vript: A video is worth thousands of words

Reference 84

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:56.079943Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:56.079943Z digest=sha256:0fe1a13233fef796d66cd7ac38f06f3d2adbf41a62c7d209f3622775a916dc69

Observation b5a02474-e2ec-4826-bc43-a1a96178e9c0 · outbound

This paper cites Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for ex- pert agi.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for ex- pert agi

Reference 85

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:56.083505Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:56.083505Z digest=sha256:93e511354f9fe18add814b784674c5ad9cb53ab3f1e0302578584d63e7d95982

Observation 9c644f51-4323-42f6-9942-e752d92768b3 · outbound

This paper cites MMMU-Pro: A More Robust Multi-discipline Multimodal Understanding Benchmark.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos MMMU-Pro: A More Robust Multi-discipline Multimodal Understanding Benchmark

Reference 86

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:56.086963Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:56.086963Z digest=sha256:8d05c4ddc58492d45e93083a3af6f8499fd67654f2822160c4622b0b3e6ead5f

Observation 3352a403-d713-4bc4-8714-334ec1debcbf · outbound

This paper cites MR-GSM8K: A Meta-Reasoning Benchmark for Large Language Model Evaluation.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos MR-GSM8K: A Meta-Reasoning Benchmark for Large Language Model Evaluation

Reference 87

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:56.090625Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:56.090625Z digest=sha256:01e5cd8c428ded823d9726e664d02f2e85a3d47e8e793d9c152a8c1d5a1210e8

Observation 425c0e8d-d767-487e-9278-d7c6bfd58ae2 · outbound

This paper cites VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding

Reference 88

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:56.094091Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:56.094091Z digest=sha256:bd68e30e8eda29a4eb5dc9588c766430a2d924f4ae6f00ff836a0b08ba65990f

Observation 5aff777f-413d-4142-9836-e8741bc8053b · outbound

This paper cites CMMMU: A Chinese Massive Multi-discipline Multimodal Understanding Benchmark.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos CMMMU: A Chinese Massive Multi-discipline Multimodal Understanding Benchmark

Reference 89

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:56.098198Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:56.098198Z digest=sha256:8855f2c6280307bbc90cd9bd569b92e53b796b745575625e842233fd1c458c92

Observation 636a398c-4161-4ff9-b1c1-fda5a06ae8a4 · outbound

This paper cites LvBench: A Benchmark for Long-form Video Understanding with Versatile Multi-modal Question Answering.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos LvBench: A Benchmark for Long-form Video Understanding with Versatile Multi-modal Question Answering

Reference 90

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:56.102015Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:56.102015Z digest=sha256:fd2914774d55370d41d19c102c46fa43d2e86108bbea58e26024e6e66ad2b347

Observation 780e01ce-6412-459e-9e7b-5403e03752ce · outbound

This paper cites Long Context Transfer from Language to Vision.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Long Context Transfer from Language to Vision

Reference 91

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:56.105590Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:56.105590Z digest=sha256:2103a73f82e68966bfa2154da2faf9e8e16fbca896f92f6b00af3bff01bf58b0

Observation 737f9633-f141-463b-b19e-f15e39a533b1 · outbound

This paper cites MMVU: Measuring Expert-Level Multi-Discipline Video Understanding.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos MMVU: Measuring Expert-Level Multi-Discipline Video Understanding

Reference 92

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:56.109578Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:56.109578Z digest=sha256:2bd6ce6038b3f11b4b69e51b1406f4c3e5b32b0996b0d199d8f3abf34f51d511

Observation aae769e7-ed42-4d67-b01c-f74bb405cab7 · outbound

This paper cites MLVU: Benchmarking Multi-task Long Video Understanding.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos MLVU: Benchmarking Multi-task Long Video Understanding

Reference 93

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:56.113344Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:56.113344Z digest=sha256:51bfdcaf1ffa7b866e107adc895593f86134995c80af82a52600e3c5f9a80bf8

Observation 759fdcf6-4d27-45f7-b53b-2c2bedb2cbd5 · outbound

This paper cites Au- toshot: A short video dataset and state-of-the-art shot bound- ary detection.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Au- toshot: A short video dataset and state-of-the-art shot bound- ary detection

Reference 94

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:56.117140Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:56.117140Z digest=sha256:089d2198470f432b2b840d87021f76a3e4ebf4c5722f42f1d53ae75cb327c111

Observation c9b0cd36-2a4d-4ce0-b797-719a13978b05 · outbound

This paper cites • Multi-step process 1: A → B → C → D.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos • Multi-step process 1: A → B → C → D

Reference 95

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:56.121263Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:56.121263Z digest=sha256:afff9512ef05e12253ab155ca13d202544399543a8d32129f63e24d592611ff5

Observation d2abdced-fcf3-4473-80e9-510a730d7196 · outbound

This paper cites • Multi-step process 1: A → B → C → D.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos • Multi-step process 1: A → B → C → D

Reference 96

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:56.124805Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:56.124805Z digest=sha256:6f1ac09b942bd18f542a6a7353cb224bba55a04bc6dadbfad54e4c20d41990c1

Observation 054d7390-470b-43cd-8851-e4691ff87b5e · outbound

This paper cites • Multi-step process: D → C → B → A.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos • Multi-step process: D → C → B → A

Reference 97

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:56.128206Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:56.128206Z digest=sha256:712fbad97d03bd7194cdc61642ff463e53ab300ac6878d0c18faf9030550c2f3

Observation b8bd4edb-813b-4535-9876-4ea20b8ee2d5 · outbound

This paper cites • Multi-step process: D → C → B → A.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos • Multi-step process: D → C → B → A

Reference 98

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:56.132146Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:56.132146Z digest=sha256:111170f52d570cefa79f3f91fad7f5ee0d5f168380a0077c348d43bc73cf93a9

Observation ee36e1ad-397c-49c7-8fa2-1440431e6943 · outbound

This paper cites • Multi-step process: A → C → D → B.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos • Multi-step process: A → C → D → B

Reference 99

Resolution
unresolved
no resolver link, observed 2026-08-07T04:22:56.135839Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:22:56.135839Z digest=sha256:3c1a717f6c793ad0750e605bd77c2b97442c29b6951e5665563c2a41bd84ce43

Observation 1081268f-4dd7-4e6c-a68f-7147abad3086 · outbound

This paper cites an unresolved cited work.

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos Unresolved cited work

Reference 100

Resolution
unresolved
raw_fallback, observed 2026-08-07T04:22:57.184540Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T04:22:56.139701Z digest=sha256:c22f63fb59ede14204b4f72bf6f690f87ae22a5b9dd3592aa28c063077a68625

Pith citing papers

Observation f7cca12f-0ef3-48ae-8da9-24c49c949add · inbound

VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs cites this paper.

VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos

Reference 106

Resolution
unresolved
no resolver link, observed 2026-08-03T20:23:08.702909Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T20:23:08.702909Z digest=sha256:95cb82960ee82e54d6d4a086d967cd5d6e2a253707f8652a123a6dd9111aa014

Observation 26f4061c-be93-4ade-b1a7-a088468f27ca · inbound

Watching, Reasoning, and Searching: A Video Deep Research Benchmark on Open Web for Agentic Video Reasoning cites this paper.

Watching, Reasoning, and Searching: A Video Deep Research Benchmark on Open Web for Agentic Video Reasoning VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos

Reference 16

Resolution
verified exact
arxiv_id, observed 2026-05-21T16:40:22.769581Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-21T16:35:24.557809Z digest=sha256:fc2bbc956673154b845c27906be07c0b8172006af1539caaa1004357d47878fe

Observation ca25f97a-b15e-4692-acc8-dac577a40f42 · inbound

Diagnosing Long-Video Quantitative Reasoning in Multimodal LLMs via Enumeration and Counting cites this paper.

Diagnosing Long-Video Quantitative Reasoning in Multimodal LLMs via Enumeration and Counting VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos

Reference 52

Resolution
unresolved
no resolver link, observed 2026-07-13T15:29:31.834566Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T15:29:31.834566Z digest=sha256:8b4067bae886ea410790853bf3fec84bbc563cc8529ce226ae1aee054e43fabb

Observation 73a3b076-d662-48e9-9632-ba373fc1cdd5 · inbound

Chain-of-Glimpse: Search-Guided Progressive Object-Grounded Reasoning for Video Understanding cites this paper.

Chain-of-Glimpse: Search-Guided Progressive Object-Grounded Reasoning for Video Understanding VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos

Reference 53

Resolution
verified exact
arxiv_id, observed 2026-05-10T12:05:22.183158Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-10T12:03:09.408019Z digest=sha256:d8f0cd375816d0c3463bdb1b02b5af2c231895017382d19060826590f207f50b

Observation 80897de9-8c46-48d2-a396-247283b3bc12 · inbound

Chain-of-Glimpse: Search-Guided Progressive Object-Grounded Reasoning for Video Understanding cites this paper.

Chain-of-Glimpse: Search-Guided Progressive Object-Grounded Reasoning for Video Understanding VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos

Reference 53

Resolution
verified exact
arxiv_id, observed 2026-05-19T17:37:41.712156Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-19T17:34:10.344111Z digest=sha256:989cae30315e8827fe30f1ae4f0ba9e8f96ffe9f8dde7192fe263f8ca779f3ff

Observation 606a425b-9f9f-4c25-bfa8-494342b57fef · inbound

Towards Temporal Compositional Reasoning in Long-Form Sports Videos cites this paper.

Towards Temporal Compositional Reasoning in Long-Form Sports Videos VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos

Reference 49

Resolution
unresolved
no resolver link, observed 2026-07-14T19:27:29.843866Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T19:27:29.843866Z digest=sha256:0041ff2f8d9501af27cd1797079f2254fd533a4e3ad1d63c524bb928b083c498

Observation a78e151e-b2dd-460d-a4f0-a06fc516a95f · inbound

CaST-Bench: Benchmarking Causal Chain-Grounded Spatio-Temporal Reasoning for Video Question Answering cites this paper.

CaST-Bench: Benchmarking Causal Chain-Grounded Spatio-Temporal Reasoning for Video Question Answering VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos

Reference 42

Resolution
verified exact
arxiv_id, observed 2026-05-25T04:55:23.211651Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-25T04:54:23.077914Z digest=sha256:20a5b2a2349e931905452b83000658dbb6e528f9447647b8b077c5a99c413b77

Observation b8993290-6c4d-4334-9dc6-93555f599665 · inbound

CaST-Bench: Benchmarking Causal Chain-Grounded Spatio-Temporal Reasoning for Video Question Answering cites this paper.

CaST-Bench: Benchmarking Causal Chain-Grounded Spatio-Temporal Reasoning for Video Question Answering VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos

Reference 42

Resolution
verified exact
arxiv_id, observed 2026-07-04T00:49:17.498640Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-07-04T00:41:02.284215Z digest=sha256:8ab5ba9026e4f916316be5ac8ad4e2459dd93bd6a1b7c9edd5cdb4cef5be29b1

Observation 8827aa6c-7368-48d9-bb61-1f90ba55de1a · inbound

SagaQA: A Multi-hop Reasoning Benchmark for Long-form Narrative Understanding in TV Series cites this paper.

SagaQA: A Multi-hop Reasoning Benchmark for Long-form Narrative Understanding in TV Series VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos

Reference 5

Resolution
verified exact
arxiv_id, observed 2026-07-02T03:16:33.477641Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-06-28T10:14:48.103490Z digest=sha256:49d8f1341478783f465a5ce98b33658fedfb01516eb5c2339ecfa6e5accbad69

Observation 6c116fb8-6802-400d-9428-98c7b1178a58 · inbound

StoryVideoQA: Scaling Deep Video Understanding with a Large-Scale, Multi-Genre and Auto-Generated Dataset cites this paper.

StoryVideoQA: Scaling Deep Video Understanding with a Large-Scale, Multi-Genre and Auto-Generated Dataset VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos

Reference 32

Resolution
metadata mismatch
arxiv_id, observed 2026-07-02T12:26:57.158892Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-06-28T02:05:47.810096Z digest=sha256:1b1ca5485bffaafd7ea66898e472562e0498a4808d4fe8937595c7dd2c703d9e

Observation 97e2e6a3-bea5-46fb-bea7-8b7f1ff6b6a4 · inbound

Watch, Remember, Reason: Human-View Video Understanding with MLLMs cites this paper.

Watch, Remember, Reason: Human-View Video Understanding with MLLMs VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos

Reference 279

Resolution
verified exact
arxiv_id, observed 2026-07-02T17:27:15.118543Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-06-27T22:00:28.350003Z digest=sha256:31c05dd070dd001beaecbde2629a5cbaa4143eed0217ddd2f8934f4e79269288