{"as_of":"2026-08-17T03:29:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5a52253ffd0b311cdbeb9edee8730bf1a27b9690046cb4f4f4f9f260086843c3","coverage":[{"denominator":122,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:22:56.139701Z","state":"measured"},{"denominator":111,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":111,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":11,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":11,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T20:23:08.702909Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T00:49:17.495045Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10857","snapshot_observed_at":"2026-08-03T20:23:08.702909Z","title":"Vrbench: A benchmark for multi-step reasoning in long narrative videos.arXiv preprint arXiv:2506.10857,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-13T06:51:54.672676Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":106,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:08.702909Z"},"links":{"cited_paper":"/paper/2506.10857","citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:84a88895c4f7ac7bf556f4b653f24393ef69468ddcd0e3ebf7d69eb66f5d8b81","observation_id":"f7cca12f-0ef3-48ae-8da9-24c49c949add","resolution":{"observed_at":"2026-08-03T20:23:08.702909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"cited_work":{"arxiv_id":"2506.10857","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10857","snapshot_observed_at":"2026-07-04T00:49:17.495045Z","title":"Vrbench: A benchmark for multi-step reasoning in long nar- rative videos","venue":null,"work_id":"5ff34ad0-8179-49bb-9f70-4b2cd18b4aa8","year":2025},"citing_paper":{"arxiv_id":"2601.06943","last_updated":"2026-05-18T06:58:21Z","snapshot_observed_at":"2026-08-15T22:39:05.824128Z","submitted_at":"2026-01-11T15:07:37Z","title":"Watching, Reasoning, and Searching: A Video Deep Research Benchmark on Open Web for Agentic Video Reasoning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-21T16:35:24.557809Z"},"links":{"cited_paper":"/paper/2506.10857","citing_paper":"/paper/2601.06943"},"observation_digest":"sha256:d2632b8a6e9253ac69c0a90e7e40b99540639d0df64d0e0621f9cec7b5623dfe","observation_id":"26f4061c-be93-4ade-b1a7-a088468f27ca","resolution":{"observed_at":"2026-05-21T16:40:22.769581Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10857","snapshot_observed_at":"2026-07-13T15:29:31.834566Z","title":"arXiv preprint arXiv:2506.10857 (2025) 1, 4, 5 18 F","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.29943","last_updated":"2026-07-10T15:58:11Z","snapshot_observed_at":"2026-08-15T13:16:33.355324Z","submitted_at":"2026-03-31T16:16:17Z","title":"Diagnosing Long-Video Quantitative Reasoning in Multimodal LLMs via Enumeration and Counting","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-13T15:29:31.834566Z"},"links":{"cited_paper":"/paper/2506.10857","citing_paper":"/paper/2603.29943"},"observation_digest":"sha256:1dd6e3febf89f4eec1d5f71e41889a53f05bf3d7ed064db3a4381c9139ea51ac","observation_id":"ca25f97a-b15e-4692-acc8-dac577a40f42","resolution":{"observed_at":"2026-07-13T15:29:31.834566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"cited_work":{"arxiv_id":"2506.10857","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10857","snapshot_observed_at":"2026-07-04T00:49:17.495045Z","title":"Vrbench: A benchmark for multi-step reasoning in long nar- rative videos","venue":null,"work_id":"5ff34ad0-8179-49bb-9f70-4b2cd18b4aa8","year":2025},"citing_paper":{"arxiv_id":"2604.14692","last_updated":"2026-05-15T12:00:53Z","snapshot_observed_at":"2026-08-16T15:18:58.448131Z","submitted_at":"2026-04-16T06:50:20Z","title":"Chain-of-Glimpse: Search-Guided Progressive Object-Grounded Reasoning for Video Understanding","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-10T12:03:09.408019Z"},"links":{"cited_paper":"/paper/2506.10857","citing_paper":"/paper/2604.14692"},"observation_digest":"sha256:0961b72bca9d4f81eb77d15100d1b16be6c188c227b688e20e725abf51ad95f2","observation_id":"73a3b076-d662-48e9-9632-ba373fc1cdd5","resolution":{"observed_at":"2026-05-10T12:05:22.183158Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"cited_work":{"arxiv_id":"2506.10857","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10857","snapshot_observed_at":"2026-07-04T00:49:17.495045Z","title":"Vrbench: A benchmark for multi-step reasoning in long nar- rative videos","venue":null,"work_id":"5ff34ad0-8179-49bb-9f70-4b2cd18b4aa8","year":2025},"citing_paper":{"arxiv_id":"2604.14692","last_updated":"2026-05-15T12:00:53Z","snapshot_observed_at":"2026-08-16T15:18:58.448131Z","submitted_at":"2026-04-16T06:50:20Z","title":"Chain-of-Glimpse: Search-Guided Progressive Object-Grounded Reasoning for Video Understanding","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-19T17:34:10.344111Z"},"links":{"cited_paper":"/paper/2506.10857","citing_paper":"/paper/2604.14692"},"observation_digest":"sha256:28d97cdda5acf4c7b9f9fcf37c248965e1ab045b400a1e6945bb3891f01a756f","observation_id":"80897de9-8c46-48d2-a396-247283b3bc12","resolution":{"observed_at":"2026-05-19T17:37:41.712156Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10857","snapshot_observed_at":"2026-07-14T19:27:29.843866Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.22226","last_updated":"2026-07-13T04:05:34Z","snapshot_observed_at":"2026-08-11T05:21:52.457685Z","submitted_at":"2026-04-24T05:02:03Z","title":"Towards Temporal Compositional Reasoning in Long-Form Sports Videos","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-14T19:27:29.843866Z"},"links":{"cited_paper":"/paper/2506.10857","citing_paper":"/paper/2604.22226"},"observation_digest":"sha256:8fb13543fe7cc25d0d88f24ba63eb1075f0690eb3e582a46c071ae8e607d645d","observation_id":"606a425b-9f9f-4c25-bfa8-494342b57fef","resolution":{"observed_at":"2026-07-14T19:27:29.843866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"cited_work":{"arxiv_id":"2506.10857","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10857","snapshot_observed_at":"2026-07-04T00:49:17.495045Z","title":"Vrbench: A benchmark for multi-step reasoning in long nar- rative videos","venue":null,"work_id":"5ff34ad0-8179-49bb-9f70-4b2cd18b4aa8","year":2025},"citing_paper":{"arxiv_id":"2605.23216","last_updated":"2026-07-02T06:54:56Z","snapshot_observed_at":"2026-08-03T00:30:19.785022Z","submitted_at":"2026-05-22T04:19:29Z","title":"CaST-Bench: Benchmarking Causal Chain-Grounded Spatio-Temporal Reasoning for Video Question Answering","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-25T04:54:23.077914Z"},"links":{"cited_paper":"/paper/2506.10857","citing_paper":"/paper/2605.23216"},"observation_digest":"sha256:120bd28212c6213e12704a1f21354c25ec0b3ab5a9bb6656885e6f2fe3401473","observation_id":"a78e151e-b2dd-460d-a4f0-a06fc516a95f","resolution":{"observed_at":"2026-05-25T04:55:23.211651Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"cited_work":{"arxiv_id":"2506.10857","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10857","snapshot_observed_at":"2026-07-04T00:49:17.495045Z","title":"Vrbench: A benchmark for multi-step reasoning in long nar- rative videos","venue":null,"work_id":"5ff34ad0-8179-49bb-9f70-4b2cd18b4aa8","year":2025},"citing_paper":{"arxiv_id":"2605.23216","last_updated":"2026-07-02T06:54:56Z","snapshot_observed_at":"2026-08-03T00:30:19.785022Z","submitted_at":"2026-05-22T04:19:29Z","title":"CaST-Bench: Benchmarking Causal Chain-Grounded Spatio-Temporal Reasoning for Video Question Answering","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-04T00:41:02.284215Z"},"links":{"cited_paper":"/paper/2506.10857","citing_paper":"/paper/2605.23216"},"observation_digest":"sha256:0fe5af901c73180307aab9b85077d660042e11ef39272cc789e40761c9192e17","observation_id":"b8993290-6c4d-4334-9dc6-93555f599665","resolution":{"observed_at":"2026-07-04T00:49:17.498640Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"cited_work":{"arxiv_id":"2506.10857","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10857","snapshot_observed_at":"2026-07-04T00:49:17.495045Z","title":"Vrbench: A benchmark for multi-step reasoning in long nar- rative videos","venue":null,"work_id":"5ff34ad0-8179-49bb-9f70-4b2cd18b4aa8","year":2025},"citing_paper":{"arxiv_id":"2606.03301","last_updated":"2026-06-02T08:14:01Z","snapshot_observed_at":"2026-08-16T19:31:50.673196Z","submitted_at":"2026-06-02T08:14:01Z","title":"SagaQA: A Multi-hop Reasoning Benchmark for Long-form Narrative Understanding in TV Series","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-28T10:14:48.103490Z"},"links":{"cited_paper":"/paper/2506.10857","citing_paper":"/paper/2606.03301"},"observation_digest":"sha256:0be617e8b12f10176c29f4ab837790f8961cc3e738269ed1e3552505885004e4","observation_id":"8827aa6c-7368-48d9-bb61-1f90ba55de1a","resolution":{"observed_at":"2026-07-02T03:16:33.477641Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"cited_work":{"arxiv_id":"2506.10857","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10857","snapshot_observed_at":"2026-07-04T00:49:17.495045Z","title":"Vrbench: A benchmark for multi-step reasoning in long nar- rative videos","venue":null,"work_id":"5ff34ad0-8179-49bb-9f70-4b2cd18b4aa8","year":2025},"citing_paper":{"arxiv_id":"2606.06338","last_updated":"2026-06-04T16:12:43Z","snapshot_observed_at":"2026-08-14T23:36:31.970442Z","submitted_at":"2026-06-04T16:12:43Z","title":"StoryVideoQA: Scaling Deep Video Understanding with a Large-Scale, Multi-Genre and Auto-Generated Dataset","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-28T02:05:47.810096Z"},"links":{"cited_paper":"/paper/2506.10857","citing_paper":"/paper/2606.06338"},"observation_digest":"sha256:c69fd1f85d3e1b53b1a88d911b7c37b617c1b61b58fcdb7503a28398a48d72d2","observation_id":"6c116fb8-6802-400d-9428-98c7b1178a58","resolution":{"observed_at":"2026-07-02T12:26:57.158892Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"cited_work":{"arxiv_id":"2506.10857","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10857","snapshot_observed_at":"2026-07-04T00:49:17.495045Z","title":"Vrbench: A benchmark for multi-step reasoning in long nar- rative videos","venue":null,"work_id":"5ff34ad0-8179-49bb-9f70-4b2cd18b4aa8","year":2025},"citing_paper":{"arxiv_id":"2606.07433","last_updated":"2026-06-05T16:29:13Z","snapshot_observed_at":"2026-08-01T21:05:06.439607Z","submitted_at":"2026-06-05T16:29:13Z","title":"Watch, Remember, Reason: Human-View Video Understanding with MLLMs","version":1},"reference_index":279,"source":"pdf_text","source_observed_at":"2026-06-27T22:00:28.350003Z"},"links":{"cited_paper":"/paper/2506.10857","citing_paper":"/paper/2606.07433"},"observation_digest":"sha256:ce0356e2c59309cfcdebe12831bd52ea2b8c1cf42cdfc58f2fbcb5c4ac87b918","observation_id":"97e2e6a3-bea5-46fb-bea7-8b7f1ff6b6a4","resolution":{"observed_at":"2026-07-02T17:27:15.118543Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.10857/citation-record","integrity":"/paper/2506.10857/integrity","json":"/paper/2506.10857/citation-record.json","paper":"/paper/2506.10857"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-08-17T03:25:04.404839Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-07T04:22:55.794507Z","title":"Phi-3 technical report: A highly capable language model locally on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.794507Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:ed892ad489adb3f86600129d282b4ac7d16316182a8978a36c381caea6e21fe6","observation_id":"67bf88f4-239b-4a02-b712-e4ca6827f655","resolution":{"observed_at":"2026-08-07T04:22:55.794507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T04:22:55.798358Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.798358Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:4dfedeb27887093a57b007773265237a7737793aec08a92d8d3452f245b2c588","observation_id":"6e9ab553-3fcc-48c8-9150-e56adf8fecbb","resolution":{"observed_at":"2026-08-07T04:22:55.798358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17297","last_updated":"2024-03-26T00:53:24Z","snapshot_observed_at":"2026-08-12T16:46:46.561976Z","submitted_at":"2024-03-26T00:53:24Z","title":"InternLM2 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17297","snapshot_observed_at":"2026-08-07T04:22:55.801744Z","title":"Internlm2 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.801744Z"},"links":{"cited_paper":"/paper/2403.17297","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:eddb877510ec63c091dfd7f482a2babf5c357b4592308c885cf88c44106db8b6","observation_id":"cd844921-0989-4044-aa69-dbffdb445ed8","resolution":{"observed_at":"2026-08-07T04:22:55.801744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.12075","last_updated":"2024-12-16T18:46:45Z","snapshot_observed_at":"2026-08-17T01:38:26.232918Z","submitted_at":"2024-12-16T18:46:45Z","title":"CG-Bench: Clue-grounded Question Answering Benchmark for Long Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.12075","snapshot_observed_at":"2026-08-07T04:22:55.805315Z","title":"Cg- bench: Clue-grounded question answering benchmark for long video understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.805315Z"},"links":{"cited_paper":"/paper/2412.12075","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:ed1c53a6ae0ada2972618eb042c164992d944ac58249a9ba2848f40595bf0c3c","observation_id":"aa3c841a-826e-4063-b441-59d7aee0678b","resolution":{"observed_at":"2026-08-07T04:22:55.805315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.12524","last_updated":"2023-12-06T03:02:45Z","snapshot_observed_at":"2026-08-16T15:31:20.233503Z","submitted_at":"2023-05-21T17:51:35Z","title":"TheoremQA: A Theorem-driven Question Answering dataset","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.12524","snapshot_observed_at":"2026-08-07T04:22:55.808811Z","title":"Theo- remqa: A theorem-driven question answering dataset","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.808811Z"},"links":{"cited_paper":"/paper/2305.12524","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:d5b876aeb2a1017af25817882fd0544f413165ec9e0c84abf6b3584ce38ae70e","observation_id":"db6db4af-9926-4f46-9e83-3b382a3516cf","resolution":{"observed_at":"2026-08-07T04:22:55.808811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:22:55.812841Z","title":"Autoeval-video: An automatic benchmark for assessing large vision language models in open-ended video question answering","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.812841Z"},"links":{"citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:ecbc2dae4af0de4c522f6e01942a6b14e778b9ff42bc6837c89872ff0a37f89f","observation_id":"9acc9133-3f9c-41c5-a370-c8ca38e496ea","resolution":{"observed_at":"2026-08-07T04:22:55.812841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T04:22:55.815725Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test- time scaling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.815725Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:3ba259e6f38c9fc5022b1964cec2f1e95df758d5e1ce92b4a9a6764a49d343b8","observation_id":"4eef8657-de74-4207-a670-d3d40a65939f","resolution":{"observed_at":"2026-08-07T04:22:55.815725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-07T04:22:55.819219Z","title":"Train- ing verifiers to solve math word problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.819219Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:086c355c9b7455bcd02b6f659644e6f410ca6f880dedcf066caed8f7ae79d732","observation_id":"5ee2aabb-d15d-4471-8307-85557ae27857","resolution":{"observed_at":"2026-08-07T04:22:55.819219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07752","last_updated":"2025-03-25T09:46:02Z","snapshot_observed_at":"2026-08-16T13:10:47.063439Z","submitted_at":"2024-10-10T09:28:36Z","title":"Lost in Time: A New Temporal Benchmark for VideoLLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07752","snapshot_observed_at":"2026-08-07T04:22:55.823070Z","title":"Tvbench: Re- designing video-language evaluation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.823070Z"},"links":{"cited_paper":"/paper/2410.07752","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:885ac0a536bc41a2eb786ca3adf13f2f7017fd37162c4b63fb17aec069e05d9b","observation_id":"3f7009cb-616d-44a6-bd44-2b6e59c6e59e","resolution":{"observed_at":"2026-08-07T04:22:55.823070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.10378","last_updated":"2024-03-15T15:08:39Z","snapshot_observed_at":"2026-08-16T14:09:25.342714Z","submitted_at":"2024-03-15T15:08:39Z","title":"EXAMS-V: A Multi-Discipline Multilingual Multimodal Exam Benchmark for Evaluating Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.10378","snapshot_observed_at":"2026-08-07T04:22:55.826579Z","title":"Exams-v: A multi-discipline multilingual multi- modal exam benchmark for evaluating vision language mod- els","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.826579Z"},"links":{"cited_paper":"/paper/2403.10378","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:a64a297b1a186e7c836a6dfb05c0226f99fe354746dd7a110070a36264e50512","observation_id":"f75212c6-a201-462d-8cf5-5bfabcb1e49c","resolution":{"observed_at":"2026-08-07T04:22:55.826579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:22:55.829651Z","title":"Deepl translate: The world’s most accurate trans- lator","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.829651Z"},"links":{"citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:bd3d97de7531528d7a18b9aa804a471d23cdcaed908d32f292ebf592452c30e1","observation_id":"37ddbae0-b8c6-41f9-935a-b57fe314946b","resolution":{"observed_at":"2026-08-07T04:22:55.829651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:22:55.832779Z","title":"Gemini 2.0 flash thinking","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.832779Z"},"links":{"citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:d5d40c7760520df638d672155357b6b5508bca383fd66c8d58078363b9a43a6d","observation_id":"a950fbf6-7e2b-427b-a098-4b7e970c0926","resolution":{"observed_at":"2026-08-07T04:22:55.832779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:22:55.835477Z","title":"Mmbench-video: A long-form multi-shot benchmark for holistic video under- standing","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.835477Z"},"links":{"citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:7258b89abcee82b1d52d9970a2e928bbce98c3572b8d7a1ab48f5f5f8a2c592e","observation_id":"5e3f8b0f-833d-40b8-a89f-00cee31d231b","resolution":{"observed_at":"2026-08-07T04:22:55.835477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03230","last_updated":"2024-05-07T11:55:10Z","snapshot_observed_at":"2026-08-16T13:54:43.185588Z","submitted_at":"2024-05-07T11:55:10Z","title":"Video-of-Thought: Step-by-Step Video Reasoning from Perception to Cognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03230","snapshot_observed_at":"2026-08-07T04:22:55.838095Z","title":"Video-of-thought: Step-by-step video reasoning from perception to cognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.838095Z"},"links":{"cited_paper":"/paper/2501.03230","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:4c30c4f5ceeb63bc7038aedb7d3c50e0ac3ca573bf0aff2ca11279d7fcf673b7","observation_id":"9675d94b-f65d-4fbb-a217-82b0059f9647","resolution":{"observed_at":"2026-08-07T04:22:55.838095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:22:55.841030Z","title":"Sciknoweval: Evaluating multi- level scientific knowledge of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.841030Z"},"links":{"citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:4d03f3745d12df23f5c7329d318c6135ac18e29c4899d2624161e01a4f06a449","observation_id":"753a87c7-a443-46e3-9bce-90ba8d4e2f5c","resolution":{"observed_at":"2026-08-07T04:22:55.841030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-07T04:22:55.843902Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.843902Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:c9dd97a29d2a8af70b222c04094303a9ef800ac09f3f652506383f1de4183dbc","observation_id":"0849dd15-06d7-43fd-adfe-969771bbac93","resolution":{"observed_at":"2026-08-07T04:22:55.843902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13611","last_updated":"2024-10-17T14:46:34Z","snapshot_observed_at":"2026-08-16T13:08:23.452837Z","submitted_at":"2024-10-17T14:46:34Z","title":"H2OVL-Mississippi Vision Language Models Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13611","snapshot_observed_at":"2026-08-07T04:22:55.846897Z","title":"H2ovl-mississippi vision language models technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.846897Z"},"links":{"cited_paper":"/paper/2410.13611","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:cb3ad104363f8224051728c16f8cff850cb92de4d5f15c4287d574b498a82295","observation_id":"2695ae24-3a76-4e1f-a39a-35dc60f54fbe","resolution":{"observed_at":"2026-08-07T04:22:55.846897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T04:22:55.849759Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.849759Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:d201d681aa7c3d011236ea4f2163bf10e54efb860c72f8262469398c7f272254","observation_id":"c4859939-007a-444d-aa0b-c725f89ac507","resolution":{"observed_at":"2026-08-07T04:22:55.849759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14794","last_updated":"2024-11-22T08:33:36Z","snapshot_observed_at":"2026-08-14T11:20:48.477344Z","submitted_at":"2024-11-22T08:33:36Z","title":"VideoEspresso: A Large-Scale Chain-of-Thought Dataset for Fine-Grained Video Reasoning via Core Frame Selection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14794","snapshot_observed_at":"2026-08-07T04:22:55.852974Z","title":"Videoespresso: A large-scale chain-of-thought dataset for fine-grained video reasoning via core frame selection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.852974Z"},"links":{"cited_paper":"/paper/2411.14794","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:34090dc2a91683ca96598b509181e503403b5bfa17efb6ed025f0bc732f33c0b","observation_id":"7c58fbad-de91-4d02-b625-61d4030b97fa","resolution":{"observed_at":"2026-08-07T04:22:55.852974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08407","last_updated":"2024-07-30T03:15:55Z","snapshot_observed_at":"2026-08-16T13:43:39.575307Z","submitted_at":"2024-06-12T16:54:54Z","title":"MMWorld: Towards Multi-discipline Multi-faceted World Model Evaluation in Videos","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08407","snapshot_observed_at":"2026-08-07T04:22:55.856234Z","title":"Mmworld: Towards multi-discipline multi-faceted world model evaluation in videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.856234Z"},"links":{"cited_paper":"/paper/2406.08407","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:bf42f055e07ac3addc33c98e5fe7319a5b1082ca94c0a22f312a16de7ba6d062","observation_id":"4f68f3c2-48fb-4c88-9dc4-c9e4b0a985d6","resolution":{"observed_at":"2026-08-07T04:22:55.856234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-13T20:44:28.824685Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-07T04:22:55.859652Z","title":"Mea- suring massive multitask language understanding","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.859652Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:8f390f09d676a128b61d87ee46b585e29a0cb4e824608357db0ca3abd5191117","observation_id":"c0f4926b-9b3f-4e21-967e-b95936779a4a","resolution":{"observed_at":"2026-08-07T04:22:55.859652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13826","last_updated":"2025-01-23T16:51:47Z","snapshot_observed_at":"2026-08-16T03:39:21.994462Z","submitted_at":"2025-01-23T16:51:47Z","title":"Video-MMMU: Evaluating Knowledge Acquisition from Multi-Discipline Professional Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13826","snapshot_observed_at":"2026-08-07T04:22:55.863069Z","title":"Video-mmmu: Evaluating knowledge acquisition from multi-discipline pro- fessional videos","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.863069Z"},"links":{"cited_paper":"/paper/2501.13826","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:15c78d050ce9f2ed80fc4f33c789b6f53d6b3fa349e4a72c46457eaba5ab0cd5","observation_id":"23b5364e-be60-48e2-8e6d-77a1ca0006f8","resolution":{"observed_at":"2026-08-07T04:22:55.863069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:22:55.866065Z","title":"C-eval: A multi-level multi-discipline chinese evaluation suite for foundation models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.866065Z"},"links":{"citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:93cdca571923982ff7f7407359466aff0d7752eb08b62902b4ca1f6723f2b201","observation_id":"495389a9-ed4f-40c5-a39a-4467210737a0","resolution":{"observed_at":"2026-08-07T04:22:55.866065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:22:55.869308Z","title":"Vbench: Comprehensive bench- mark suite for video generative models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.869308Z"},"links":{"citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:3232247ef958382b20612c22b60eb34d86638f13e142baf723b7655926908d42","observation_id":"aa0582dd-d1da-43cb-af60-a13f67595808","resolution":{"observed_at":"2026-08-07T04:22:55.869308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:22:55.872434Z","title":"Olympicarena: Benchmark- ing multi-discipline cognitive reasoning for superintelligent ai","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.872434Z"},"links":{"citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:728ffae4dd6b826e30cad199a0e6a643d612935d57519cec654d96e4dff38698","observation_id":"251dc541-9fc2-4f9d-9e0f-43a43d65d45b","resolution":{"observed_at":"2026-08-07T04:22:55.872434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07974","last_updated":"2024-06-06T17:41:21Z","snapshot_observed_at":"2026-08-16T07:05:57.323612Z","submitted_at":"2024-03-12T17:58:04Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07974","snapshot_observed_at":"2026-08-07T04:22:55.875498Z","title":"Livecodebench: Holistic and contamination free evaluation of large language models for code","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.875498Z"},"links":{"cited_paper":"/paper/2403.07974","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:d385982d308e453445d2f479cace9f574db16f00d536b22bbca8147ab1e879fe","observation_id":"bb48fda0-189a-4e90-a294-989e03148d7a","resolution":{"observed_at":"2026-08-07T04:22:55.875498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.13730","last_updated":"2024-12-02T15:11:23Z","snapshot_observed_at":"2026-08-16T13:19:55.772122Z","submitted_at":"2024-09-10T01:20:26Z","title":"VisScience: An Extensive Benchmark for Evaluating K12 Educational Multi-modal Scientific Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.13730","snapshot_observed_at":"2026-08-07T04:22:55.878707Z","title":"Vis- science: An extensive benchmark for evaluating k12 ed- ucational multi-modal scientific reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.878707Z"},"links":{"cited_paper":"/paper/2409.13730","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:a1b0286453af724b7ecef215ab93461701c152b0ff54168ce471951d5c556533","observation_id":"172d0c3b-4e7a-4db9-adac-bce723c074a9","resolution":{"observed_at":"2026-08-07T04:22:55.878707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.01696","last_updated":"2019-05-07T21:34:05Z","snapshot_observed_at":"2026-08-14T18:32:30.931998Z","submitted_at":"2018-09-05T19:14:11Z","title":"TVQA: Localized, Compositional Video Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.01696","snapshot_observed_at":"2026-08-07T04:22:55.882019Z","title":"Tvqa: Localized, compositional video question answering","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.882019Z"},"links":{"cited_paper":"/paper/1809.01696","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:368a23e4b9600808aa385f3c3ae4bb6111bf01e49f7509759e76dafabccf64d7","observation_id":"7eae764e-27d8-42d7-a2e7-8a04c60c7397","resolution":{"observed_at":"2026-08-07T04:22:55.882019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:22:55.885036Z","title":"Veu-bench: Towards comprehensive under- standing of video editing","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.885036Z"},"links":{"citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:62706e0388e387d502f75232cb318da6957bc5e7dabc32ac7a09d256ca07e190","observation_id":"dd312b7a-59eb-4997-941c-a8f1f084af16","resolution":{"observed_at":"2026-08-07T04:22:55.885036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-08-16T13:11:31.171443Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-08-07T04:22:55.888224Z","title":"Aria: An open multimodal native mixture-of- experts model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.888224Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:a78491b1eaf022d9a4a1fb7cc994b6345069ea060d736d4144cc5d2606bd608c","observation_id":"bdeedada-c8a1-4732-8f62-8830251ce4c6","resolution":{"observed_at":"2026-08-07T04:22:55.888224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:22:55.891513Z","title":"Mvbench: A comprehensive multi-modal video understand- ing benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.891513Z"},"links":{"citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:e500363817c128e3cc0171fece5ce8a49d143dfbd0d2191f878496c9e732e897","observation_id":"f76134e5-71df-41ac-80c0-b4b20c61c9f5","resolution":{"observed_at":"2026-08-07T04:22:55.891513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00574","last_updated":"2025-07-13T16:21:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-31T18:01:23Z","title":"VideoChat-Flash: Hierarchical Compression for Long-Context Video Modeling","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00574","snapshot_observed_at":"2026-08-07T04:22:55.894485Z","title":"Videochat-flash: Hierarchical com- pression for long-context video modeling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.894485Z"},"links":{"cited_paper":"/paper/2501.00574","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:d3a0e61140aaf73ae87ebc098dca66949c895257cfe1c2cf1c702cff9cd52ce1","observation_id":"464c5e5e-07f5-46f0-ae02-fcf6e2b9ff09","resolution":{"observed_at":"2026-08-07T04:22:55.894485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-08-07T04:22:55.898375Z","title":"Videochat-r1: Enhancing spatio-temporal perception via reinforcement fine-tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.898375Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:1818f710e2ebb35e76af35152aea39dde9b4326c68f116737c99ef247ac7595d","observation_id":"96a7f6a6-d097-497d-887f-4378e5386efb","resolution":{"observed_at":"2026-08-07T04:22:55.898375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11303","last_updated":"2024-06-17T08:09:00Z","snapshot_observed_at":"2026-08-16T13:42:22.602032Z","submitted_at":"2024-06-17T08:09:00Z","title":"VideoVista: A Versatile Benchmark for Video Understanding and Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11303","snapshot_observed_at":"2026-08-07T04:22:55.901902Z","title":"Videovista: A versatile bench- mark for video understanding and reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.901902Z"},"links":{"cited_paper":"/paper/2406.11303","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:84ec2148c6e891a4176f56b77282c6efdedd39e49def7289f23b56a1db89e5bc","observation_id":"72944cf2-74c2-4dd2-91fa-073fcf1672fa","resolution":{"observed_at":"2026-08-07T04:22:55.901902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:22:55.905354Z","title":"Mmsci: A multimodal multi-discipline dataset for phd-level scientific comprehen- sion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.905354Z"},"links":{"citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:7d9da5f98739de0e001571a2570718a108b3c0b1d5c6e52851d28cf1819c7f4a","observation_id":"8d67a2a2-fdbe-4af4-ba1b-bf14d005537b","resolution":{"observed_at":"2026-08-07T04:22:55.905354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05138","last_updated":"2024-02-06T19:16:55Z","snapshot_observed_at":"2026-08-16T14:20:52.599669Z","submitted_at":"2024-02-06T19:16:55Z","title":"SceMQA: A Scientific College Entrance Level Multimodal Question Answering Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05138","snapshot_observed_at":"2026-08-07T04:22:55.908709Z","title":"Scemqa: A scientific col- lege entrance level multimodal question answering bench- mark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.908709Z"},"links":{"cited_paper":"/paper/2402.05138","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:7b319f49eb228809a913ed48e60ad705f3f674622c516bd4c3f0af6b1ac92c2c","observation_id":"777b0caa-5f9e-4163-8fe5-9811e7a48d40","resolution":{"observed_at":"2026-08-07T04:22:55.908709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:22:55.912456Z","title":"Vila: On pre-training for vi- sual language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.912456Z"},"links":{"citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:338d9b3cd5c8e333c3e585ddbecf0276b95c8e36cb951a28fafd23fe8bc4a4b3","observation_id":"d3686116-b77e-4086-86e6-93a127e3afbf","resolution":{"observed_at":"2026-08-07T04:22:55.912456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-15T17:27:11.980940Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-07T04:22:55.915660Z","title":"Deepseek-v3 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.915660Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:95556647cf9bfb3b213c0290b686bbc1eaf989ac9ee0967e023a7b1578622d42","observation_id":"4a99a1ed-4c12-4cf3-b715-9a75287a794a","resolution":{"observed_at":"2026-08-07T04:22:55.915660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.00476","last_updated":"2024-06-03T04:13:39Z","snapshot_observed_at":"2026-08-12T14:24:43.915700Z","submitted_at":"2024-03-01T12:02:19Z","title":"TempCompass: Do Video LLMs Really Understand Videos?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.00476","snapshot_observed_at":"2026-08-07T04:22:55.919117Z","title":"Tempcom- pass: Do video llms really understand videos?arXiv preprint arXiv:2403.00476, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.919117Z"},"links":{"cited_paper":"/paper/2403.00476","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:7f5278fbc382b0709fed96bf8ffbae6f954d76f64472f356f916a9cde65199b7","observation_id":"b4aacb62-809e-4ff1-8917-6c9b2db81e35","resolution":{"observed_at":"2026-08-07T04:22:55.919117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18111","last_updated":"2024-09-26T17:53:04Z","snapshot_observed_at":"2026-08-16T13:15:00.858953Z","submitted_at":"2024-09-26T17:53:04Z","title":"E.T. Bench: Towards Open-Ended Event-Level Video-Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18111","snapshot_observed_at":"2026-08-07T04:22:55.922688Z","title":"Et bench: Towards open-ended event-level video-language understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.922688Z"},"links":{"cited_paper":"/paper/2409.18111","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:a05bb161ed20bd51a59d5712c4544885eb5e1ff90350fbc502bbfe4789d8e786","observation_id":"ca08579a-f769-47a9-87cc-a7bb7a4e650c","resolution":{"observed_at":"2026-08-07T04:22:55.922688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:22:55.926445Z","title":"Llama-3.3-70b-instruct","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.926445Z"},"links":{"citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:f00d52ff5f36a1a5154992d9d6ab2be440e8cba99cb856aafa393fe9748f69d9","observation_id":"ea1b2c88-4fb8-4786-841f-074d073c603c","resolution":{"observed_at":"2026-08-07T04:22:55.926445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-07T04:22:55.929946Z","title":"Mathvista: Evaluating mathemat- ical reasoning of foundation models in visual contexts.arXiv preprint arXiv:2310.02255, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.929946Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:087b3edc784e987f2d86de08f8b5be09f7774de4d906febb732926406bdf6285","observation_id":"cafefa2f-9f66-49de-9955-28857541679a","resolution":{"observed_at":"2026-08-07T04:22:55.929946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:22:55.933948Z","title":"Egoschema: A diagnostic benchmark for very long- form video language understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.933948Z"},"links":{"citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:cfb22e8fa76ea9e080b9c03540682ae6a1028ee62e8c2ebfdc0836946207a179","observation_id":"4bc8e262-74ec-44bc-ae1e-02b2b7c087ab","resolution":{"observed_at":"2026-08-07T04:22:55.933948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10244","last_updated":"2022-03-19T05:00:30Z","snapshot_observed_at":"2026-08-11T03:45:43.920485Z","submitted_at":"2022-03-19T05:00:30Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.10244","snapshot_observed_at":"2026-08-07T04:22:55.937385Z","title":"Chartqa: A benchmark for question an- swering about charts with visual and logical reasoning.arXiv preprint arXiv:2203.10244, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.937385Z"},"links":{"cited_paper":"/paper/2203.10244","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:1a2e17b4957ade6a2ce76d835f19b9c0d1fa9db9c9ede6a9dd4ac31c7cc6ca77","observation_id":"4288717a-c077-4503-8d0f-6b943dc16086","resolution":{"observed_at":"2026-08-07T04:22:55.937385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:22:55.941480Z","title":"Plotqa: Reasoning over scientific plots","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.941480Z"},"links":{"citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:80a62e0d4f0f5daab2f6bb60488dce944c538e874f53d9c55d94b806efa08202","observation_id":"f4dd8165-bd5e-4613-a574-b558d5fe57e6","resolution":{"observed_at":"2026-08-07T04:22:55.941480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16103","last_updated":"2023-11-28T18:16:29Z","snapshot_observed_at":"2026-08-16T14:39:55.654977Z","submitted_at":"2023-11-27T18:59:58Z","title":"Video-Bench: A Comprehensive Benchmark and Toolkit for Evaluating Video-based Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16103","snapshot_observed_at":"2026-08-07T04:22:55.944763Z","title":"Video-bench: A com- prehensive benchmark and toolkit for evaluating video-based large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.944763Z"},"links":{"cited_paper":"/paper/2311.16103","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:55ad7a828644234d3270ffa571f028a201864213d6102c33f25b7bbd635ec127","observation_id":"ad1ab0a5-8d56-42b7-abc7-9ab6202c0e16","resolution":{"observed_at":"2026-08-07T04:22:55.944763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:22:55.948741Z","title":"Hello gpt4-o","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.948741Z"},"links":{"citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:78ac58030552c03a69336ad5a94f1c6fe7f2b39de8830a0b4bb44c87a184dbaa","observation_id":"90e2f9bc-4a34-40b3-b521-86f6f1ad70c6","resolution":{"observed_at":"2026-08-07T04:22:55.948741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:22:55.951948Z","title":"Introducing openai o1","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.951948Z"},"links":{"citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:e582fe178029ef712e26cb7740c567c8a61e627c20589529799bf9c678874859","observation_id":"9514c253-91e1-4207-9685-bde03caf9b22","resolution":{"observed_at":"2026-08-07T04:22:55.951948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:22:55.955676Z","title":"Openai o3-mini","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.955676Z"},"links":{"citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:e3405623efda87d38ac07a684fd38fce6388252430423c734d0e34816b51318b","observation_id":"f039a56a-1291-4aa6-8310-e8a13a0b95b8","resolution":{"observed_at":"2026-08-07T04:22:55.955676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:22:55.959241Z","title":"Per- ception test: A diagnostic benchmark for multimodal video models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.959241Z"},"links":{"citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:d2eda6a46a86c4405e086d34f9cfa39a539d3c95852e8678aca72414b1ac7d7a","observation_id":"e8356cf3-7c1c-489f-b74f-cd3836ef58e5","resolution":{"observed_at":"2026-08-07T04:22:55.959241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:22:55.962613Z","title":"Robust speech recognition via large-scale weak supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.962613Z"},"links":{"citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:0043fb0878567569d9aa2958108b490efa52acc965886c726eba2b8ebfd3ddbd","observation_id":"8456456e-a978-4287-883a-6bb39db100b2","resolution":{"observed_at":"2026-08-07T04:22:55.962613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:22:55.965834Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.965834Z"},"links":{"citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:43789006ad8d21fc794166740e17aea68e7abac60381680cfea768f21798f183","observation_id":"248a203e-e894-4ac2-9ce7-d528e407e952","resolution":{"observed_at":"2026-08-07T04:22:55.965834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08813","last_updated":"2024-10-21T03:08:08Z","snapshot_observed_at":"2026-08-16T13:52:43.594422Z","submitted_at":"2024-05-14T17:59:02Z","title":"CinePile: A Long Video Question Answering Dataset and Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08813","snapshot_observed_at":"2026-08-07T04:22:55.969084Z","title":"Cinepile: A long video question answering dataset and benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.969084Z"},"links":{"cited_paper":"/paper/2405.08813","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:70a960c50e48bc12575c1c3e3489bc552629836da7377332f598c686fbdce362","observation_id":"2bce9224-a4cb-41a3-853a-88f33fd1a58b","resolution":{"observed_at":"2026-08-07T04:22:55.969084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:22:55.972753Z","title":"Scienceqa: A novel resource for question answering on scholarly articles","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.972753Z"},"links":{"citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:dcc16a0ec3533cb7ec4eedd667e3fdbf759254965fd412441039c2677487ba38","observation_id":"0403ef84-b2cc-4ba8-b7ea-606cd2b175b1","resolution":{"observed_at":"2026-08-07T04:22:55.972753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T04:22:55.976330Z","title":"Proximal policy optimization algo- rithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.976330Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:2dfe27650a2177f9cbfe9275960e56658e3ad57751f55bdae42115585ab5251b","observation_id":"b7567d2a-afe6-49ac-87b3-75bdf9b6cba0","resolution":{"observed_at":"2026-08-07T04:22:55.976330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:22:55.979783Z","title":"Moviechat: From dense token to sparse memory for long video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.979783Z"},"links":{"citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:7e07e54731223ab5ef5b2ed144c5f27dc25da522483d41801faf64f148d57b0c","observation_id":"d67660f1-c14d-4565-a888-d47027a2f72c","resolution":{"observed_at":"2026-08-07T04:22:55.979783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:22:55.983472Z","title":"Scieval: A multi-level large language model evaluation benchmark for scientific re- search","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.983472Z"},"links":{"citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:03e4772987342556ceb5bffafbd6aa2472e41b52d00327f81dc9c113c0954c01","observation_id":"91aa0012-efe1-4a8b-ba32-15907154c07b","resolution":{"observed_at":"2026-08-07T04:22:55.983472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:22:55.986695Z","title":"Movieqa: Understanding stories in movies through question- answering","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.986695Z"},"links":{"citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:68b5445620795d96242bcbf70a09cfd19b365395755c107dad5d187d4759061b","observation_id":"20738237-2470-4115-95df-50ad77de4008","resolution":{"observed_at":"2026-08-07T04:22:55.986695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:22:55.990171Z","title":"Claude Team","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.990171Z"},"links":{"citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:724b2ace4cba2df326a89e39d80a79f04b67897bc7cdb464e2ece271337fd2a6","observation_id":"a2c0df03-ede1-4de7-8286-ca5772f806c0","resolution":{"observed_at":"2026-08-07T04:22:55.990171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-17T02:54:42.660830Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03569","snapshot_observed_at":"2026-08-07T04:22:55.993691Z","title":"Mimo-vl technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.993691Z"},"links":{"cited_paper":"/paper/2506.03569","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:0c309545a8f20ccf55b0962830b4b8f37fa307800dd2c847cc84fdc3f79c6100","observation_id":"61343ccd-0658-4382-8a41-57d7baedba20","resolution":{"observed_at":"2026-08-07T04:22:55.993691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T04:22:55.997443Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.997443Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:7563b625dcf8a22689f410ed3328c3f615c091af352c4812a2fbbf7098b0a62b","observation_id":"0fc8315a-a995-42eb-a74d-b37f89622c28","resolution":{"observed_at":"2026-08-07T04:22:55.997443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-08-15T15:21:55.432655Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-08-07T04:22:56.001192Z","title":"Kimi-vl technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:56.001192Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:4838c5257f65bfe19f67da6b307a9b6b43bc17dadc6a64d88572b9b8c6e63424","observation_id":"223a5ac8-47d9-4218-9aed-c491e5c2d770","resolution":{"observed_at":"2026-08-07T04:22:56.001192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01949","last_updated":"2025-07-02T17:57:28Z","snapshot_observed_at":"2026-08-16T04:50:52.862197Z","submitted_at":"2025-07-02T17:57:28Z","title":"Kwai Keye-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.01949","snapshot_observed_at":"2026-08-07T04:22:56.004930Z","title":"Kwai keye-vl technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:56.004930Z"},"links":{"cited_paper":"/paper/2507.01949","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:ebab042032ac0e868fd8d106f8bf80b32de5f7da5f3a8215b07a8e1c01b477b5","observation_id":"574deb97-d5bb-408c-a6d8-0403b5d74e9d","resolution":{"observed_at":"2026-08-07T04:22:56.004930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:22:56.008810Z","title":"Qwq: Reflect deeply on the boundaries of the unknown","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:56.008810Z"},"links":{"citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:f0cba2abc1325a80d3025ba8659f3750700f0b0f861dffcc36749628071c14b8","observation_id":"a8ba791d-667a-4b4d-a2bf-a7ef871bb11d","resolution":{"observed_at":"2026-08-07T04:22:56.008810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:22:56.012332Z","title":"Qwq-32b: Embracing the power of reinforce- ment learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:56.012332Z"},"links":{"citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:f78ccbb1f455a08e7da8291cb4c199a28a126faa6795cd66e6bfd2a48bc71f66","observation_id":"0cc786e6-eb01-4356-9800-19c9bfa5dc5f","resolution":{"observed_at":"2026-08-07T04:22:56.012332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06186","last_updated":"2025-01-10T18:59:51Z","snapshot_observed_at":"2026-08-16T12:59:16.590181Z","submitted_at":"2025-01-10T18:59:51Z","title":"LlamaV-o1: Rethinking Step-by-step Visual Reasoning in LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.06186","snapshot_observed_at":"2026-08-07T04:22:56.015726Z","title":"Llamav- o1: Rethinking step-by-step visual reasoning in llms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:56.015726Z"},"links":{"cited_paper":"/paper/2501.06186","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:09a24d47e095e882efa10e5004f12273efe1dae583e4fcf884f6d137603b2052","observation_id":"998bdf44-fffa-4ad1-a2a1-5fda2aa5c176","resolution":{"observed_at":"2026-08-07T04:22:56.015726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:22:56.019503Z","title":"Mea- suring multimodal mathematical reasoning with math-vision dataset","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:56.019503Z"},"links":{"citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:24e1cc9adeb0a15f5f13931465661cee13bc127cdee14f446a7a4ad05928d4dc","observation_id":"12d08530-1010-4849-ad8f-3a52100a62b0","resolution":{"observed_at":"2026-08-07T04:22:56.019503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T04:22:56.022809Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:56.022809Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:2ece0a19f717e32b86cc34772b558697464ef7c2d816b813833faff1191f3108","observation_id":"a733ad3b-02c9-4ce9-ab71-cf3ee71ca713","resolution":{"observed_at":"2026-08-07T04:22:56.022809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10442","last_updated":"2025-04-07T09:09:39Z","snapshot_observed_at":"2026-08-13T18:24:04.904767Z","submitted_at":"2024-11-15T18:59:27Z","title":"Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10442","snapshot_observed_at":"2026-08-07T04:22:56.026472Z","title":"Enhancing the reasoning ability of multimodal large language models via mixed preference optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:56.026472Z"},"links":{"cited_paper":"/paper/2411.10442","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:b0d3ced90d16d7463f005945da3933d7ba17e2438ff38e8751234e39f5c4a5f2","observation_id":"b61e18b8-a4b4-41a3-9831-f60c6e691041","resolution":{"observed_at":"2026-08-07T04:22:56.026472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08035","last_updated":"2025-08-09T10:54:59Z","snapshot_observed_at":"2026-08-08T19:38:26.415599Z","submitted_at":"2024-06-12T09:36:52Z","title":"LVBench: An Extreme Long Video Understanding Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08035","snapshot_observed_at":"2026-08-07T04:22:56.029698Z","title":"Lvbench: An extreme long video understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:56.029698Z"},"links":{"cited_paper":"/paper/2406.08035","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:23a940008fea5b1f8901c66f42f4a937da3f28b99a8227a230c38fe62595ccda","observation_id":"9c63bfad-d6e4-44f8-a6d1-0365e150803d","resolution":{"observed_at":"2026-08-07T04:22:56.029698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:22:56.033273Z","title":"Internvideo2: Scaling foundation models for mul- timodal video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:56.033273Z"},"links":{"citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:5f15a2d8f9b2eba1d72a60c51beb4ac45293bc4756c0d040c331e3302184d79f","observation_id":"7721589c-31dc-49cd-85bc-14090328f51d","resolution":{"observed_at":"2026-08-07T04:22:56.033273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:22:56.036599Z","title":"Mmlu-pro: A more robust and challenging multi-task language understanding benchmark","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:56.036599Z"},"links":{"citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:d9b3f4580071fd3257668e7a75748c6c0a16106ec140305d50694e2f5d862f84","observation_id":"35576631-0d20-440c-93e9-b78340cdeae2","resolution":{"observed_at":"2026-08-07T04:22:56.036599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12386","last_updated":"2025-07-13T18:57:17Z","snapshot_observed_at":"2026-08-06T07:17:05.291678Z","submitted_at":"2025-01-21T18:59:00Z","title":"InternVideo2.5: Empowering Video MLLMs with Long and Rich Context Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12386","snapshot_observed_at":"2026-08-07T04:22:56.040389Z","title":"Internvideo2","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:56.040389Z"},"links":{"cited_paper":"/paper/2501.12386","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:9cd6845155f2dc4344f1fd6d1dc57135e160fd516e99b2838632bed08d48b4ea","observation_id":"a8c1bebf-3b71-4951-8ed2-20c1839bf3c5","resolution":{"observed_at":"2026-08-07T04:22:56.040389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:22:56.044092Z","title":"Charxiv: Charting gaps in realistic chart understanding in multimodal llms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:56.044092Z"},"links":{"citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:8a69d29be79a5f42624b460579b781f49f9e7be42ca99319553903068c4ad0ac","observation_id":"d70a7195-8eeb-4046-a743-304badfbdd03","resolution":{"observed_at":"2026-08-07T04:22:56.044092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:22:56.048025Z","title":"Chain-of-thought prompting elicits reasoning in large lan- guage models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:56.048025Z"},"links":{"citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:135f2b56080a2238eb5100d01f7015eb46527b9bbf317047676720c508761d29","observation_id":"80c7b20b-7eaa-440d-a569-3db0431d1f06","resolution":{"observed_at":"2026-08-07T04:22:56.048025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09711","last_updated":"2024-05-15T21:53:54Z","snapshot_observed_at":"2026-08-16T21:19:34.047707Z","submitted_at":"2024-05-15T21:53:54Z","title":"STAR: A Benchmark for Situated Reasoning in Real-World Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09711","snapshot_observed_at":"2026-08-07T04:22:56.051254Z","title":"Star: A benchmark for situated reason- ing in real-world videos","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:56.051254Z"},"links":{"cited_paper":"/paper/2405.09711","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:e24836eb5af088ff412de547995cb4b8649dbfb614edc010a9e9a2bfac1574b9","observation_id":"9a8e578c-f3ed-4db6-b45f-5eba1d035eca","resolution":{"observed_at":"2026-08-07T04:22:56.051254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:22:56.054587Z","title":"Longvideobench: A benchmark for long-context interleaved video-language understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:56.054587Z"},"links":{"citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:abfc2daf1f45103935ffb506572e2ec81bd389c199b5c6d6936ba69292f7424c","observation_id":"09d024e8-859c-4f80-b3c1-2e52fbef5d7b","resolution":{"observed_at":"2026-08-07T04:22:56.054587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.07001","last_updated":"2024-11-06T13:56:28Z","snapshot_observed_at":"2026-08-16T13:53:32.844681Z","submitted_at":"2024-05-11T12:33:46Z","title":"ChartInsights: Evaluating Multimodal Large Language Models for Low-Level Chart Question Answering","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.07001","snapshot_observed_at":"2026-08-07T04:22:56.057630Z","title":"Chartinsights: Evaluating multimodal large language models for low-level chart question answer- ing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:56.057630Z"},"links":{"cited_paper":"/paper/2405.07001","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:cf95291c9ccbebffdc2bf00997a0d111faa8b8a28d78d1d4253117ee4f893f17","observation_id":"48a6e6e0-2b1a-4f35-8642-cb8ada73e42d","resolution":{"observed_at":"2026-08-07T04:22:56.057630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10302","last_updated":"2024-12-13T17:37:48Z","snapshot_observed_at":"2026-08-07T03:01:29.031129Z","submitted_at":"2024-12-13T17:37:48Z","title":"DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10302","snapshot_observed_at":"2026-08-07T04:22:56.061641Z","title":"Deepseek-vl2: Mixture-of- experts vision-language models for advanced multimodal understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:56.061641Z"},"links":{"cited_paper":"/paper/2412.10302","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:8e9a0b1e29a2663b1a203255ce3e5fda29cf8755e25c6e24f6a68eaa139b3997","observation_id":"c9615c86-c7a2-4a34-872b-ee5f4d09608c","resolution":{"observed_at":"2026-08-07T04:22:56.061641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:22:56.065135Z","title":"Next-qa: Next phase of question-answering to explaining temporal actions","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:56.065135Z"},"links":{"citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:7bd024c94ed783a93dadcd6c98c72f15d16e01ec26920ae3df0983655b1d6fb7","observation_id":"34c6a477-35c9-4891-a79d-16c5ff0e1c75","resolution":{"observed_at":"2026-08-07T04:22:56.065135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10440","last_updated":"2025-07-21T03:53:30Z","snapshot_observed_at":"2026-08-15T17:00:20.282987Z","submitted_at":"2024-11-15T18:58:31Z","title":"LLaVA-CoT: Let Vision Language Models Reason Step-by-Step","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10440","snapshot_observed_at":"2026-08-07T04:22:56.068528Z","title":"Llava-o1: Let vision language models reason step- by-step","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:56.068528Z"},"links":{"cited_paper":"/paper/2411.10440","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:dfd3fb3370c07e8935ac663c4f88499fcc26a35b2b97ede51daa101702a970a3","observation_id":"f499c913-d804-40f1-819d-bf2eaee718d1","resolution":{"observed_at":"2026-08-07T04:22:56.068528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-08-16T18:57:50.930866Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-07T04:22:56.072007Z","title":"Qwen2 technical report, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:56.072007Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:f3a394b7398f05361b6aefb2216bacccbf6e6db664a58d6815ab61412e512ca5","observation_id":"9e523dc1-8827-4b22-a657-8ce90271cccb","resolution":{"observed_at":"2026-08-07T04:22:56.072007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T04:22:56.075817Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:56.075817Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:d6392e33588f4dafbc6bc85102e1320a8f47c5776b44be85d8a93193748de145","observation_id":"baf03061-74b5-4672-9873-f22e3c60fa29","resolution":{"observed_at":"2026-08-07T04:22:56.075817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:22:56.079943Z","title":"Vript: A video is worth thousands of words","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:56.079943Z"},"links":{"citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:5e73baec232ec31451e78088f0a0ab0944440318225e81102f5f04da772bcd63","observation_id":"63efaa54-d18b-432f-8376-97fd9af0a511","resolution":{"observed_at":"2026-08-07T04:22:56.079943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:22:56.083505Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for ex- pert agi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:56.083505Z"},"links":{"citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:cce876252f06e06abc382f4d94592d807632befa3f3f0399bdb8b0be27c00fce","observation_id":"b5a02474-e2ec-4826-bc43-a1a96178e9c0","resolution":{"observed_at":"2026-08-07T04:22:56.083505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02813","last_updated":"2025-05-22T08:22:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-04T15:31:26Z","title":"MMMU-Pro: A More Robust Multi-discipline Multimodal Understanding Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02813","snapshot_observed_at":"2026-08-07T04:22:56.086963Z","title":"Mmmu-pro: A more robust multi- discipline multimodal understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:56.086963Z"},"links":{"cited_paper":"/paper/2409.02813","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:3b13059661ca593894a5695a1e686f13d541b7e8984d1682170c63115d16473f","observation_id":"9c644f51-4323-42f6-9942-e752d92768b3","resolution":{"observed_at":"2026-08-07T04:22:56.086963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.17080","last_updated":"2024-06-05T04:05:42Z","snapshot_observed_at":"2026-08-16T14:31:08.951193Z","submitted_at":"2023-12-28T15:49:43Z","title":"MR-GSM8K: A Meta-Reasoning Benchmark for Large Language Model Evaluation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.17080","snapshot_observed_at":"2026-08-07T04:22:56.090625Z","title":"Mr-gsm8k: A meta-reasoning bench- mark for large language model evaluation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:56.090625Z"},"links":{"cited_paper":"/paper/2312.17080","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:1b9f67af406584ef6fa9a11402aa97cd9ef27902fc1aaaf14cd1c65486c49d55","observation_id":"3352a403-d713-4bc4-8714-334ec1debcbf","resolution":{"observed_at":"2026-08-07T04:22:56.090625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13106","last_updated":"2025-06-03T03:33:14Z","snapshot_observed_at":"2026-08-13T11:53:19.464291Z","submitted_at":"2025-01-22T18:59:46Z","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13106","snapshot_observed_at":"2026-08-07T04:22:56.094091Z","title":"Videollama 3: Frontier multi- modal foundation models for image and video understand- ing","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:56.094091Z"},"links":{"cited_paper":"/paper/2501.13106","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:40a1b07ddadebe90083c4da08572d64462b32f40fe517cfdb4ffd1a52f087bb8","observation_id":"425c0e8d-d767-487e-9278-d7c6bfd58ae2","resolution":{"observed_at":"2026-08-07T04:22:56.094091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.11944","last_updated":"2024-11-04T13:28:48Z","snapshot_observed_at":"2026-08-16T14:25:35.042378Z","submitted_at":"2024-01-22T13:34:34Z","title":"CMMMU: A Chinese Massive Multi-discipline Multimodal Understanding Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.11944","snapshot_observed_at":"2026-08-07T04:22:56.098198Z","title":"Cmmmu: A chinese massive multi- discipline multimodal understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:56.098198Z"},"links":{"cited_paper":"/paper/2401.11944","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:28ee4a4425432b8019f60afe17f265828a20c96a418a260a0ef6897d171bbaf9","observation_id":"5aff777f-413d-4142-9836-e8741bc8053b","resolution":{"observed_at":"2026-08-07T04:22:56.098198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.04817","last_updated":"2025-09-01T05:09:27Z","snapshot_observed_at":"2026-08-16T14:36:37.740777Z","submitted_at":"2023-12-08T03:33:38Z","title":"LvBench: A Benchmark for Long-form Video Understanding with Versatile Multi-modal Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.04817","snapshot_observed_at":"2026-08-07T04:22:56.102015Z","title":"Movqa: A benchmark of versatile question-answering for long-form movie understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:56.102015Z"},"links":{"cited_paper":"/paper/2312.04817","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:e690e95a090cbed0b5ec6dcfe59f2da42da4e419fa7f9b601ec08dc80d957b28","observation_id":"636a398c-4161-4ff9-b1c1-fda5a06ae8a4","resolution":{"observed_at":"2026-08-07T04:22:56.102015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-07T04:22:56.105590Z","title":"Long context transfer from language to vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:56.105590Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:0aead926195af6e2911abb4ff612cf4578325fa46d715842d12f758c157442ab","observation_id":"780e01ce-6412-459e-9e7b-5403e03752ce","resolution":{"observed_at":"2026-08-07T04:22:56.105590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12380","last_updated":"2025-01-21T18:56:18Z","snapshot_observed_at":"2026-08-16T20:45:19.595957Z","submitted_at":"2025-01-21T18:56:18Z","title":"MMVU: Measuring Expert-Level Multi-Discipline Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12380","snapshot_observed_at":"2026-08-07T04:22:56.109578Z","title":"Mmvu: Measuring expert- level multi-discipline video understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:56.109578Z"},"links":{"cited_paper":"/paper/2501.12380","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:0d2825997090b3375ffc000528c54cb5efb27b8925d05e38c0cc9c0e1fe827e9","observation_id":"737f9633-f141-463b-b19e-f15e39a533b1","resolution":{"observed_at":"2026-08-07T04:22:56.109578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04264","last_updated":"2025-01-01T15:53:58Z","snapshot_observed_at":"2026-08-03T20:38:36.602554Z","submitted_at":"2024-06-06T17:09:32Z","title":"MLVU: Benchmarking Multi-task Long Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04264","snapshot_observed_at":"2026-08-07T04:22:56.113344Z","title":"Mlvu: A comprehensive benchmark for multi-task long video understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:56.113344Z"},"links":{"cited_paper":"/paper/2406.04264","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:ee568734c0b296ec2b5a79d2480afbe36f442e76604c2529cbf72e94f768176c","observation_id":"aae769e7-ed42-4d67-b01c-f74bb405cab7","resolution":{"observed_at":"2026-08-07T04:22:56.113344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:22:56.117140Z","title":"Au- toshot: A short video dataset and state-of-the-art shot bound- ary detection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:56.117140Z"},"links":{"citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:7f438eb309b3c7e3534009889ea271a598111e47017588412f420c358b06f925","observation_id":"759fdcf6-4d27-45f7-b53b-2c2bedb2cbd5","resolution":{"observed_at":"2026-08-07T04:22:56.117140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:22:56.121263Z","title":"• Multi-step process 1: A → B → C → D","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:56.121263Z"},"links":{"citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:a596e5f9acf10e2b9e9783bca820c62a6a4d7a47c3cc9fddf9ecef40b864b904","observation_id":"c9b0cd36-2a4d-4ce0-b797-719a13978b05","resolution":{"observed_at":"2026-08-07T04:22:56.121263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:22:56.124805Z","title":"• Multi-step process 1: A → B → C → D","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:56.124805Z"},"links":{"citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:a48f632e4b4c26e45605023a136412541ab0373e78980da0a6c4551a0d06311f","observation_id":"d2abdced-fcf3-4473-80e9-510a730d7196","resolution":{"observed_at":"2026-08-07T04:22:56.124805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:22:56.128206Z","title":"• Multi-step process: D → C → B → A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:56.128206Z"},"links":{"citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:6483ee53f888c364435434e8a1d66306b336abb0dae993bba484d12174ecd720","observation_id":"054d7390-470b-43cd-8851-e4691ff87b5e","resolution":{"observed_at":"2026-08-07T04:22:56.128206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:22:56.132146Z","title":"• Multi-step process: D → C → B → A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:56.132146Z"},"links":{"citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:5c1aa00f36b67bc0bd528533b49cacf784bddfe31e88cdc27fbfad4f3256b1ab","observation_id":"b8bd4edb-813b-4535-9876-4ea20b8ee2d5","resolution":{"observed_at":"2026-08-07T04:22:56.132146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:22:56.135839Z","title":"• Multi-step process: A → C → D → B","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:56.135839Z"},"links":{"citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:e0e899d6c4a699013e4e2bfa2fd067e26e5f014f9d014b7a5c6f7c35f1d6b532","observation_id":"ee36e1ad-397c-49c7-8fa2-1440431e6943","resolution":{"observed_at":"2026-08-07T04:22:56.135839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:22:57.181090Z","title":null,"venue":null,"work_id":"7ebd4b14-4199-4436-8ad1-3d3290212dfa","year":null},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:56.139701Z"},"links":{"citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:a8d0409efe2cd38dbeb66c9761e428490ea1700c4264ac4f4714bd7ddf871b41","observation_id":"1081268f-4dd7-4e6c-a68f-7147abad3086","resolution":{"observed_at":"2026-08-07T04:22:57.184540Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T15:50:03.132186Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":100,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":122},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 100 of 122 outbound references and 11 inbound Pith citation observations for arXiv:2506.10857."}