{"as_of":"2026-08-18T06:05:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5a1d29d7e0eee780256b3a5d2c1a59a1f88a94b35cdc20d23ba829d710a4813d","coverage":[{"denominator":80,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":80,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T21:59:33.853704Z","state":"measured"},{"denominator":80,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":80,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.08455/citation-record","integrity":"/paper/2505.08455/integrity","json":"/paper/2505.08455/citation-record.json","paper":"/paper/2505.08455"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:59:35.234825Z","title":"Robovqa: Multimodal long-horizon reasoning for robotics","venue":null,"work_id":"3276658d-37ba-4ca8-9437-ddcd67a5ff59","year":2024},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-17T08:35:40.471939Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.444017Z"},"links":{"citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:71e1d4dfcd36c30e2f3297a4d700017f85f3eb421f49c955287febc05fc7b9a8","observation_id":"0b89677d-3b55-4f0b-b0fa-46f60380ab2e","resolution":{"observed_at":"2026-08-15T21:59:35.239931Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19693","last_updated":"2024-06-28T07:09:06Z","snapshot_observed_at":"2026-08-18T00:25:38.248902Z","submitted_at":"2024-06-28T07:09:06Z","title":"MMRo: Are Multimodal LLMs Eligible as the Brain for In-Home Robotics?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19693","snapshot_observed_at":"2026-08-15T21:59:33.450018Z","title":"Mmro: Are multimodal llms eligible as the brain for in-home robotics? arXiv preprint arXiv:2406.19693, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-17T08:35:40.471939Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.450018Z"},"links":{"cited_paper":"/paper/2406.19693","citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:5640146aabf0662d621b246fad3b64d1b8b20fd44889afec9493995dc42abefc","observation_id":"c878ab8e-0a4b-4286-9bb6-0c705479fbd3","resolution":{"observed_at":"2026-08-15T21:59:33.450018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06722","last_updated":"2024-06-11T06:53:44Z","snapshot_observed_at":"2026-08-16T19:41:21.903959Z","submitted_at":"2023-12-11T03:35:58Z","title":"EgoPlan-Bench: Benchmarking Multimodal Large Language Models for Human-Level Planning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06722","snapshot_observed_at":"2026-08-15T21:59:33.455775Z","title":"Egoplan-bench: Benchmarking multimodal large language models for human-level planning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-17T08:35:40.471939Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.455775Z"},"links":{"cited_paper":"/paper/2312.06722","citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:669c22661e3e6e340a505c2a9fec25d922f4e6291dd3975044866600c8814d35","observation_id":"236615c5-5e79-4ada-ba59-d2b445ddf7cc","resolution":{"observed_at":"2026-08-15T21:59:33.455775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:59:35.219267Z","title":"Openeqa: Embodied question answering in the era of foundation models","venue":null,"work_id":"19aaedda-22fe-47d2-8630-234801ae1726","year":2024},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-17T08:35:40.471939Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.461137Z"},"links":{"citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:3e32505af81217db4a1c099c44173b0311cde0e708638f27a088ff3f7ff7ba29","observation_id":"144edce9-8fb6-4610-bc43-0d037e06a919","resolution":{"observed_at":"2026-08-15T21:59:35.224949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02071","last_updated":"2023-11-28T11:23:14Z","snapshot_observed_at":"2026-08-16T14:55:29.088594Z","submitted_at":"2023-10-03T14:13:36Z","title":"Towards End-to-End Embodied Decision Making via Multi-modal Large Language Model: Explorations with GPT4-Vision and Beyond","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02071","snapshot_observed_at":"2026-08-15T21:59:33.466110Z","title":"Towards end-to-end embodied decision making via multi- modal large language model: Explorations with gpt4-vision and beyond","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-17T08:35:40.471939Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.466110Z"},"links":{"cited_paper":"/paper/2310.02071","citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:195b8bdf1e7a81cc21cdb6e6d72fe25a6cd48e8f625c3648074e91e9e3f100a5","observation_id":"d80e3b03-69f1-440e-8910-a0d0c85dc28a","resolution":{"observed_at":"2026-08-15T21:59:33.466110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.09848","last_updated":"2025-04-14T03:38:31Z","snapshot_observed_at":"2026-08-16T12:41:30.990282Z","submitted_at":"2025-04-14T03:38:31Z","title":"A Survey of Large Language Model-Powered Spatial Intelligence Across Scales: Advances in Embodied Agents, Smart Cities, and Earth Science","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.09848","snapshot_observed_at":"2026-08-15T21:59:33.471828Z","title":"A survey of large language model-powered spatial intelligence across scales: Advances in embodied agents, smart cities, and earth science","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-17T08:35:40.471939Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.471828Z"},"links":{"cited_paper":"/paper/2504.09848","citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:d02eed8d69339a89dc09981800180868248cdd3394d7753a2b867e0f810339ba","observation_id":"6f59abb2-0476-4a6d-a816-b4485f291313","resolution":{"observed_at":"2026-08-15T21:59:33.471828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:59:35.203415Z","title":"Spatialvlm: Endowing vision-language models with spatial reasoning capabilities","venue":null,"work_id":"a6023340-d58d-42fe-a8a3-c4311cfc76bf","year":2024},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-17T08:35:40.471939Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.477225Z"},"links":{"citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:79a22463d4f3241ea3913e660ba71cb790cab2338045ff633a13537f7d0d6486","observation_id":"45022173-519c-455a-bc87-57177bbf8318","resolution":{"observed_at":"2026-08-15T21:59:35.208399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.05973","last_updated":"2023-11-02T06:53:37Z","snapshot_observed_at":"2026-08-05T01:03:23.456778Z","submitted_at":"2023-07-12T07:40:48Z","title":"VoxPoser: Composable 3D Value Maps for Robotic Manipulation with Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.05973","snapshot_observed_at":"2026-08-15T21:59:33.483140Z","title":"V oxposer: Composable 3d value maps for robotic manipulation with language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-17T08:35:40.471939Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.483140Z"},"links":{"cited_paper":"/paper/2307.05973","citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:dd373f28a73e303e038536ff6ca89ba6f8842098fd3cfa5295edcdce2257fc70","observation_id":"6cb698aa-a7bd-4323-8b10-e43c707f888d","resolution":{"observed_at":"2026-08-15T21:59:33.483140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11217","last_updated":"2024-11-29T02:50:45Z","snapshot_observed_at":"2026-08-16T14:17:47.173829Z","submitted_at":"2024-02-17T08:04:23Z","title":"A Spectrum Evaluation Benchmark for Medical Multi-Modal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11217","snapshot_observed_at":"2026-08-15T21:59:33.489753Z","title":"A spectrum evaluation benchmark for medical multi-modal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-17T08:35:40.471939Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.489753Z"},"links":{"cited_paper":"/paper/2402.11217","citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:496f628645fd9aa5c1ebc5ab37b2cdd110cc98d3408db4ea4d8673b516356ffd","observation_id":"46c22944-33a7-4cec-936e-4a58d7efeb44","resolution":{"observed_at":"2026-08-15T21:59:33.489753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00578","last_updated":"2024-03-31T06:55:12Z","snapshot_observed_at":"2026-08-16T14:04:54.843248Z","submitted_at":"2024-03-31T06:55:12Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00578","snapshot_observed_at":"2026-08-15T21:59:33.495030Z","title":"M3d: Advancing 3d medical image analysis with multi-modal large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-17T08:35:40.471939Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.495030Z"},"links":{"cited_paper":"/paper/2404.00578","citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:247f6817155f4510b44e8885762b1bbfc41f155fc085fd3ca424ff30e8c74e92","observation_id":"81b998e8-84cd-4ebd-82ad-3ab02563bc02","resolution":{"observed_at":"2026-08-15T21:59:33.495030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:59:35.188097Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"decf1ac2-d1b9-42e6-841c-3946bc64c686","year":2021},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-17T08:35:40.471939Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.500010Z"},"links":{"citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:0d545a248e5a137335c42f7ab3dfd67d05e9ae756d70bf0818cbedfd4700cd4b","observation_id":"e50418e7-bf9e-4d51-86fd-1264daa20d9b","resolution":{"observed_at":"2026-08-15T21:59:35.193579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:59:35.172405Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":"61fbb26b-8107-4bee-8ae9-bd922a29d423","year":2023},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-17T08:35:40.471939Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.504583Z"},"links":{"citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:e6d717cdbadbbb60617e4f5b341e7ac30f72e955fa8fd612674f47c80a4fa80a","observation_id":"cdff0e5f-ee66-4d28-a96b-3f5716613f57","resolution":{"observed_at":"2026-08-15T21:59:35.178154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.15377","last_updated":"2024-08-14T14:31:50Z","snapshot_observed_at":"2026-08-16T20:34:09.579602Z","submitted_at":"2024-03-22T17:57:42Z","title":"InternVideo2: Scaling Foundation Models for Multimodal Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.15377","snapshot_observed_at":"2026-08-15T21:59:33.509378Z","title":"Internvideo2: Scaling video foundation models for multimodal video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-17T08:35:40.471939Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.509378Z"},"links":{"cited_paper":"/paper/2403.15377","citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:d20e767333f6e3faf3b2e04878df254267e1fd42a5ab5a5c0b37ddf8b93b5ed3","observation_id":"82f532e7-71c2-45e0-b07e-e60c41ae0a9c","resolution":{"observed_at":"2026-08-15T21:59:33.509378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17434","last_updated":"2024-10-22T21:21:37Z","snapshot_observed_at":"2026-08-13T11:36:11.821356Z","submitted_at":"2024-10-22T21:21:37Z","title":"LongVU: Spatiotemporal Adaptive Compression for Long Video-Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17434","snapshot_observed_at":"2026-08-15T21:59:33.514987Z","title":"Longvu: Spa- tiotemporal adaptive compression for long video-language understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-17T08:35:40.471939Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.514987Z"},"links":{"cited_paper":"/paper/2410.17434","citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:777b85ad04f03c69deff05c402cef5b5e0ea5a364e795435547f510c0dbb67b2","observation_id":"96598b34-9e8d-4787-afd8-98e1cfe4e53e","resolution":{"observed_at":"2026-08-15T21:59:33.514987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15841","last_updated":"2024-09-15T05:00:18Z","snapshot_observed_at":"2026-08-16T13:32:02.889396Z","submitted_at":"2024-07-22T17:58:04Z","title":"SlowFast-LLaVA: A Strong Training-Free Baseline for Video Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15841","snapshot_observed_at":"2026-08-15T21:59:33.520336Z","title":"Slowfast-llava: A strong training-free baseline for video large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-17T08:35:40.471939Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.520336Z"},"links":{"cited_paper":"/paper/2407.15841","citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:eed616a17da31df1f47283877d8e21c0b8cfa5fce2aa6458287e3480a45f3739","observation_id":"7270f04b-5650-4b02-bbef-ae2a4a921ff8","resolution":{"observed_at":"2026-08-15T21:59:33.520336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:59:35.157260Z","title":"Mvbench: A comprehensive multi-modal video understanding benchmark","venue":null,"work_id":"3ab83cb6-330a-4864-913b-e2574c10dad1","year":2024},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-17T08:35:40.471939Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.525739Z"},"links":{"citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:c3b58c20a83d954841d263aa60dc678d6ac5d919670ef481376e16a982f0bbfa","observation_id":"605c03e1-405b-4afc-b7ee-1ac3815bde4b","resolution":{"observed_at":"2026-08-15T21:59:35.162399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17043","last_updated":"2023-11-28T18:53:43Z","snapshot_observed_at":"2026-08-16T14:39:31.347488Z","submitted_at":"2023-11-28T18:53:43Z","title":"LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17043","snapshot_observed_at":"2026-08-15T21:59:33.532560Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-17T08:35:40.471939Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.532560Z"},"links":{"cited_paper":"/paper/2311.17043","citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:549bf57379c2ddbd63737ba00549b61366e446890240a97b84195063c2c78d71","observation_id":"a418e650-accc-4d06-8ae2-41cfbd230895","resolution":{"observed_at":"2026-08-15T21:59:33.532560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-08-14T16:25:22.654846Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-15T21:59:33.537472Z","title":"Videollama 2: Advancing spatial-temporal modeling and audio understanding in video-llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-17T08:35:40.471939Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.537472Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:0299d7a99f849046bf612adf3432deb3b1d353bd3e9fb11e42fda6af969eb296","observation_id":"ae912172-be3e-4f6d-ac41-6e33bfe252ab","resolution":{"observed_at":"2026-08-15T21:59:33.537472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13106","last_updated":"2025-06-03T03:33:14Z","snapshot_observed_at":"2026-08-13T11:53:19.464291Z","submitted_at":"2025-01-22T18:59:46Z","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13106","snapshot_observed_at":"2026-08-15T21:59:33.543100Z","title":"Videollama 3: Frontier multimodal foundation models for image and video understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-17T08:35:40.471939Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.543100Z"},"links":{"cited_paper":"/paper/2501.13106","citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:e1103427fb3f06b09ea7e6903b14edd4b2bbeb001deebee02ae1d7e1b6e6d75e","observation_id":"50caf98d-008e-4c68-b7f7-a27bc88dd2a9","resolution":{"observed_at":"2026-08-15T21:59:33.543100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:59:35.142524Z","title":"Timechat: A time-sensitive multimodal large language model for long video understanding","venue":null,"work_id":"328790d9-52b5-45b8-bf53-a285964308e7","year":2024},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-17T08:35:40.471939Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.547817Z"},"links":{"citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:a4e343e56e18df53bdf09ad947ba46e6c021d820fcb7f72e4400a65eae25e5a0","observation_id":"9cf4d981-c735-4225-bb99-f5f4764d190b","resolution":{"observed_at":"2026-08-15T21:59:35.147759Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-16T04:27:36.181491Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-08-15T21:59:33.552216Z","title":"Longvila: Scaling long-context visual language models for long videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-17T08:35:40.471939Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.552216Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:44f5118b59e0e0cae62d1c738aac839cf68e0641a930b9194178ebad6d35099c","observation_id":"bb79dd26-bed0-4924-b083-bc95c8cfb7b3","resolution":{"observed_at":"2026-08-15T21:59:33.552216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-08-15T21:59:33.557150Z","title":"Video instruction tuning with synthetic data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-17T08:35:40.471939Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.557150Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:f3399bcb6eeb93a7805ad763302c066a629faed140bbbf504f6783be6ca73f8d","observation_id":"bfdc15e9-adde-4fe9-a13d-624b11eb2769","resolution":{"observed_at":"2026-08-15T21:59:33.557150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-15T21:59:33.562745Z","title":"Video-llava: Learning united visual representation by alignment before projection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-17T08:35:40.471939Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.562745Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:fe5213a72ed2de32914175a2a1eb867148bc9ed67d95566c7c926a802de12ec6","observation_id":"e5439363-9c59-44d3-a269-b8b7db28832c","resolution":{"observed_at":"2026-08-15T21:59:33.562745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-08-14T18:15:53.516440Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-15T21:59:33.567661Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-17T08:35:40.471939Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.567661Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:de6119650e62d698969ea0493ac4511cdec5adf19ad555fc655e5d3f26222b62","observation_id":"578520e5-b3bb-4afe-9cc2-8bb64ce22f25","resolution":{"observed_at":"2026-08-15T21:59:33.567661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:59:35.126850Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":"fdd1e778-da38-4aa4-8d53-0f9efea9743f","year":2024},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-17T08:35:40.471939Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.572655Z"},"links":{"citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:8e4b0dca722ac7bafacc4635198cab114cd9b135b059c0c2023b3d2b0fc52202","observation_id":"43c1aa7a-e644-415c-9837-9a358b3c61b3","resolution":{"observed_at":"2026-08-15T21:59:35.132123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-15T21:59:33.577918Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-17T08:35:40.471939Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.577918Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:907ebb3c09c9683d8c90dffdc83ab1b6ab11c399347659d406fc9df7ffbf024d","observation_id":"1ebae743-b61f-48fa-b400-fbdbd49df6e4","resolution":{"observed_at":"2026-08-15T21:59:33.577918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:59:35.111602Z","title":"Qwen-vl: A versatile vision-language model for understanding, localization","venue":null,"work_id":"1174e36b-f7a4-4575-b1ac-2fd94853cfdf","year":2023},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-17T08:35:40.471939Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.582957Z"},"links":{"citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:806662f228de76f8c95fac79aa427b1e8ea4b99ae4914ccdc7dc9bc2fbfaced2","observation_id":"abc00dbc-3b25-4895-8253-99514193ed0c","resolution":{"observed_at":"2026-08-15T21:59:35.116420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-15T21:59:33.587609Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-17T08:35:40.471939Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.587609Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:fd53068a81edf2201f4ed89ec0cc59045dc1cc4b51165133b1e10f94342c029d","observation_id":"ed7d0b5a-a7ca-4ac5-b33c-f162c980f986","resolution":{"observed_at":"2026-08-15T21:59:33.587609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:59:35.079984Z","title":"Intentqa: Context-aware video intent reasoning","venue":null,"work_id":"727a4f4e-2967-478a-96c3-da30a609f250","year":2023},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-17T08:35:40.471939Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.597957Z"},"links":{"citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:9a647ce7b866afe2fdeda5ab8989ab2f9376b1f72fe601992ea09743ad2a24cf","observation_id":"8d2f1091-ee92-4f41-b884-c575b4d27450","resolution":{"observed_at":"2026-08-15T21:59:35.084753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:59:35.063885Z","title":"Rex- time: A benchmark suite for reasoning-across-time in videos","venue":null,"work_id":"374d65f5-5914-4bb6-b341-eba51daa608a","year":2024},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-17T08:35:40.471939Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.602270Z"},"links":{"citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:77513ab20744b408d9224e00a50167a100dd7a5021c44c3724090fe67af122f4","observation_id":"852a0e58-1b22-4e8e-903b-0ef34fe7db90","resolution":{"observed_at":"2026-08-15T21:59:35.069675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:59:35.046730Z","title":"From representation to reasoning: Towards both evidence and commonsense reasoning for video question-answering","venue":null,"work_id":"8ef6dec4-0af9-47de-bd0b-7ec55f98b8d0","year":2022},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-17T08:35:40.471939Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.607218Z"},"links":{"citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:66fa5b6374fbca1872326b52eab6c1691c1eb5117c07e6cb5f677caca06b051c","observation_id":"95eb2e73-826e-45ec-ba3f-6e5aa90e6e69","resolution":{"observed_at":"2026-08-15T21:59:35.052199Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-15T21:59:33.611835Z","title":"Long context transfer from language to vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-17T08:35:40.471939Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.611835Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:23bf0ea6bde888d1d940380482d5814bec74f292557127ea898b375145bfa972","observation_id":"a9ef2c91-79b1-4a9a-ab86-7279b66c08b5","resolution":{"observed_at":"2026-08-15T21:59:33.611835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:59:35.030846Z","title":"Moviechat: From dense token to sparse memory for long video understanding","venue":null,"work_id":"b3cf0e8f-3e9f-4d75-b760-7ea3f5ddeb19","year":2024},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-17T08:35:40.471939Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.617442Z"},"links":{"citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:cea4e8faf752373161f0cb41bea0c06883c47aee1767bfad0acdf5a3ef559d03","observation_id":"906e0ef9-b0e3-40b6-a7d0-d3b554e4d1d6","resolution":{"observed_at":"2026-08-15T21:59:35.036159Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00574","last_updated":"2025-07-13T16:21:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-31T18:01:23Z","title":"VideoChat-Flash: Hierarchical Compression for Long-Context Video Modeling","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00574","snapshot_observed_at":"2026-08-15T21:59:33.622058Z","title":"Videochat-flash: Hierarchical compression for long-context video modeling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-17T08:35:40.471939Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.622058Z"},"links":{"cited_paper":"/paper/2501.00574","citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:b3887f9afbb6936242e92995ce8db2292b3617b0aea136e698ba2d234b53615e","observation_id":"c725de8b-4d3c-42b8-bbb1-e77eda694019","resolution":{"observed_at":"2026-08-15T21:59:33.622058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15704","last_updated":"2024-06-22T01:36:11Z","snapshot_observed_at":"2026-08-16T13:40:35.133323Z","submitted_at":"2024-06-22T01:36:11Z","title":"video-SALMONN: Speech-Enhanced Audio-Visual Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15704","snapshot_observed_at":"2026-08-15T21:59:33.626864Z","title":"video-salmonn: Speech-enhanced audio-visual large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-17T08:35:40.471939Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.626864Z"},"links":{"cited_paper":"/paper/2406.15704","citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:c76064b4bc450fae27c08027613e897689a4dcb3a6feb4cc672798ba3afc6fb6","observation_id":"ec3dd096-487a-4ce7-8741-b02ab8275c7c","resolution":{"observed_at":"2026-08-15T21:59:33.626864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09418","last_updated":"2024-06-13T17:59:59Z","snapshot_observed_at":"2026-08-16T13:43:12.933116Z","submitted_at":"2024-06-13T17:59:59Z","title":"VideoGPT+: Integrating Image and Video Encoders for Enhanced Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09418","snapshot_observed_at":"2026-08-15T21:59:33.631527Z","title":"Videogpt+: Integrating image and video encoders for enhanced video understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-17T08:35:40.471939Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.631527Z"},"links":{"cited_paper":"/paper/2406.09418","citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:ac186263a1ece654ac0c82eaa830106e7846a2ed0ec6dde97624775958636ec0","observation_id":"01a1d4b7-fae9-465e-a4fd-a4c44af26b47","resolution":{"observed_at":"2026-08-15T21:59:33.631527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:59:33.637682Z","title":"Video understanding with large language models: A survey","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-17T08:35:40.471939Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.637682Z"},"links":{"citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:ae82c214bfe46153e1cb185ad4dbc3ad70cb2757101153a3a1a5a53b0525c7be","observation_id":"4e1f5f85-d232-4aab-8ea3-c116692f5b5e","resolution":{"observed_at":"2026-08-15T21:59:33.637682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.03770","last_updated":"2024-05-06T18:09:48Z","snapshot_observed_at":"2026-08-16T13:54:55.899708Z","submitted_at":"2024-05-06T18:09:48Z","title":"Foundation Models for Video Understanding: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.03770","snapshot_observed_at":"2026-08-15T21:59:33.642396Z","title":"Foundation models for video understanding: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-17T08:35:40.471939Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.642396Z"},"links":{"cited_paper":"/paper/2405.03770","citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:34c1e44027dd8c3d720909c5a4175a8efc43ffe692df1806f6c5e1a5338a47b1","observation_id":"920f45ec-7d6e-4994-a205-3e17288a260c","resolution":{"observed_at":"2026-08-15T21:59:33.642396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:59:33.647351Z","title":"Activitynet-qa: A dataset for understanding complex web videos via question answering","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-17T08:35:40.471939Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.647351Z"},"links":{"citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:015bbe3f66dec356204ccb0f7b7a9241ca209f3d9107ca4f60837527b6ba3e5e","observation_id":"6ae3780d-0c83-40ce-a81c-fa06d730fe3f","resolution":{"observed_at":"2026-08-15T21:59:33.647351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:59:35.002743Z","title":"Video question answering via gradually refined attention over appearance and motion","venue":null,"work_id":"22709430-ca43-4309-bfc1-fd7d498189dc","year":2017},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-17T08:35:40.471939Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.653452Z"},"links":{"citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:b641db2cda055734b6fdc7368fc6d66c891b4f77202a60d29b5ba0895dc82ded","observation_id":"eca70cb1-cdc6-4f87-93d4-b83935edb694","resolution":{"observed_at":"2026-08-15T21:59:35.008796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:59:34.985891Z","title":"Next-qa: Next phase of question- answering to explaining temporal actions","venue":null,"work_id":"5d393a3d-9376-44fb-bce0-b6accbf590be","year":2021},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-17T08:35:40.471939Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.658131Z"},"links":{"citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:72b9f4db064101d7824b34e8f1f843859804b59c3e2291cfef491e537acbeb57","observation_id":"2a023add-8aef-4e6e-8b2f-07d2cf103131","resolution":{"observed_at":"2026-08-15T21:59:34.990702Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:59:34.970695Z","title":"Tgif-qa: Toward spatio-temporal reasoning in visual question answering","venue":null,"work_id":"0db04fd8-3181-4ced-a1cc-4d34a2b043fe","year":2017},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-17T08:35:40.471939Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.663554Z"},"links":{"citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:c4413ab0df3543d12af2c8bff75e77c7c7b05f3a05a1ff36b4642f49c899fccf","observation_id":"acea9151-c1c2-4783-9c9f-1d659178ccc0","resolution":{"observed_at":"2026-08-15T21:59:34.975540Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07752","last_updated":"2025-03-25T09:46:02Z","snapshot_observed_at":"2026-08-16T13:10:47.063439Z","submitted_at":"2024-10-10T09:28:36Z","title":"Lost in Time: A New Temporal Benchmark for VideoLLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07752","snapshot_observed_at":"2026-08-15T21:59:33.668469Z","title":"Tvbench: Redesigning video-language evaluation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-17T08:35:40.471939Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.668469Z"},"links":{"cited_paper":"/paper/2410.07752","citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:b77bbf7c7e21c7d4939eba6f00206dc0a86e8824555b8f7879024db3b3103aaf","observation_id":"e75fe3f7-da28-4ef7-8baf-7a88741e82dc","resolution":{"observed_at":"2026-08-15T21:59:33.668469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-15T21:59:33.674311Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-17T08:35:40.471939Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.674311Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:c5daeb9b341df2a5ece0d2ed78dacff7eb909558c2fb71f8182585655f854d48","observation_id":"e39db794-266f-4f71-b8c6-afea1340d505","resolution":{"observed_at":"2026-08-15T21:59:33.674311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.00476","last_updated":"2024-06-03T04:13:39Z","snapshot_observed_at":"2026-08-12T14:24:43.915700Z","submitted_at":"2024-03-01T12:02:19Z","title":"TempCompass: Do Video LLMs Really Understand Videos?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.00476","snapshot_observed_at":"2026-08-15T21:59:33.679506Z","title":"Tempcompass: Do video llms really understand videos? arXiv preprint arXiv:2403.00476, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-17T08:35:40.471939Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.679506Z"},"links":{"cited_paper":"/paper/2403.00476","citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:54aae21aba1d1b523a3dc0cfe867a670ac15f9a872d37bad96c987fced994be5","observation_id":"0efe9d6d-0a96-4d3d-b9df-09d0c1139a53","resolution":{"observed_at":"2026-08-15T21:59:33.679506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10818","last_updated":"2024-10-15T17:55:46Z","snapshot_observed_at":"2026-08-16T13:09:28.872428Z","submitted_at":"2024-10-14T17:59:58Z","title":"TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10818","snapshot_observed_at":"2026-08-15T21:59:33.684509Z","title":"Temporalbench: Benchmarking fine-grained temporal understanding for multimodal video models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-17T08:35:40.471939Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.684509Z"},"links":{"cited_paper":"/paper/2410.10818","citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:56b9e4b5b66f29224764ca82b0a477096c999ce650a956d770ba00a39b230975","observation_id":"dd700fdb-2a23-43c3-9a61-04b000dd0e50","resolution":{"observed_at":"2026-08-15T21:59:33.684509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04264","last_updated":"2025-01-01T15:53:58Z","snapshot_observed_at":"2026-08-03T20:38:36.602554Z","submitted_at":"2024-06-06T17:09:32Z","title":"MLVU: Benchmarking Multi-task Long Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04264","snapshot_observed_at":"2026-08-15T21:59:33.689913Z","title":"Mlvu: A comprehensive benchmark for multi-task long video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-17T08:35:40.471939Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.689913Z"},"links":{"cited_paper":"/paper/2406.04264","citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:89b2784c9ad96479f173b5f038c40668e51b08e3ad0e089c212592920c125cd2","observation_id":"861cd7f6-85bf-478e-bea8-bf3dc51f9482","resolution":{"observed_at":"2026-08-15T21:59:33.689913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:59:34.954867Z","title":"Longvideobench: A benchmark for long- context interleaved video-language understanding","venue":null,"work_id":"22887694-28d3-47e2-bf66-91d7a0d1df0d","year":2025},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-17T08:35:40.471939Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.696191Z"},"links":{"citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:a3c2aceab3ad60306c0797b9f6ebda706fc597acf41a31c49001665099660694","observation_id":"bb3b54af-c5be-4614-b2b4-575ef17ec51b","resolution":{"observed_at":"2026-08-15T21:59:34.959836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:59:34.939702Z","title":"Egoschema: A diagnostic benchmark for very long-form video language understanding","venue":null,"work_id":"ffae61bf-d24c-4151-8ab1-56b590e91f1d","year":2023},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-17T08:35:40.471939Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.701111Z"},"links":{"citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:ec099db28c5cac9d504591a68f38ca45b8c9f5cdcfb1df1cb9463d3e93e1e5ec","observation_id":"4af261fa-79dd-48c9-a700-bc67770e9b37","resolution":{"observed_at":"2026-08-15T21:59:34.944426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16338","last_updated":"2024-06-24T06:21:59Z","snapshot_observed_at":"2026-08-16T13:40:17.320079Z","submitted_at":"2024-06-24T06:21:59Z","title":"VideoHallucer: Evaluating Intrinsic and Extrinsic Hallucinations in Large Video-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16338","snapshot_observed_at":"2026-08-15T21:59:33.705892Z","title":"Videohallucer: Evaluating intrinsic and extrinsic hallucinations in large video-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-17T08:35:40.471939Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.705892Z"},"links":{"cited_paper":"/paper/2406.16338","citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:949e7dff6ef126e43842acd5be32d43c5b732e76e5efbb97d759adab8b0b0221","observation_id":"d0eb0d0b-aa1a-4a6d-83de-645e6b7d1a3a","resolution":{"observed_at":"2026-08-15T21:59:33.705892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.14566","last_updated":"2024-03-25T06:05:24Z","snapshot_observed_at":"2026-08-17T08:51:17.030494Z","submitted_at":"2023-10-23T04:49:09Z","title":"HallusionBench: An Advanced Diagnostic Suite for Entangled Language Hallucination and Visual Illusion in Large Vision-Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.14566","snapshot_observed_at":"2026-08-15T21:59:33.711050Z","title":"Hallusionbench: an advanced diagnostic suite for entangled language hallucination and visual illusion in large vision-language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-17T08:35:40.471939Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.711050Z"},"links":{"cited_paper":"/paper/2310.14566","citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:560efc760d51cf4bce58c8352f9252252ae9abb2af3322af8696d7c7d0de4424","observation_id":"3d5e342c-f4bb-4d8b-a56c-51bb49b5abcd","resolution":{"observed_at":"2026-08-15T21:59:33.711050Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:59:34.924242Z","title":"Sok-bench: A situated video reasoning benchmark with aligned open-world knowledge","venue":null,"work_id":"fd61e611-02ec-405d-bf2d-63f20e823b4b","year":2024},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-17T08:35:40.471939Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.716606Z"},"links":{"citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:ea21281f6b939157fff75024c6813b60240ac138e61211306f37f6a889708e2b","observation_id":"b934793b-b950-48ce-93e9-5c77b1a3a9c0","resolution":{"observed_at":"2026-08-15T21:59:34.929308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08407","last_updated":"2024-07-30T03:15:55Z","snapshot_observed_at":"2026-08-16T13:43:39.575307Z","submitted_at":"2024-06-12T16:54:54Z","title":"MMWorld: Towards Multi-discipline Multi-faceted World Model Evaluation in Videos","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08407","snapshot_observed_at":"2026-08-15T21:59:33.721333Z","title":"Mmworld: Towards multi-discipline multi-faceted world model evaluation in videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-17T08:35:40.471939Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.721333Z"},"links":{"cited_paper":"/paper/2406.08407","citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:f3a9cc40d84597b6c25deac70df8cf51c6197948765ea1aa69f120b7b8c5c564","observation_id":"fa4837b5-47b0-42d8-8d65-e4e6cd901d7a","resolution":{"observed_at":"2026-08-15T21:59:33.721333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07022","last_updated":"2023-11-13T02:13:13Z","snapshot_observed_at":"2026-08-17T04:39:36.707236Z","submitted_at":"2023-11-13T02:13:13Z","title":"ViLMA: A Zero-Shot Benchmark for Linguistic and Temporal Grounding in Video-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07022","snapshot_observed_at":"2026-08-15T21:59:33.726301Z","title":"Vilma: A zero-shot benchmark for linguistic and temporal grounding in video-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-17T08:35:40.471939Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.726301Z"},"links":{"cited_paper":"/paper/2311.07022","citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:b0084802b65bddc22d7377ccf5237c53258456624e57ee658a67e97e4064480d","observation_id":"d78f15c0-b7e3-4db3-8dc0-380def64992e","resolution":{"observed_at":"2026-08-15T21:59:33.726301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:59:33.731448Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-17T08:35:40.471939Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.731448Z"},"links":{"citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:36fb09b2f52046ee27dcc93168dde4995b44d86908fcb1bf21687223eca7c493","observation_id":"ac8e6e87-15f4-430c-9521-2b29d9083cbf","resolution":{"observed_at":"2026-08-15T21:59:33.731448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:59:34.899620Z","title":"Deep reinforcement learning from human preferences","venue":null,"work_id":"a9835e1a-117a-407c-9b6e-26bdce89aacf","year":2017},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-17T08:35:40.471939Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.736464Z"},"links":{"citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:b4da4fee5a186018e4b63b8782586a2e5ad28213b192746a0b96f7d15fd7a49c","observation_id":"8580e34b-d30c-4b28-b1e6-c0848ed85041","resolution":{"observed_at":"2026-08-15T21:59:34.904330Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-15T21:59:33.741587Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-17T08:35:40.471939Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.741587Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:5b98e292b497d136b4825f4edd87a6887f25291713c640e9126d9d8f30f08c01","observation_id":"89df4697-23fa-4319-9127-b731d1cc5aac","resolution":{"observed_at":"2026-08-15T21:59:33.741587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-15T21:59:33.748580Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-17T08:35:40.471939Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.748580Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:d988281e65f124c9757c79813b989f8a1d2d92f89a718e093935b95e023ced29","observation_id":"97814645-f452-4faa-8251-db811fa094db","resolution":{"observed_at":"2026-08-15T21:59:33.748580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-08-16T01:49:22.176843Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-15T21:59:33.753498Z","title":"Self-consistency improves chain of thought reasoning in language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-17T08:35:40.471939Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.753498Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:977547a37a9cef89c12ee7e6fc7f5f5e3491ddbb2f14efed3dfb0a7e71794aed","observation_id":"24680908-ecc4-4b80-bf19-e826a679e737","resolution":{"observed_at":"2026-08-15T21:59:33.753498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:59:34.884566Z","title":"Learning to summarize with human feedback","venue":null,"work_id":"9bf7a93e-61e5-405b-9030-cf1c49491c46","year":2020},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-17T08:35:40.471939Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.758432Z"},"links":{"citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:e10612f82d3016201d1e36d1324cd774e74008d5e81fa6f9ef2adfb4db1c59b9","observation_id":"9e1edf25-7ef5-4916-a861-67fdbd79e8fd","resolution":{"observed_at":"2026-08-15T21:59:34.889209Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.09332","last_updated":"2022-06-01T19:08:11Z","snapshot_observed_at":"2026-08-07T17:14:39.278754Z","submitted_at":"2021-12-17T05:43:43Z","title":"WebGPT: Browser-assisted question-answering with human feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.09332","snapshot_observed_at":"2026-08-15T21:59:33.763413Z","title":"Webgpt: Browser-assisted question-answering with human feedback","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-17T08:35:40.471939Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.763413Z"},"links":{"cited_paper":"/paper/2112.09332","citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:6baa39ae1910edbea7a90cd78b58aa1ac3347fbb948151453f892053cf8ad830","observation_id":"a8c36977-6c37-45b7-9b12-17e04a61dd27","resolution":{"observed_at":"2026-08-15T21:59:33.763413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02406","last_updated":"2023-04-11T19:39:17Z","snapshot_observed_at":"2026-08-15T11:54:04.569366Z","submitted_at":"2022-10-05T17:28:20Z","title":"Decomposed Prompting: A Modular Approach for Solving Complex Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02406","snapshot_observed_at":"2026-08-15T21:59:33.768463Z","title":"Decomposed prompting: A modular approach for solving complex tasks","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-17T08:35:40.471939Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.768463Z"},"links":{"cited_paper":"/paper/2210.02406","citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:28f02ba4c6a2ea84ff060fa6ba0dc213bbdbcac52f526b9fe23fe0f6efa4bd5f","observation_id":"95e00432-1208-4893-87e9-0d48cb358aa9","resolution":{"observed_at":"2026-08-15T21:59:33.768463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:59:33.774187Z","title":"Cross-task weakly supervised learning from instructional videos","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-17T08:35:40.471939Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.774187Z"},"links":{"citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:8ccba499a2fcff5101d8fa449d39f7cb556809f083d0087a7460ef52cbdd9c9d","observation_id":"7501a49a-7ab1-4c2a-b32f-8c0ba6a17baf","resolution":{"observed_at":"2026-08-15T21:59:33.774187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-15T21:59:33.779074Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-17T08:35:40.471939Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.779074Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:6f53da5d70f23d39ba91fa4b0dc519bc51da5b044175d5a938dbd5f70f6f6e73","observation_id":"bfcfd53b-1f87-4dc8-b886-63934c8076a9","resolution":{"observed_at":"2026-08-15T21:59:33.779074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:59:34.858085Z","title":"Procedure planning in instructional videos","venue":null,"work_id":"efa7c2b1-34cb-4ace-9140-1f3942dc18ab","year":2020},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-17T08:35:40.471939Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.783601Z"},"links":{"citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:6cad0a5ab2c6f5448115b9b206f60682ba150ffc8900f715d852bb66264af969","observation_id":"1d7f9d09-8164-4e31-b0ff-cf7cb4912456","resolution":{"observed_at":"2026-08-15T21:59:34.862986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-15T21:59:33.788339Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-17T08:35:40.471939Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.788339Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:2b40f65ee7f5440abb0d4a6fe46e10d152d0a90a23ca73f72514caee1d48917c","observation_id":"45816025-77a8-4996-8343-f5f185a6bce3","resolution":{"observed_at":"2026-08-15T21:59:33.788339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-15T21:59:33.793129Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-17T08:35:40.471939Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.793129Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:fd7cca3ee915cca2d4d114a9792a6527d655cd037b36ba8e0e1197221d583de1","observation_id":"6b696177-b007-40e3-a160-eb62669a7c28","resolution":{"observed_at":"2026-08-15T21:59:33.793129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-15T21:59:33.797702Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-17T08:35:40.471939Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.797702Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:31993d3d97cfefe4dd5a2de0eea5b9ad4b873239c60ab7cb9a19700e8efd2bac","observation_id":"ca8f6bae-b1e5-4f52-8979-691d0a85fb06","resolution":{"observed_at":"2026-08-15T21:59:33.797702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:59:34.842741Z","title":"Identifying and mitigating vulnerabilities in llm-integrated applications","venue":null,"work_id":"1680d1db-d91b-4369-a083-72606f268f03","year":2024},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-17T08:35:40.471939Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.803407Z"},"links":{"citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:aabad0a9fe4cd8840e9dc37df2ef07dd01cd914d2893eec40925ec71c46c476f","observation_id":"577db0fc-0d97-4733-8a58-afaccc14980c","resolution":{"observed_at":"2026-08-15T21:59:34.847612Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-15T21:59:33.808139Z","title":"Qwen technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-17T08:35:40.471939Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.808139Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:a2b03f43f72634448e85db1e290aace6d6299e7be4016eb6188dd8f54c9d1cd6","observation_id":"cf3fe687-b0a0-444a-87ea-e87f80ecc16e","resolution":{"observed_at":"2026-08-15T21:59:33.808139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-08-17T18:50:07.059564Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-15T21:59:33.812991Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-17T08:35:40.471939Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.812991Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:d906cd2d0681ccc10e17279aeec07bb0dc6481c76b1229b291e39acb5a7da101","observation_id":"047be0b7-5194-461e-9856-6be2066e33e2","resolution":{"observed_at":"2026-08-15T21:59:33.812991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:59:34.826628Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":"d65a041f-886e-4dff-8586-eba695044fc2","year":2023},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-17T08:35:40.471939Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.817963Z"},"links":{"citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:24124862e38e856d8ba5e5cc8995339e395dc2e7427df98ca9ae1bdad143603e","observation_id":"de0015e8-0aeb-4867-97b3-f8b93ab7d2bc","resolution":{"observed_at":"2026-08-15T21:59:34.832119Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:59:34.810331Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":"3158031f-44eb-41b6-8c03-0e3e6dc33f2b","year":2024},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-17T08:35:40.471939Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.822529Z"},"links":{"citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:ae3a6774e95c6c86a5eb8e0a733256438c6ec2fc42abe4856f396cfe2cb1e913","observation_id":"5ef27645-4dab-43fc-85a8-edf929a3dbc1","resolution":{"observed_at":"2026-08-15T21:59:34.815963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-17T13:03:40.359628Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-15T21:59:33.827196Z","title":"Dinov2: Learning robust visual features without supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-17T08:35:40.471939Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.827196Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:3dc3c21176cf71178ff7f2d15a2791f99ee1cf06f91e42a33cb51bb60ba5af78","observation_id":"faf3c1a1-325b-4625-ae12-0e58912ab2c3","resolution":{"observed_at":"2026-08-15T21:59:33.827196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:59:34.792896Z","title":"Unmasked teacher: Towards training-efficient video foundation models","venue":null,"work_id":"68fbff69-f727-4104-a3ff-ff830e499b00","year":2023},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-17T08:35:40.471939Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.833255Z"},"links":{"citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:86730a4bcec51cf2ea6f8f69e09010f92a491e294a0dab352bd9134156fda7db","observation_id":"53afbc61-2f7a-425b-a164-06134bde3f79","resolution":{"observed_at":"2026-08-15T21:59:34.799739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:59:33.838263Z","title":"Self-alignment of large video language models with refined regularized preference optimization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-17T08:35:40.471939Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.838263Z"},"links":{"citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:2cad61d7acf926150eb564e605b2aa3647d68c3437d13caa0b50bcd9db0f4781","observation_id":"443f75ea-042d-40ab-bbbf-82c5d5f71f07","resolution":{"observed_at":"2026-08-15T21:59:33.838263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04468","snapshot_observed_at":"2026-08-15T21:59:33.842742Z","title":"Nvila: Efficient frontier visual language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-17T08:35:40.471939Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.842742Z"},"links":{"cited_paper":"/paper/2412.04468","citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:03604abb489f241cb24e890d9425d8cc9e3e591f45e6739a2b8c2656237bb67d","observation_id":"e95008de-bb64-4ce2-8fda-886c9f83364d","resolution":{"observed_at":"2026-08-15T21:59:33.842742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-15T21:59:33.848016Z","title":"Minicpm-v: A gpt-4v level mllm on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-17T08:35:40.471939Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.848016Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:56f64adbe4aab5d8fca1c9285f19532a02e3a95d1cbb98e32b159926c6446f67","observation_id":"7df600f0-39b1-42a5-8f74-b0b2ab60c761","resolution":{"observed_at":"2026-08-15T21:59:33.848016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-08-15T14:02:47.366139Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-15T21:59:33.853704Z","title":"Gpt-4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-17T08:35:40.471939Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.853704Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:394c81f08eb05a3362c962bdc0ff9811fc11683417a635e6befc22418a32dac0","observation_id":"c2d2c112-4f3f-477f-9dd0-beaee1a5d3d4","resolution":{"observed_at":"2026-08-15T21:59:33.853704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:59:35.095619Z","title":null,"venue":null,"work_id":"c518de37-c5f3-4d5a-b2c0-1e080a002b28","year":null},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-17T08:35:40.471939Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.592973Z"},"links":{"citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:76b728c48c016e1c16edd40d77a545d97a9bd568b0f0519430edefa910333330","observation_id":"f3caf5fc-588c-41b9-9866-da8cedf6f0d6","resolution":{"observed_at":"2026-08-15T21:59:35.100239Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-17T08:35:40.471939Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models"},"reference_resolution":{"displayed":80,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":52,"verified_exact":0,"verified_fuzzy":26},"total_outbound_references":80},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 80 of 80 outbound references and 0 inbound Pith citation observations for arXiv:2505.08455."}