{"as_of":"2026-08-18T10:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0d6591cdfe4a8652e29bd3a98e7de1d2e74c58d7b0389dde121887020cafbf37","coverage":[{"denominator":53,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T10:50:29.935626Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:08:41.965687Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-13T21:18:17.187055Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.17828","last_updated":"2025-04-24T04:36:28Z","snapshot_observed_at":"2026-08-17T22:44:17.432288Z","submitted_at":"2025-04-24T04:36:28Z","title":"VEU-Bench: Towards Comprehensive Understanding of Video Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.17828","snapshot_observed_at":"2026-08-07T11:08:41.965687Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.04277","last_updated":"2025-06-04T02:07:40Z","snapshot_observed_at":"2026-08-18T00:57:13.199663Z","submitted_at":"2025-06-04T02:07:40Z","title":"RSVP: Reasoning Segmentation via Visual Prompting and Multi-modal Chain-of-Thought","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T11:08:41.965687Z"},"links":{"cited_paper":"/paper/2504.17828","citing_paper":"/paper/2506.04277"},"observation_digest":"sha256:0ae36c3c5376a2027140a4b630af0d8f1967c5ac1341ba18be903e1422e349bf","observation_id":"86bf2cb7-94da-403f-8ed4-05db4472013b","resolution":{"observed_at":"2026-08-07T11:08:41.965687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.17828","last_updated":"2025-04-24T04:36:28Z","snapshot_observed_at":"2026-08-17T22:44:17.432288Z","submitted_at":"2025-04-24T04:36:28Z","title":"VEU-Bench: Towards Comprehensive Understanding of Video Editing","version":1},"cited_work":{"arxiv_id":"2504.17828","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.17828","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"1f63a3af-c137-4779-9400-08149e19c36a","year":2025},"citing_paper":{"arxiv_id":"2604.02467","last_updated":"2026-04-27T18:17:15Z","snapshot_observed_at":"2026-08-13T08:23:55.814605Z","submitted_at":"2026-04-02T18:58:56Z","title":"VERTIGO: Visual Preference Optimization for Cinematic Camera Trajectory Generation","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-13T21:14:42.021240Z"},"links":{"cited_paper":"/paper/2504.17828","citing_paper":"/paper/2604.02467"},"observation_digest":"sha256:63c12868af357dfeff06b834e245885a75bbe53afd0bfb4e812121c756ee67b7","observation_id":"d47f2d1d-dfd3-4cfa-b3df-33df2b972b46","resolution":{"observed_at":"2026-05-13T21:18:17.189424Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2504.17828/citation-record","integrity":"/paper/2504.17828/integrity","json":"/paper/2504.17828/citation-record.json","paper":"/paper/2504.17828"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:50:30.671985Z","title":"The anatomy of video editing: A dataset and benchmark suite for ai-assisted video editing","venue":null,"work_id":"fe68a8b1-746f-4e4d-84ab-7f9dd5e94248","year":2022},"citing_paper":{"arxiv_id":"2504.17828","last_updated":"2025-04-24T04:36:28Z","snapshot_observed_at":"2026-08-17T22:44:17.432288Z","submitted_at":"2025-04-24T04:36:28Z","title":"VEU-Bench: Towards Comprehensive Understanding of Video Editing","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T10:50:29.719063Z"},"links":{"citing_paper":"/paper/2504.17828"},"observation_digest":"sha256:80a0aed4be6c2f9b4c26817947040212a8088223dd13eb672e361f72de81b449","observation_id":"df1542c8-2c67-4624-a15c-24caeb6f6067","resolution":{"observed_at":"2026-08-16T10:50:30.681590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:50:30.659103Z","title":"Theory of film practice","venue":null,"work_id":"d8f18f1f-1ea4-4978-87e7-2579f3726d69","year":2014},"citing_paper":{"arxiv_id":"2504.17828","last_updated":"2025-04-24T04:36:28Z","snapshot_observed_at":"2026-08-17T22:44:17.432288Z","submitted_at":"2025-04-24T04:36:28Z","title":"VEU-Bench: Towards Comprehensive Understanding of Video Editing","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T10:50:29.724028Z"},"links":{"citing_paper":"/paper/2504.17828"},"observation_digest":"sha256:e0925fd28438ef7edad5f891d1c82c170f846f2edc5d5a3c5186670a9a4375f2","observation_id":"beb144f7-db10-4bfe-8dd2-a481b1edba75","resolution":{"observed_at":"2026-08-16T10:50:30.663217Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06070","last_updated":"2024-03-10T03:29:56Z","snapshot_observed_at":"2026-08-18T00:57:52.590932Z","submitted_at":"2024-03-10T03:29:56Z","title":"Reframe Anything: LLM Agent for Open World Video Reframing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06070","snapshot_observed_at":"2026-08-16T10:50:29.728425Z","title":"Reframe anything: Llm agent for open world video reframing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.17828","last_updated":"2025-04-24T04:36:28Z","snapshot_observed_at":"2026-08-17T22:44:17.432288Z","submitted_at":"2025-04-24T04:36:28Z","title":"VEU-Bench: Towards Comprehensive Understanding of Video Editing","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T10:50:29.728425Z"},"links":{"cited_paper":"/paper/2403.06070","citing_paper":"/paper/2504.17828"},"observation_digest":"sha256:422c4a931520ea5ef7d9815bcda419f129551caf982a38f21970525eb9bc32cb","observation_id":"5595545d-4e5a-44c4-ab37-17a59303d935","resolution":{"observed_at":"2026-08-16T10:50:29.728425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:50:30.645347Z","title":"Match cutting: Finding cuts with smooth visual transitions","venue":null,"work_id":"18c37eb8-3284-4203-91bd-71261eb32995","year":2023},"citing_paper":{"arxiv_id":"2504.17828","last_updated":"2025-04-24T04:36:28Z","snapshot_observed_at":"2026-08-17T22:44:17.432288Z","submitted_at":"2025-04-24T04:36:28Z","title":"VEU-Bench: Towards Comprehensive Understanding of Video Editing","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T10:50:29.733054Z"},"links":{"citing_paper":"/paper/2504.17828"},"observation_digest":"sha256:c33e80aec3c213ca1b3e9abd0fc5162a6afe12b6c5cbd49045298dd9286ce789","observation_id":"2a79a1f4-8a33-416d-a960-f09d74109829","resolution":{"observed_at":"2026-08-16T10:50:30.649683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-16T10:50:29.737303Z","title":"Sharegpt4video: Improving video understand- ing and generation with better captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.17828","last_updated":"2025-04-24T04:36:28Z","snapshot_observed_at":"2026-08-17T22:44:17.432288Z","submitted_at":"2025-04-24T04:36:28Z","title":"VEU-Bench: Towards Comprehensive Understanding of Video Editing","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T10:50:29.737303Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2504.17828"},"observation_digest":"sha256:4cfc18328b6eaecd8e11fb0ce3fa9c289f3da9b5d3b4ced57df748c29f4894de","observation_id":"c7dfa941-13be-4f45-b591-a253d06c7c01","resolution":{"observed_at":"2026-08-16T10:50:29.737303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-08-17T14:16:52.244007Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-16T10:50:29.741646Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.17828","last_updated":"2025-04-24T04:36:28Z","snapshot_observed_at":"2026-08-17T22:44:17.432288Z","submitted_at":"2025-04-24T04:36:28Z","title":"VEU-Bench: Towards Comprehensive Understanding of Video Editing","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T10:50:29.741646Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2504.17828"},"observation_digest":"sha256:e001894f5d4f8c36ce4696dafc60a8594bb24aece207f55a4cf93e38b74b5793","observation_id":"b3db770a-b655-4bb7-aa36-8e01199c7ae3","resolution":{"observed_at":"2026-08-16T10:50:29.741646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-08-14T16:25:22.654846Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-16T10:50:29.746377Z","title":"Videollama 2: Advancing spatial- temporal modeling and audio understanding in video-llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.17828","last_updated":"2025-04-24T04:36:28Z","snapshot_observed_at":"2026-08-17T22:44:17.432288Z","submitted_at":"2025-04-24T04:36:28Z","title":"VEU-Bench: Towards Comprehensive Understanding of Video Editing","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T10:50:29.746377Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2504.17828"},"observation_digest":"sha256:2c5412dd028be5b331e0b2fdf824399c928046a8b4c9391c23e25f50a9584eef","observation_id":"3351857e-fa43-432f-bef0-26ec0cc6b496","resolution":{"observed_at":"2026-08-16T10:50:29.746377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:50:30.632505Z","title":"The technique of film and video editing: history, theory, and practice","venue":null,"work_id":"cacaabcc-424a-462b-8322-d58b0c38c112","year":2018},"citing_paper":{"arxiv_id":"2504.17828","last_updated":"2025-04-24T04:36:28Z","snapshot_observed_at":"2026-08-17T22:44:17.432288Z","submitted_at":"2025-04-24T04:36:28Z","title":"VEU-Bench: Towards Comprehensive Understanding of Video Editing","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T10:50:29.750248Z"},"links":{"citing_paper":"/paper/2504.17828"},"observation_digest":"sha256:3a5c1029db84ba68f522c9e4ae2c7d4dc03851033f0caa0531feb4e48c27a619","observation_id":"a754fa32-211a-45d2-8038-8f7b487133f4","resolution":{"observed_at":"2026-08-16T10:50:30.636715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.14023","last_updated":"2024-08-26T05:27:14Z","snapshot_observed_at":"2026-08-16T13:23:55.587572Z","submitted_at":"2024-08-26T05:27:14Z","title":"Video-CCAM: Enhancing Video-Language Understanding with Causal Cross-Attention Masks for Short and Long Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.14023","snapshot_observed_at":"2026-08-16T10:50:29.754241Z","title":"Video-ccam: Enhancing video-language un- derstanding with causal cross-attention masks for short and long videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.17828","last_updated":"2025-04-24T04:36:28Z","snapshot_observed_at":"2026-08-17T22:44:17.432288Z","submitted_at":"2025-04-24T04:36:28Z","title":"VEU-Bench: Towards Comprehensive Understanding of Video Editing","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T10:50:29.754241Z"},"links":{"cited_paper":"/paper/2408.14023","citing_paper":"/paper/2504.17828"},"observation_digest":"sha256:e6418cfdfd7af6069b69a533f43e42978dede3d4a45cf33dd9f49ac1380ea0eb","observation_id":"3a9f687c-a050-4582-a0ea-c9b0cf0357e5","resolution":{"observed_at":"2026-08-16T10:50:29.754241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.06988","last_updated":"2021-05-14T17:52:25Z","snapshot_observed_at":"2026-08-16T18:24:38.526669Z","submitted_at":"2021-05-14T17:52:25Z","title":"Automatic Non-Linear Video Editing Transfer","version":1},"cited_work":{"arxiv_id":"2105.06988","doi":null,"metadata_source":"pith","pith_arxiv_id":"2105.06988","snapshot_observed_at":"2026-08-16T10:50:30.319167Z","title":"Automatic Non-Linear Video Editing Transfer","venue":"cs.CV","work_id":"5e5cb314-fd32-4003-bc96-66c9b958ceb2","year":2021},"citing_paper":{"arxiv_id":"2504.17828","last_updated":"2025-04-24T04:36:28Z","snapshot_observed_at":"2026-08-17T22:44:17.432288Z","submitted_at":"2025-04-24T04:36:28Z","title":"VEU-Bench: Towards Comprehensive Understanding of Video Editing","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T10:50:29.758395Z"},"links":{"cited_paper":"/paper/2105.06988","citing_paper":"/paper/2504.17828"},"observation_digest":"sha256:c9a066590b2509b1029739332a5236a57979f4f3de4ba283383245622b1b4468","observation_id":"0c919074-4ccd-4001-8559-1770e74ba05e","resolution":{"observed_at":"2026-08-16T10:50:30.323439Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-16T10:50:29.763000Z","title":"Video-mme: The first-ever compre- hensive evaluation benchmark of multi-modal llms in video analysis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.17828","last_updated":"2025-04-24T04:36:28Z","snapshot_observed_at":"2026-08-17T22:44:17.432288Z","submitted_at":"2025-04-24T04:36:28Z","title":"VEU-Bench: Towards Comprehensive Understanding of Video Editing","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T10:50:29.763000Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2504.17828"},"observation_digest":"sha256:e66d69f6e4f2278aa0218c39303f7a0d5eb085ece2fff49f00ba0e304953e27b","observation_id":"edd27ce0-1296-4e94-a87b-ef66ac6f0892","resolution":{"observed_at":"2026-08-16T10:50:29.763000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.16048","last_updated":"2025-02-25T06:46:02Z","snapshot_observed_at":"2026-08-16T14:07:00.397882Z","submitted_at":"2024-03-24T07:29:04Z","title":"Edit3K: Universal Representation Learning for Video Editing Components","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.16048","snapshot_observed_at":"2026-08-16T10:50:29.767070Z","title":"Edit3k: Universal representa- tion learning for video editing components","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.17828","last_updated":"2025-04-24T04:36:28Z","snapshot_observed_at":"2026-08-17T22:44:17.432288Z","submitted_at":"2025-04-24T04:36:28Z","title":"VEU-Bench: Towards Comprehensive Understanding of Video Editing","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T10:50:29.767070Z"},"links":{"cited_paper":"/paper/2403.16048","citing_paper":"/paper/2504.17828"},"observation_digest":"sha256:ce959b547317a2b145313e92bb75692387a0a5387dc8458c2cdd83c58e0484af","observation_id":"8ed59f42-0b90-4f8f-9ef0-30986f331394","resolution":{"observed_at":"2026-08-16T10:50:29.767070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-17T18:04:53.578114Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-16T10:50:29.771160Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.17828","last_updated":"2025-04-24T04:36:28Z","snapshot_observed_at":"2026-08-17T22:44:17.432288Z","submitted_at":"2025-04-24T04:36:28Z","title":"VEU-Bench: Towards Comprehensive Understanding of Video Editing","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T10:50:29.771160Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2504.17828"},"observation_digest":"sha256:1fc49f72efa2a5affe974432e2d8d77c69cc7eb2c70b3619db1d45a0796b825d","observation_id":"d4005da3-0840-4488-aed2-b1e65b38636b","resolution":{"observed_at":"2026-08-16T10:50:29.771160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:50:30.619361Z","title":"Vtimellm: Empower llm to grasp video moments","venue":null,"work_id":"51913901-0ecf-4d9f-80b6-e08a985ebf19","year":2024},"citing_paper":{"arxiv_id":"2504.17828","last_updated":"2025-04-24T04:36:28Z","snapshot_observed_at":"2026-08-17T22:44:17.432288Z","submitted_at":"2025-04-24T04:36:28Z","title":"VEU-Bench: Towards Comprehensive Understanding of Video Editing","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T10:50:29.775357Z"},"links":{"citing_paper":"/paper/2504.17828"},"observation_digest":"sha256:4bd5af362c473f51c9ea17ae2eb1b02f60d0af3214c1e31ead6bb3c8499d1150","observation_id":"e261ab51-bb24-4474-9371-e2408318bfbf","resolution":{"observed_at":"2026-08-16T10:50:30.623631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:50:30.606399Z","title":"Movienet: A holistic dataset for movie understanding","venue":null,"work_id":"ae56a186-5ea2-4639-93d1-8f76997e91dd","year":2020},"citing_paper":{"arxiv_id":"2504.17828","last_updated":"2025-04-24T04:36:28Z","snapshot_observed_at":"2026-08-17T22:44:17.432288Z","submitted_at":"2025-04-24T04:36:28Z","title":"VEU-Bench: Towards Comprehensive Understanding of Video Editing","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T10:50:29.779201Z"},"links":{"citing_paper":"/paper/2504.17828"},"observation_digest":"sha256:97348d58a309ad69421ef3256841bc67f20bac181cf63aca803219e772d7544b","observation_id":"73678a1a-6d14-422b-8d89-2a769e4d20a2","resolution":{"observed_at":"2026-08-16T10:50:30.610505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:50:30.593589Z","title":"Study of vari- ous video annotation techniques","venue":null,"work_id":"e98d09a7-57e1-4106-ab8a-29fe3b6d662c","year":2013},"citing_paper":{"arxiv_id":"2504.17828","last_updated":"2025-04-24T04:36:28Z","snapshot_observed_at":"2026-08-17T22:44:17.432288Z","submitted_at":"2025-04-24T04:36:28Z","title":"VEU-Bench: Towards Comprehensive Understanding of Video Editing","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T10:50:29.783094Z"},"links":{"citing_paper":"/paper/2504.17828"},"observation_digest":"sha256:8189d261311edd20464486158f662badc56323303b00a7487bc3ff0b6d110947","observation_id":"68d33af1-7e79-4102-a671-fd5fade83331","resolution":{"observed_at":"2026-08-16T10:50:30.597848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:50:30.580625Z","title":"Automatic color scheme extraction from movies","venue":null,"work_id":"5aeb7c1e-7718-4272-91be-a7f67e4ad4bc","year":2020},"citing_paper":{"arxiv_id":"2504.17828","last_updated":"2025-04-24T04:36:28Z","snapshot_observed_at":"2026-08-17T22:44:17.432288Z","submitted_at":"2025-04-24T04:36:28Z","title":"VEU-Bench: Towards Comprehensive Understanding of Video Editing","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T10:50:29.786897Z"},"links":{"citing_paper":"/paper/2504.17828"},"observation_digest":"sha256:0880425477afbd4e66e693aeee8e81bed3c3114dadacd9afd14322800f9e3607","observation_id":"4a8e3af3-20fc-4ea2-a60b-8b3d86b630f6","resolution":{"observed_at":"2026-08-16T10:50:30.585033Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12475","last_updated":"2024-08-22T15:13:27Z","snapshot_observed_at":"2026-08-16T13:24:33.749954Z","submitted_at":"2024-08-22T15:13:27Z","title":"Frame Order Matters: A Temporal Sequence-Aware Model for Few-Shot Action Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12475","snapshot_observed_at":"2026-08-16T10:50:29.790543Z","title":"Frame order matters: A temporal sequence-aware model for few-shot action recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.17828","last_updated":"2025-04-24T04:36:28Z","snapshot_observed_at":"2026-08-17T22:44:17.432288Z","submitted_at":"2025-04-24T04:36:28Z","title":"VEU-Bench: Towards Comprehensive Understanding of Video Editing","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T10:50:29.790543Z"},"links":{"cited_paper":"/paper/2408.12475","citing_paper":"/paper/2504.17828"},"observation_digest":"sha256:67e9e5ee99de1075fa3813116235ef917dd761cd7e54420fe17f2a5b7b8b0c78","observation_id":"e89586d6-630c-443f-b1bc-0021e5cc66f7","resolution":{"observed_at":"2026-08-16T10:50:29.790543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-16T10:50:29.794977Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.17828","last_updated":"2025-04-24T04:36:28Z","snapshot_observed_at":"2026-08-17T22:44:17.432288Z","submitted_at":"2025-04-24T04:36:28Z","title":"VEU-Bench: Towards Comprehensive Understanding of Video Editing","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T10:50:29.794977Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2504.17828"},"observation_digest":"sha256:f5d0e0e809fe000f4bfc0456363e599f1865347043918d60676fe6ce9786fb53","observation_id":"4b0d1287-fdb6-4ba6-9f4e-21bb5ea600d7","resolution":{"observed_at":"2026-08-16T10:50:29.794977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:50:30.567704Z","title":"Mvbench: A comprehensive multi-modal video understand- ing benchmark","venue":null,"work_id":"84dbb0a9-b8b3-43b5-9b7d-f205fdaeed1a","year":2024},"citing_paper":{"arxiv_id":"2504.17828","last_updated":"2025-04-24T04:36:28Z","snapshot_observed_at":"2026-08-17T22:44:17.432288Z","submitted_at":"2025-04-24T04:36:28Z","title":"VEU-Bench: Towards Comprehensive Understanding of Video Editing","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T10:50:29.799069Z"},"links":{"citing_paper":"/paper/2504.17828"},"observation_digest":"sha256:4f78a0c1905ec32f4fb449ebb9b1680a85a2ac7d3cf6320a8c5d9609c9ee9fa8","observation_id":"2d400170-9e9e-4a89-9a06-69b9794aa5bf","resolution":{"observed_at":"2026-08-16T10:50:30.572030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-16T10:50:29.803058Z","title":"Video-llava: Learning united visual rep- resentation by alignment before projection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.17828","last_updated":"2025-04-24T04:36:28Z","snapshot_observed_at":"2026-08-17T22:44:17.432288Z","submitted_at":"2025-04-24T04:36:28Z","title":"VEU-Bench: Towards Comprehensive Understanding of Video Editing","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T10:50:29.803058Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2504.17828"},"observation_digest":"sha256:b661cdf1eb56fa955e74d2ab88126fa122275166f222473b4dba4e1805c071b4","observation_id":"8f0db0df-d6d7-4151-967e-e4e583c20c2c","resolution":{"observed_at":"2026-08-16T10:50:29.803058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:50:30.554953Z","title":"Vila: On pre-training for visual language models","venue":null,"work_id":"fa10b08a-7ec4-47a3-8b33-d20ce2afed35","year":2024},"citing_paper":{"arxiv_id":"2504.17828","last_updated":"2025-04-24T04:36:28Z","snapshot_observed_at":"2026-08-17T22:44:17.432288Z","submitted_at":"2025-04-24T04:36:28Z","title":"VEU-Bench: Towards Comprehensive Understanding of Video Editing","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T10:50:29.807109Z"},"links":{"citing_paper":"/paper/2504.17828"},"observation_digest":"sha256:2ed4ecc2cba7f8c6062d64d6afbe25ba3df2849a40f5bcf6e1f0a54844dcf0e0","observation_id":"7aea31df-fcd5-40dc-a327-bff6b98039b0","resolution":{"observed_at":"2026-08-16T10:50:30.559138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06158","last_updated":"2024-08-12T13:55:46Z","snapshot_observed_at":"2026-08-16T13:27:00.364898Z","submitted_at":"2024-08-12T13:55:46Z","title":"OmniCLIP: Adapting CLIP for Video Recognition with Spatial-Temporal Omni-Scale Feature Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06158","snapshot_observed_at":"2026-08-16T10:50:29.811027Z","title":"Omniclip: Adapt- ing clip for video recognition with spatial-temporal omni- scale feature learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.17828","last_updated":"2025-04-24T04:36:28Z","snapshot_observed_at":"2026-08-17T22:44:17.432288Z","submitted_at":"2025-04-24T04:36:28Z","title":"VEU-Bench: Towards Comprehensive Understanding of Video Editing","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T10:50:29.811027Z"},"links":{"cited_paper":"/paper/2408.06158","citing_paper":"/paper/2504.17828"},"observation_digest":"sha256:4de0b59835b83b3f286bb14478109c4e66bf5bc9503caead4d9e74357d1f71eb","observation_id":"73917e7a-15a5-4439-9230-725c43bc659a","resolution":{"observed_at":"2026-08-16T10:50:29.811027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.00476","last_updated":"2024-06-03T04:13:39Z","snapshot_observed_at":"2026-08-12T14:24:43.915700Z","submitted_at":"2024-03-01T12:02:19Z","title":"TempCompass: Do Video LLMs Really Understand Videos?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.00476","snapshot_observed_at":"2026-08-16T10:50:29.815623Z","title":"Tempcom- pass: Do video llms really understand videos?arXiv preprint arXiv:2403.00476, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.17828","last_updated":"2025-04-24T04:36:28Z","snapshot_observed_at":"2026-08-17T22:44:17.432288Z","submitted_at":"2025-04-24T04:36:28Z","title":"VEU-Bench: Towards Comprehensive Understanding of Video Editing","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T10:50:29.815623Z"},"links":{"cited_paper":"/paper/2403.00476","citing_paper":"/paper/2504.17828"},"observation_digest":"sha256:9878d081a24e9ab40e515685282a00a1aad07a0c67925a5a553a40907e3c5557","observation_id":"468a9f86-0350-4cb1-827d-ae8a6ee09610","resolution":{"observed_at":"2026-08-16T10:50:29.815623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12961","last_updated":"2025-02-27T06:09:46Z","snapshot_observed_at":"2026-08-16T13:17:05.325564Z","submitted_at":"2024-09-19T17:59:51Z","title":"Oryx MLLM: On-Demand Spatial-Temporal Understanding at Arbitrary Resolution","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12961","snapshot_observed_at":"2026-08-16T10:50:29.819644Z","title":"Oryx mllm: On-demand spatial-temporal understanding at arbitrary resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.17828","last_updated":"2025-04-24T04:36:28Z","snapshot_observed_at":"2026-08-17T22:44:17.432288Z","submitted_at":"2025-04-24T04:36:28Z","title":"VEU-Bench: Towards Comprehensive Understanding of Video Editing","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T10:50:29.819644Z"},"links":{"cited_paper":"/paper/2409.12961","citing_paper":"/paper/2504.17828"},"observation_digest":"sha256:2e6735f1b313d3d083da2c797f081324bc2a57dd9c3db2904e014d6035473a7c","observation_id":"c9a6248b-b904-44db-aff0-78109d8466af","resolution":{"observed_at":"2026-08-16T10:50:29.819644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-16T10:50:29.824192Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.17828","last_updated":"2025-04-24T04:36:28Z","snapshot_observed_at":"2026-08-17T22:44:17.432288Z","submitted_at":"2025-04-24T04:36:28Z","title":"VEU-Bench: Towards Comprehensive Understanding of Video Editing","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T10:50:29.824192Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2504.17828"},"observation_digest":"sha256:f0e47965b05c4b14b4777f61ed5c6ad8d7b0ea60665b286f30e774cabd76d145","observation_id":"4d84cdba-c51d-4582-84fe-e8517857df54","resolution":{"observed_at":"2026-08-16T10:50:29.824192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05424","last_updated":"2024-06-10T01:36:53Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05424","snapshot_observed_at":"2026-08-16T10:50:29.828630Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.17828","last_updated":"2025-04-24T04:36:28Z","snapshot_observed_at":"2026-08-17T22:44:17.432288Z","submitted_at":"2025-04-24T04:36:28Z","title":"VEU-Bench: Towards Comprehensive Understanding of Video Editing","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T10:50:29.828630Z"},"links":{"cited_paper":"/paper/2306.05424","citing_paper":"/paper/2504.17828"},"observation_digest":"sha256:8f6566e8a19b17201cdf9098fed6a7170bdf7ac3514c36f99d391a0ad9c5221b","observation_id":"dc7bf747-f927-41c1-bf94-44379ec167ec","resolution":{"observed_at":"2026-08-16T10:50:29.828630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:50:30.542009Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and language models","venue":null,"work_id":"bf6d6be9-c201-4661-8a1e-ac8dc24f1dcd","year":2024},"citing_paper":{"arxiv_id":"2504.17828","last_updated":"2025-04-24T04:36:28Z","snapshot_observed_at":"2026-08-17T22:44:17.432288Z","submitted_at":"2025-04-24T04:36:28Z","title":"VEU-Bench: Towards Comprehensive Understanding of Video Editing","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T10:50:29.832573Z"},"links":{"citing_paper":"/paper/2504.17828"},"observation_digest":"sha256:1ba06332ad581b47949d7a20d71b1463a4a3563f2bfb6bc1f8df669dafcfb43a","observation_id":"6cd29212-5daf-4d76-96ad-008046d093cd","resolution":{"observed_at":"2026-08-16T10:50:30.546166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:50:30.528794Z","title":"Film language: A semiotics of the cinema","venue":null,"work_id":"93c9fe3e-8a2e-4520-a227-71e246851d4c","year":1991},"citing_paper":{"arxiv_id":"2504.17828","last_updated":"2025-04-24T04:36:28Z","snapshot_observed_at":"2026-08-17T22:44:17.432288Z","submitted_at":"2025-04-24T04:36:28Z","title":"VEU-Bench: Towards Comprehensive Understanding of Video Editing","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T10:50:29.836635Z"},"links":{"citing_paper":"/paper/2504.17828"},"observation_digest":"sha256:f784a3d87f9a6a2fd1272f0cf9724bb9c7a9d747ba8c3e3ebaca5dff5b1bb6e7","observation_id":"f7beb7ce-554f-4a46-aff1-e5cb0db0f250","resolution":{"observed_at":"2026-08-16T10:50:30.533118Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:50:30.515830Z","title":"Hello gpt-4o","venue":null,"work_id":"e2050827-8990-4205-bb7c-f2b7e9359dd7","year":2024},"citing_paper":{"arxiv_id":"2504.17828","last_updated":"2025-04-24T04:36:28Z","snapshot_observed_at":"2026-08-17T22:44:17.432288Z","submitted_at":"2025-04-24T04:36:28Z","title":"VEU-Bench: Towards Comprehensive Understanding of Video Editing","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T10:50:29.840466Z"},"links":{"citing_paper":"/paper/2504.17828"},"observation_digest":"sha256:72febe4d39aaf6e3813ce083df97cf767e7b0000c695d934e702113673402cf4","observation_id":"6fc9c3f4-7bf4-4c71-a0c4-9899432b3a79","resolution":{"observed_at":"2026-08-16T10:50:30.520155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:50:30.502315Z","title":"Learning to cut by watch- ing movies","venue":null,"work_id":"5d6a378c-1b5b-4b1b-bca5-8634ff59984c","year":2021},"citing_paper":{"arxiv_id":"2504.17828","last_updated":"2025-04-24T04:36:28Z","snapshot_observed_at":"2026-08-17T22:44:17.432288Z","submitted_at":"2025-04-24T04:36:28Z","title":"VEU-Bench: Towards Comprehensive Understanding of Video Editing","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T10:50:29.844481Z"},"links":{"citing_paper":"/paper/2504.17828"},"observation_digest":"sha256:a6ec31575352f21cac6acfaeed352908d6a34608de6fb0cd1acaa3c148b9ffd0","observation_id":"428a71d4-79e1-4026-8e88-f4986202a2c6","resolution":{"observed_at":"2026-08-16T10:50:30.506467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:50:30.488709Z","title":"Moviecuts: A new dataset and benchmark for cut type recognition","venue":null,"work_id":"5bf1ff71-6c1d-4331-bf17-9e8e15ad35b3","year":null},"citing_paper":{"arxiv_id":"2504.17828","last_updated":"2025-04-24T04:36:28Z","snapshot_observed_at":"2026-08-17T22:44:17.432288Z","submitted_at":"2025-04-24T04:36:28Z","title":"VEU-Bench: Towards Comprehensive Understanding of Video Editing","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T10:50:29.848450Z"},"links":{"citing_paper":"/paper/2504.17828"},"observation_digest":"sha256:52f5e99b0fc6cbd1a7731bde965b3831ad256743336c12f09f6d24c15e7ecb4d","observation_id":"65b45f01-ef13-46c5-bce8-816fb3f72caf","resolution":{"observed_at":"2026-08-16T10:50:30.493170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:50:30.473739Z","title":"Perception test: A diagnostic benchmark for multimodal video models","venue":null,"work_id":"71f57c0b-4e0d-4774-988b-f40c55531ed4","year":2024},"citing_paper":{"arxiv_id":"2504.17828","last_updated":"2025-04-24T04:36:28Z","snapshot_observed_at":"2026-08-17T22:44:17.432288Z","submitted_at":"2025-04-24T04:36:28Z","title":"VEU-Bench: Towards Comprehensive Understanding of Video Editing","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T10:50:29.852455Z"},"links":{"citing_paper":"/paper/2504.17828"},"observation_digest":"sha256:ee55d128af1ddef398b1cc5c040b2d92b41f197faaf6308a95fb4ca8374352ba","observation_id":"541fefd0-a7db-4db1-859d-e0fc4c8a4870","resolution":{"observed_at":"2026-08-16T10:50:30.478920Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:50:30.458960Z","title":"Autotran- sition: Learning to recommend video transition effects","venue":null,"work_id":"52e4c991-1044-4e7a-8ee7-fce12650e45f","year":2022},"citing_paper":{"arxiv_id":"2504.17828","last_updated":"2025-04-24T04:36:28Z","snapshot_observed_at":"2026-08-17T22:44:17.432288Z","submitted_at":"2025-04-24T04:36:28Z","title":"VEU-Bench: Towards Comprehensive Understanding of Video Editing","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T10:50:29.856455Z"},"links":{"citing_paper":"/paper/2504.17828"},"observation_digest":"sha256:c5dadb46e8ed41d620dd5b42c379115627ad498c80167195d265296a8b0e6baa","observation_id":"53ddda76-f0fc-4a95-a994-a3dc9da77f97","resolution":{"observed_at":"2026-08-16T10:50:30.463313Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:50:30.444198Z","title":"Harnessing ai for augmenting creativity: Appli- cation to movie trailer creation","venue":null,"work_id":"4f1b6c34-63ba-4ac8-bbd4-65e3187cc913","year":2017},"citing_paper":{"arxiv_id":"2504.17828","last_updated":"2025-04-24T04:36:28Z","snapshot_observed_at":"2026-08-17T22:44:17.432288Z","submitted_at":"2025-04-24T04:36:28Z","title":"VEU-Bench: Towards Comprehensive Understanding of Video Editing","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T10:50:29.860575Z"},"links":{"citing_paper":"/paper/2504.17828"},"observation_digest":"sha256:936a19f9545690f6aa2fdfa26c93a2724899e2ff79f11988483d4edd929039a4","observation_id":"f1e1463d-c381-4a44-ac2b-d25a5958e5ac","resolution":{"observed_at":"2026-08-16T10:50:30.448755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07111","last_updated":"2024-06-26T04:58:39Z","snapshot_observed_at":"2026-08-16T13:39:33.591894Z","submitted_at":"2024-06-26T04:58:39Z","title":"Diffusion Model-Based Video Editing: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07111","snapshot_observed_at":"2026-08-16T10:50:29.864489Z","title":"Diffusion model-based video editing: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.17828","last_updated":"2025-04-24T04:36:28Z","snapshot_observed_at":"2026-08-17T22:44:17.432288Z","submitted_at":"2025-04-24T04:36:28Z","title":"VEU-Bench: Towards Comprehensive Understanding of Video Editing","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T10:50:29.864489Z"},"links":{"cited_paper":"/paper/2407.07111","citing_paper":"/paper/2504.17828"},"observation_digest":"sha256:33e3cf067873b79139b07be8f19b6951b7516e3e56080b7005bf8c324f2a0539","observation_id":"7ad4a3b3-9abe-4f14-ac99-62a99f5824c9","resolution":{"observed_at":"2026-08-16T10:50:29.864489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-16T10:50:29.868612Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.17828","last_updated":"2025-04-24T04:36:28Z","snapshot_observed_at":"2026-08-17T22:44:17.432288Z","submitted_at":"2025-04-24T04:36:28Z","title":"VEU-Bench: Towards Comprehensive Understanding of Video Editing","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T10:50:29.868612Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2504.17828"},"observation_digest":"sha256:5e3a65951deb8aedb9861f8ccd1fce96ffb96756cf3a6b7e36fd0f2c519c803b","observation_id":"e8576dfe-7d15-40e7-adcc-918118619203","resolution":{"observed_at":"2026-08-16T10:50:29.868612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:50:30.430771Z","title":"Converting video formats with ffmpeg","venue":null,"work_id":"8f8ca185-3d0e-4e18-8c12-5e85c2b6ef6d","year":2006},"citing_paper":{"arxiv_id":"2504.17828","last_updated":"2025-04-24T04:36:28Z","snapshot_observed_at":"2026-08-17T22:44:17.432288Z","submitted_at":"2025-04-24T04:36:28Z","title":"VEU-Bench: Towards Comprehensive Understanding of Video Editing","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T10:50:29.872819Z"},"links":{"citing_paper":"/paper/2504.17828"},"observation_digest":"sha256:773466c7f2fe9588490c74a7a49d940353f570166c9f25fc129bab9ca0b0b7dd","observation_id":"c53bf548-3e40-45fe-b2c8-ff5bc67b71da","resolution":{"observed_at":"2026-08-16T10:50:30.434949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:50:30.416985Z","title":"Movie lens: Discovering and characterizing editing patterns in the anal- ysis of short movie sequences","venue":null,"work_id":"f1180112-0a55-4a04-9509-f4c18d68fe0d","year":2022},"citing_paper":{"arxiv_id":"2504.17828","last_updated":"2025-04-24T04:36:28Z","snapshot_observed_at":"2026-08-17T22:44:17.432288Z","submitted_at":"2025-04-24T04:36:28Z","title":"VEU-Bench: Towards Comprehensive Understanding of Video Editing","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T10:50:29.876820Z"},"links":{"citing_paper":"/paper/2504.17828"},"observation_digest":"sha256:05835fc8554c6a14d82b096c471c875d333715cbc5c48948254996908373f2e0","observation_id":"e317ea7e-28aa-4d83-87a0-e22badb7d63b","resolution":{"observed_at":"2026-08-16T10:50:30.421455Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-16T10:50:29.880662Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.17828","last_updated":"2025-04-24T04:36:28Z","snapshot_observed_at":"2026-08-17T22:44:17.432288Z","submitted_at":"2025-04-24T04:36:28Z","title":"VEU-Bench: Towards Comprehensive Understanding of Video Editing","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T10:50:29.880662Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2504.17828"},"observation_digest":"sha256:d448b90f06b88c8fb727f610cbd71bd9518d4cc30bce5199e021dc5a2a18329d","observation_id":"83adc78b-320e-415b-9731-e83f95bff8ac","resolution":{"observed_at":"2026-08-16T10:50:29.880662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08035","last_updated":"2025-08-09T10:54:59Z","snapshot_observed_at":"2026-08-08T19:38:26.415599Z","submitted_at":"2024-06-12T09:36:52Z","title":"LVBench: An Extreme Long Video Understanding Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08035","snapshot_observed_at":"2026-08-16T10:50:29.884649Z","title":"Lvbench: An extreme long video understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.17828","last_updated":"2025-04-24T04:36:28Z","snapshot_observed_at":"2026-08-17T22:44:17.432288Z","submitted_at":"2025-04-24T04:36:28Z","title":"VEU-Bench: Towards Comprehensive Understanding of Video Editing","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T10:50:29.884649Z"},"links":{"cited_paper":"/paper/2406.08035","citing_paper":"/paper/2504.17828"},"observation_digest":"sha256:8235182393c219126b627aee6078f16fe355f70073f613ed83ab2e48e7d558c2","observation_id":"cb1685b3-a5b2-45f8-b21b-0ab8809b8b54","resolution":{"observed_at":"2026-08-16T10:50:29.884649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:50:30.402098Z","title":"Editing techniques with final cut pro","venue":null,"work_id":"6a33b912-ead2-430c-9887-d3d16ccad80c","year":2002},"citing_paper":{"arxiv_id":"2504.17828","last_updated":"2025-04-24T04:36:28Z","snapshot_observed_at":"2026-08-17T22:44:17.432288Z","submitted_at":"2025-04-24T04:36:28Z","title":"VEU-Bench: Towards Comprehensive Understanding of Video Editing","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T10:50:29.888880Z"},"links":{"citing_paper":"/paper/2504.17828"},"observation_digest":"sha256:7d13b3cd6e004be1fbdf1a452543edb0a6e691e34de32c20aa07934f08150288","observation_id":"45929c96-d7fa-48d0-ab14-aa397f109fc6","resolution":{"observed_at":"2026-08-16T10:50:30.407011Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15754","last_updated":"2024-07-22T16:00:55Z","snapshot_observed_at":"2026-08-15T01:28:11.776642Z","submitted_at":"2024-07-22T16:00:55Z","title":"LongVideoBench: A Benchmark for Long-context Interleaved Video-Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15754","snapshot_observed_at":"2026-08-16T10:50:29.893249Z","title":"Longvideobench: A benchmark for long-context inter- leaved video-language understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.17828","last_updated":"2025-04-24T04:36:28Z","snapshot_observed_at":"2026-08-17T22:44:17.432288Z","submitted_at":"2025-04-24T04:36:28Z","title":"VEU-Bench: Towards Comprehensive Understanding of Video Editing","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T10:50:29.893249Z"},"links":{"cited_paper":"/paper/2407.15754","citing_paper":"/paper/2504.17828"},"observation_digest":"sha256:ec6c733c64f97ee298695222e624aa89a35a60ce6a61012acd41901d48d05d97","observation_id":"8e86f818-dcd2-4741-a4ce-57d825c415fe","resolution":{"observed_at":"2026-08-16T10:50:29.893249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17309","last_updated":"2024-06-25T06:42:26Z","snapshot_observed_at":"2026-08-16T13:39:53.026586Z","submitted_at":"2024-06-25T06:42:26Z","title":"Zero-Shot Long-Form Video Understanding through Screenplay","version":1},"cited_work":{"arxiv_id":"2406.17309","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.17309","snapshot_observed_at":"2026-08-16T10:50:30.088674Z","title":"Zero-Shot Long-Form Video Understanding through Screenplay","venue":"cs.CV","work_id":"e31ae9c1-2d48-4f21-b0b3-32244d7d709e","year":2024},"citing_paper":{"arxiv_id":"2504.17828","last_updated":"2025-04-24T04:36:28Z","snapshot_observed_at":"2026-08-17T22:44:17.432288Z","submitted_at":"2025-04-24T04:36:28Z","title":"VEU-Bench: Towards Comprehensive Understanding of Video Editing","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-16T10:50:29.897427Z"},"links":{"cited_paper":"/paper/2406.17309","citing_paper":"/paper/2504.17828"},"observation_digest":"sha256:b4ba08c759fcd7796ce8629d7c5f787cc8ddb7e5ff477418bc7c7af1acd2cd1b","observation_id":"16a12aa8-eff9-408a-b1d3-77ba01e12531","resolution":{"observed_at":"2026-08-16T10:50:30.095171Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08879","last_updated":"2024-12-16T03:16:59Z","snapshot_observed_at":"2026-08-13T01:37:11.297453Z","submitted_at":"2024-12-12T02:27:46Z","title":"Video Repurposing from User Generated Content: A Large-scale Dataset and Benchmark","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.08879","snapshot_observed_at":"2026-08-16T10:50:29.901553Z","title":"Video repurposing from user generated con- tent: A large-scale dataset and benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.17828","last_updated":"2025-04-24T04:36:28Z","snapshot_observed_at":"2026-08-17T22:44:17.432288Z","submitted_at":"2025-04-24T04:36:28Z","title":"VEU-Bench: Towards Comprehensive Understanding of Video Editing","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-16T10:50:29.901553Z"},"links":{"cited_paper":"/paper/2412.08879","citing_paper":"/paper/2504.17828"},"observation_digest":"sha256:af9d5e8bc41831c9211e30637a725b10d8460566e1a205f94ca0dd23c1ab4d5b","observation_id":"c31df461-7bc2-43e2-a2a2-480719ea4c3b","resolution":{"observed_at":"2026-08-16T10:50:29.901553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10484","last_updated":"2024-09-27T02:47:55Z","snapshot_observed_at":"2026-08-16T13:42:47.062039Z","submitted_at":"2024-06-15T03:28:52Z","title":"Beyond Raw Videos: Understanding Edited Videos with Large Multimodal Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10484","snapshot_observed_at":"2026-08-16T10:50:29.905591Z","title":"Beyond raw videos: Understanding edited videos with large multimodal model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.17828","last_updated":"2025-04-24T04:36:28Z","snapshot_observed_at":"2026-08-17T22:44:17.432288Z","submitted_at":"2025-04-24T04:36:28Z","title":"VEU-Bench: Towards Comprehensive Understanding of Video Editing","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-16T10:50:29.905591Z"},"links":{"cited_paper":"/paper/2406.10484","citing_paper":"/paper/2504.17828"},"observation_digest":"sha256:6a0e1620366e947533f1feea98efc1b13f96c205e71b46aae0f27fedbc13322c","observation_id":"227d5305-fddf-43ff-aa02-e6f2529b05f7","resolution":{"observed_at":"2026-08-16T10:50:29.905591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-16T04:27:36.181491Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-08-16T10:50:29.910764Z","title":"Longvila: Scaling long-context visual language models for long videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.17828","last_updated":"2025-04-24T04:36:28Z","snapshot_observed_at":"2026-08-17T22:44:17.432288Z","submitted_at":"2025-04-24T04:36:28Z","title":"VEU-Bench: Towards Comprehensive Understanding of Video Editing","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-16T10:50:29.910764Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2504.17828"},"observation_digest":"sha256:c1c9f464b8d88c4dd266b108e4d9103d8d3a85f92b78333051e32e383547440b","observation_id":"18bda182-7892-4052-bb7a-c37ea413cccc","resolution":{"observed_at":"2026-08-16T10:50:29.910764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-16T10:50:29.915272Z","title":"Minicpm-v: A gpt-4v level mllm on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.17828","last_updated":"2025-04-24T04:36:28Z","snapshot_observed_at":"2026-08-17T22:44:17.432288Z","submitted_at":"2025-04-24T04:36:28Z","title":"VEU-Bench: Towards Comprehensive Understanding of Video Editing","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-16T10:50:29.915272Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2504.17828"},"observation_digest":"sha256:7cea2dfaec4e008cc9e507c47056d38f3029128ceaafc15772a4475dcc94b440","observation_id":"2d406e3a-6e76-425a-aefd-ba39fb6a3d8c","resolution":{"observed_at":"2026-08-16T10:50:29.915272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04840","last_updated":"2024-08-13T08:10:32Z","snapshot_observed_at":"2026-08-16T23:01:47.789827Z","submitted_at":"2024-08-09T03:25:42Z","title":"mPLUG-Owl3: Towards Long Image-Sequence Understanding in Multi-Modal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04840","snapshot_observed_at":"2026-08-16T10:50:29.918962Z","title":"mplug-owl3: Towards long image-sequence understand- ing in multi-modal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.17828","last_updated":"2025-04-24T04:36:28Z","snapshot_observed_at":"2026-08-17T22:44:17.432288Z","submitted_at":"2025-04-24T04:36:28Z","title":"VEU-Bench: Towards Comprehensive Understanding of Video Editing","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-16T10:50:29.918962Z"},"links":{"cited_paper":"/paper/2408.04840","citing_paper":"/paper/2504.17828"},"observation_digest":"sha256:2e933eddce45fa2733122adfd4477b029ee4e6488b1395604e7994a86e4a015b","observation_id":"c4431211-cab5-45ba-86fa-5796e0e7adb9","resolution":{"observed_at":"2026-08-16T10:50:29.918962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-08-13T15:50:38.254753Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-16T10:50:29.923137Z","title":"Video-llama: An instruction-tuned audio-visual language model for video un- derstanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.17828","last_updated":"2025-04-24T04:36:28Z","snapshot_observed_at":"2026-08-17T22:44:17.432288Z","submitted_at":"2025-04-24T04:36:28Z","title":"VEU-Bench: Towards Comprehensive Understanding of Video Editing","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-16T10:50:29.923137Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2504.17828"},"observation_digest":"sha256:0e7c5187544fde0b2cd9efbfaea34d901a9ae34ba32b1efa89843980bc40c4b8","observation_id":"436a70dd-7435-4c9d-af02-12d9b814f80d","resolution":{"observed_at":"2026-08-16T10:50:29.923137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03320","last_updated":"2024-07-03T17:59:21Z","snapshot_observed_at":"2026-08-14T16:53:05.474750Z","submitted_at":"2024-07-03T17:59:21Z","title":"InternLM-XComposer-2.5: A Versatile Large Vision Language Model Supporting Long-Contextual Input and Output","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.03320","snapshot_observed_at":"2026-08-16T10:50:29.927424Z","title":"Internlm-xcomposer-2.5: A versatile large vision language model supporting long-contextual in- put and output","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.17828","last_updated":"2025-04-24T04:36:28Z","snapshot_observed_at":"2026-08-17T22:44:17.432288Z","submitted_at":"2025-04-24T04:36:28Z","title":"VEU-Bench: Towards Comprehensive Understanding of Video Editing","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-16T10:50:29.927424Z"},"links":{"cited_paper":"/paper/2407.03320","citing_paper":"/paper/2504.17828"},"observation_digest":"sha256:0276fe539daa2a09cf8915a07dbc6d662cb2c19d4488c67aebe7974908447dbd","observation_id":"d761f01e-d6ef-4c4b-9afb-59c0bba72a75","resolution":{"observed_at":"2026-08-16T10:50:29.927424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-08-16T10:50:29.931575Z","title":"Video instruction tuning with synthetic data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.17828","last_updated":"2025-04-24T04:36:28Z","snapshot_observed_at":"2026-08-17T22:44:17.432288Z","submitted_at":"2025-04-24T04:36:28Z","title":"VEU-Bench: Towards Comprehensive Understanding of Video Editing","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-16T10:50:29.931575Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2504.17828"},"observation_digest":"sha256:84c044a1aad2f2a5975ddcbf320ae4d826d7df238ee2e822517191b1a1870888","observation_id":"7dee8977-a33c-49e8-9fc7-dd7533c02385","resolution":{"observed_at":"2026-08-16T10:50:29.931575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04264","last_updated":"2025-01-01T15:53:58Z","snapshot_observed_at":"2026-08-03T20:38:36.602554Z","submitted_at":"2024-06-06T17:09:32Z","title":"MLVU: Benchmarking Multi-task Long Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04264","snapshot_observed_at":"2026-08-16T10:50:29.935626Z","title":"Mlvu: A comprehensive benchmark for multi-task long video understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.17828","last_updated":"2025-04-24T04:36:28Z","snapshot_observed_at":"2026-08-17T22:44:17.432288Z","submitted_at":"2025-04-24T04:36:28Z","title":"VEU-Bench: Towards Comprehensive Understanding of Video Editing","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-16T10:50:29.935626Z"},"links":{"cited_paper":"/paper/2406.04264","citing_paper":"/paper/2504.17828"},"observation_digest":"sha256:4109a95e13b55977e087d1a4c0d5c8ed906b6abd388ede5932f86b7b9e1bd2fb","observation_id":"8f12a558-3aa6-4041-9e8e-bf707c9c3e40","resolution":{"observed_at":"2026-08-16T10:50:29.935626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2504.17828","last_updated":"2025-04-24T04:36:28Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-17T22:44:17.432288Z","submitted_at":"2025-04-24T04:36:28Z","title":"VEU-Bench: Towards Comprehensive Understanding of Video Editing"},"reference_resolution":{"displayed":53,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":30,"verified_exact":2,"verified_fuzzy":21},"total_outbound_references":53},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 2 inbound Pith citation observations for arXiv:2504.17828."}