{"as_of":"2026-08-10T08:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c038ec44100c928b7ac2d233b8613b12a1fd130525801c4bba75f029d97bb39d","coverage":[{"denominator":66,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":66,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T02:57:35.417802Z","state":"measured"},{"denominator":66,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":66,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.25300/citation-record","integrity":"/paper/2607.25300/integrity","json":"/paper/2607.25300/citation-record.json","paper":"/paper/2607.25300"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:33.526010Z","title":"Adopting self- supervised learning into unsupervised video summarization through restorative score","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-09T06:34:14.297495Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:33.526010Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:21efced3d385fd1cfa73fcff48cb00d30f1ad22297bda653e0cd054c155bcb64","observation_id":"ecced3ec-8956-43b8-8873-8915804c5eca","resolution":{"observed_at":"2026-08-01T02:57:33.526010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:33.531817Z","title":"Combining global and local attention with positional encoding for video summarization","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-09T06:34:14.297495Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:33.531817Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:142d008fd5f69a470b02ac5ac49ef1eaf1c365af058da26602a6000f5b41e8ec","observation_id":"acda662c-6162-4503-9b3c-fd3458d436e4","resolution":{"observed_at":"2026-08-01T02:57:33.531817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:33.537215Z","title":"Summarizing videos using con- centrated attention and considering the uniqueness and diver- sity of the video frames","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-09T06:34:14.297495Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:33.537215Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:4dd6888599405af71e0b769ad59030bbaa045b822b93b254f4670042f2246e50","observation_id":"27d5d21a-0523-4123-a40c-ae1ba4b9053d","resolution":{"observed_at":"2026-08-01T02:57:33.537215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:33.542503Z","title":"Scaling up video summarization pretraining with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-09T06:34:14.297495Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:33.542503Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:e4150b62a6d38f461db5d30a7d8240b56f0a30cc1d12012953d8e0e658055bb5","observation_id":"59baaf17-8b2b-4b27-b110-c428ee0f6d7c","resolution":{"observed_at":"2026-08-01T02:57:33.542503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-01T02:57:33.547372Z","title":"Qwen3-VL technical report.arXiv preprint arXiv:2511.21631, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-09T06:34:14.297495Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:33.547372Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:beb5beffcc52167f7ef0324f7d10804b9b9cc2927c63fdbb13c68808b0562c50","observation_id":"1de320e2-cd3a-4139-94e1-2109e9b99123","resolution":{"observed_at":"2026-08-01T02:57:33.547372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:33.553920Z","title":"Blender studio films.https://studio","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-09T06:34:14.297495Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:33.553920Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:4d89b7011a20894b23c352c038955c54d0b3464fd1fe24334b69976e921b7fb1","observation_id":"ff241b79-9bbc-432b-ad24-16efc41ab4d6","resolution":{"observed_at":"2026-08-01T02:57:33.553920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:33.559812Z","title":"VSUMM: A mechanism designed to produce static video summaries and a novel evaluation method.Pattern Recog- nit","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-09T06:34:14.297495Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:33.559812Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:fe0a78e974e8f78f8df5af2f1fee1df8e07b40951b62a006212391d33d81656f","observation_id":"093d8ffd-64fb-4612-9cf7-98c1eedbb5ec","resolution":{"observed_at":"2026-08-01T02:57:33.559812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:33.566410Z","title":"Summarizing videos with attention","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-09T06:34:14.297495Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:33.566410Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:dc672a7b4482efc5e54961f2006b8da503039cb8a4c33aac849461c60207ad72","observation_id":"87394ed8-fd48-4735-977e-5a16af907239","resolution":{"observed_at":"2026-08-01T02:57:33.566410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:33.573564Z","title":"Video-R1: Reinforcing video reasoning in MLLMs.NeurIPS, 38:99114–99137,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-09T06:34:14.297495Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:33.573564Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:477850837532f7bab7be2fe3362b41871a46d11fc828b85fa04becead69d828b","observation_id":"f517d32b-6f65-4f09-81b4-b8854a870cae","resolution":{"observed_at":"2026-08-01T02:57:33.573564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:33.577949Z","title":"Au- tomatic non-linear video editing transfer","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-09T06:34:14.297495Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:33.577949Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:6f9a0ef4440a0752482c84da6e1235b0be68230eb569523c832f3800d9c2aa93","observation_id":"1526b89c-f3bf-481d-a0f6-4b3f32a69e5b","resolution":{"observed_at":"2026-08-01T02:57:33.577949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:33.581992Z","title":"Video-MME: The first-ever comprehensive evaluation benchmark of multi- modal LLMs in video analysis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-09T06:34:14.297495Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:33.581992Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:d04b261fb37adf82c2af2bf5791d2b550ccb8efdafcca649bdef1d020c2dbaae","observation_id":"4612b575-b863-4be5-8268-5df9bfe7066b","resolution":{"observed_at":"2026-08-01T02:57:33.581992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:33.586663Z","title":"Training-free language-guided video summarization via multi-grained saliency scoring","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-09T06:34:14.297495Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:33.586663Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:bc47cbee2ec16fd5e84d578386da4833fc04ba6d4b6ba7f6afae0054706d91d1","observation_id":"1049e734-6252-40a7-b747-b7c66e8b30f5","resolution":{"observed_at":"2026-08-01T02:57:33.586663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:33.591243Z","title":"Supervised video summarization via multiple feature sets with parallel attention","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-09T06:34:14.297495Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:33.591243Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:c1f04b992da3769e3192351f85e7b5547bde602393b3d17c6ab7925164477e85","observation_id":"9aa6d92c-f5ab-46ce-84bf-d1d51241a196","resolution":{"observed_at":"2026-08-01T02:57:33.591243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15594","last_updated":"2025-10-19T10:32:43Z","snapshot_observed_at":"2026-08-02T10:23:50.881300Z","submitted_at":"2024-11-23T16:03:35Z","title":"A Survey on LLM-as-a-Judge","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15594","snapshot_observed_at":"2026-08-01T02:57:33.595868Z","title":"A survey on LLM-as-a- judge.arXiv preprint arXiv:2411.15594, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-09T06:34:14.297495Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:33.595868Z"},"links":{"cited_paper":"/paper/2411.15594","citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:ca3c0c16f93ac906b1fe8091b654679a3670a3513ec22577bd68a7794211e7b6","observation_id":"5a58f19a-82d1-447d-a574-17ed5d27a40b","resolution":{"observed_at":"2026-08-01T02:57:33.595868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:33.600907Z","title":"VTG-LLM: Integrating timestamp knowledge into video LLMs for enhanced video temporal grounding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-09T06:34:14.297495Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:33.600907Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:da5e596edbfdaf86160d5d3c5dca605d4c7ad7135318daa0e3a6b5ea5147f02c","observation_id":"c728aa61-d9b1-4197-b6a2-5da281883f28","resolution":{"observed_at":"2026-08-01T02:57:33.600907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:33.606418Z","title":"Creating summaries from user videos","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-09T06:34:14.297495Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:33.606418Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:b658114d499e91ed72fc6e62d9c321b6e1bdf2956063fe958563091ffb1d7c86","observation_id":"3ca9901d-096e-4061-ab4c-97a148843892","resolution":{"observed_at":"2026-08-01T02:57:33.606418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:33.611332Z","title":"Align and attend: Multimodal summarization with dual contrastive losses","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-09T06:34:14.297495Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:33.611332Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:06720f1084097ec845faa0fec263cb09a08c5a1d73b622429f1485a102258129","observation_id":"a7d90a2c-4405-41d9-aae1-0bf39a09d96b","resolution":{"observed_at":"2026-08-01T02:57:33.611332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:33.617191Z","title":"MovieNet: A holistic dataset for movie under- standing","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-09T06:34:14.297495Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:33.617191Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:063a42533c81dc905fc6fda50f6b60043aeb25dfa491ad7030b2701824445002","observation_id":"acfa2fc3-39d0-46a4-9ed5-1b8035c2a4de","resolution":{"observed_at":"2026-08-01T02:57:33.617191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:33.623434Z","title":"Joint video summarization and moment localization by cross-task sample transfer","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-09T06:34:14.297495Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:33.623434Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:9132409ec03110ed233924dcb504edb71721d143a492738e92fcab83b39e7c69","observation_id":"6fd57df8-6057-4080-ac17-65e9d06b8542","resolution":{"observed_at":"2026-08-01T02:57:33.623434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:33.633320Z","title":"Discriminative feature learning for unsu- pervised video summarization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-09T06:34:14.297495Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:33.633320Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:8c247bd6470e9446ed2d1feddc0c7e2a6698834616f4d5b0aefaa2400f1fcaff","observation_id":"a192e377-fd68-4f53-8236-3dcd1e8de382","resolution":{"observed_at":"2026-08-01T02:57:33.633320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:33.646692Z","title":"Dense-captioning events in videos","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-09T06:34:14.297495Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:33.646692Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:b8346d4d76e94f568b830d9c91fda30bcae725c8dec14940114e940db70e4c1f","observation_id":"e914b6eb-0492-4220-8877-28d176408329","resolution":{"observed_at":"2026-08-01T02:57:33.646692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:33.659453Z","title":"Computational video editing for dialogue-driven scenes.ACM Trans","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-09T06:34:14.297495Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:33.659453Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:edb6601c4e43032c0f5d93ecf68166da0d087a773c35fd68baa44177fff83661","observation_id":"2da01de5-bbbf-4d77-8beb-e4ccfb1c4176","resolution":{"observed_at":"2026-08-01T02:57:33.659453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:33.680677Z","title":"Video sum- marization with large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-09T06:34:14.297495Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:33.680677Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:9824aedf1769fdcb94b826e5a9b66adfbe5d270b621bfa7f460cc71df75b7a01","observation_id":"f3f5c708-8ebf-4238-8d97-484837367b00","resolution":{"observed_at":"2026-08-01T02:57:33.680677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:33.700419Z","title":"Detecting mo- ments and highlights in videos via natural language queries","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-09T06:34:14.297495Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:33.700419Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:0a3832c2ba50a9a53edfd2c62dfa3ce042660d79bdadda34eb22936c1c1aea5a","observation_id":"86900be1-3d86-456f-a173-501ca56e32a4","resolution":{"observed_at":"2026-08-01T02:57:33.700419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:33.721473Z","title":"Progressive video summarization via multimodal self- supervised learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-09T06:34:14.297495Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:33.721473Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:a1b06c154d154faee42b150c1b405cc3ba870f0e7599b545ca0f8319947ef6fa","observation_id":"b63513ae-f924-4abf-ad7b-743101a434e0","resolution":{"observed_at":"2026-08-01T02:57:33.721473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:33.747254Z","title":"Progressive video summarization via multimodal self- supervised learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-09T06:34:14.297495Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:33.747254Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:6bdb86ca1e315a5c701b0935f750b6cf6a240a9811bc026e5be9fadeee006fe0","observation_id":"062e7a7a-18d2-4467-adf9-01a0a304ad21","resolution":{"observed_at":"2026-08-01T02:57:33.747254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:33.771469Z","title":"VideoChat-R1: Enhancing spatio-temporal percep- tion via reinforcement fine-tuning.NeurIPS, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-09T06:34:14.297495Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:33.771469Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:2fd6d22d187ee744d7110fe7fcb94edf7781691fc7b0d8eaf51ecd190bb0ca5b","observation_id":"da640c86-dd3c-4611-b5c5-b1c815b40c3a","resolution":{"observed_at":"2026-08-01T02:57:33.771469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:33.793614Z","title":"VideoXum: cross- modal visual and textural summarization of videos.IEEE Trans","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-09T06:34:14.297495Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:33.793614Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:0644fc630648fe1ce52d451d443d29630b671fe1c2913ec9678cec9c9bf46bfc","observation_id":"41c3e89d-2252-4411-b6d1-10fcd170bf27","resolution":{"observed_at":"2026-08-01T02:57:33.793614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:33.819796Z","title":"Visual instruction tuning.NeurIPS, 36:34892–34916, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-09T06:34:14.297495Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:33.819796Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:7063815ca1d627b236b007b9cefc8dd5cb226db94477f8cf3f6b45b14c4673e9","observation_id":"b70bf6a0-9822-46b6-8405-91157efb81a6","resolution":{"observed_at":"2026-08-01T02:57:33.819796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:33.841722Z","title":"G-Eval: NLG evaluation using gpt-4 with better human alignment","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-09T06:34:14.297495Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:33.841722Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:d9d014ef0c7739e38633c22dcbe9443b6c84b999702a7fda160445dddf640bdd","observation_id":"4fcf045e-d7f8-4251-8ddc-1a187e0b7952","resolution":{"observed_at":"2026-08-01T02:57:33.841722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:33.910460Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-09T06:34:14.297495Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:33.910460Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:c90cd9a2c1c689e84cf8959a18158bd397d2541e83a7edfa6d9d4ceb1531d5f4","observation_id":"49c0c03c-75b9-41ff-81c8-1c126a6ae26b","resolution":{"observed_at":"2026-08-01T02:57:33.910460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:34.008992Z","title":"Chrono: A simple blueprint for representing time in MLLMs.arXiv preprint arXiv:2406.18113, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-09T06:34:14.297495Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:34.008992Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:1d85cebcb706a6a1a322c7b2a6a44b79691b98ec1aa1a031e7e2669f1876e4f8","observation_id":"1ebf3e82-6a7c-431d-8d72-8db30a0f133b","resolution":{"observed_at":"2026-08-01T02:57:34.008992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:34.127674Z","title":"CLIP-It! language-guided video summarization","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-09T06:34:14.297495Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:34.127674Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:4916923e5ad89f49264f765e2f43c4e96dd7d4712ddaaddb916027586739b7d3","observation_id":"ec5547e9-99dc-4c2c-b7f1-3d9f24c42fdf","resolution":{"observed_at":"2026-08-01T02:57:34.127674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:34.285272Z","title":"Rethinking the evaluation of video summaries","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-09T06:34:14.297495Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:34.285272Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:1eb776ac145e15cb8bde8cce55e7c66943fc83327639c6358a2eebe43474b0f3","observation_id":"b48724bc-2013-4ce5-afd3-1dd42a55a6ee","resolution":{"observed_at":"2026-08-01T02:57:34.285272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:34.407233Z","title":"Contrastive losses are natural criteria for unsu- pervised video summarization","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-09T06:34:14.297495Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:34.407233Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:0ad442ce8b7b359ea63d6bba8d28a81fcd54fa89a7f6bac5e2fbfaeab1368e98","observation_id":"f334b4cd-eb25-4f6f-bb75-206a797ed8ca","resolution":{"observed_at":"2026-08-01T02:57:34.407233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:34.538157Z","title":"Mea- sure Twice, Cut Once: A semantic-oriented approach to video temporal localization with video LLMs","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-09T06:34:14.297495Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:34.538157Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:f5050a6891b3605bc182434c0d51a3607fd788258e11a6a8618e170531824f71","observation_id":"6b51240d-382e-4790-b7b0-646b837f855a","resolution":{"observed_at":"2026-08-01T02:57:34.538157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:34.652076Z","title":"MovieCuts: A new dataset and benchmark for cut type recognition","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-09T06:34:14.297495Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:34.652076Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:c000d474c6664e90bf35e93d6bd4b7ec8ef868687ae83171c89b790b33b1b3b0","observation_id":"d5debe9c-38ca-407e-bc5a-c918a90f6f4f","resolution":{"observed_at":"2026-08-01T02:57:34.652076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:34.724308Z","title":"Generative timelines for instructed visual assembly","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-09T06:34:14.297495Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:34.724308Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:0e72b238d67a99ff685665ff74b00793d228b5b8332f49d00dba0eef48887f74","observation_id":"5922fd12-7f72-49b0-ae3d-b7d02d6b5cc7","resolution":{"observed_at":"2026-08-01T02:57:34.724308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:34.884059Z","title":"MMSum: A dataset for multimodal summarization and thumbnail gen- eration of videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-09T06:34:14.297495Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:34.884059Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:57fdf7248cbb227189e538c0856a85d5adb6358014aac9a4b29645d9144ad801","observation_id":"340a0024-cb23-46fc-ad60-2e35af0d907e","resolution":{"observed_at":"2026-08-01T02:57:34.884059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:34.950203Z","title":"TimeChat: A time-sensitive multimodal large language model for long video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-09T06:34:14.297495Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:34.950203Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:51689e6dcfb681d3f6a0224292d048e106e7583d215265e30d82bea9247d5aac","observation_id":"0449790b-45b0-41e3-9677-b1c772a3243a","resolution":{"observed_at":"2026-08-01T02:57:34.950203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:35.052912Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-09T06:34:14.297495Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:35.052912Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:d64e9fb4ed43c0ec91a08ae87388e8c234a4c46898e6bb2576b5104bba8006b4","observation_id":"41add252-88da-4500-82b0-0b2e80965a3d","resolution":{"observed_at":"2026-08-01T02:57:35.052912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:35.119099Z","title":"Judging the judges: A system- atic study of position bias in LLM-as-a-Judge","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-09T06:34:14.297495Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:35.119099Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:4838313024ae14b10e6e40ebd23059500f3a00627492f586c8093df379cdda08","observation_id":"71a2a1fc-0ad2-49c5-b9d6-3f60a8bfdb18","resolution":{"observed_at":"2026-08-01T02:57:35.119099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:35.224975Z","title":"Generic event boundary de- tection: A benchmark for event segmentation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-09T06:34:14.297495Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:35.224975Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:6860df764320fad7184a51ac2c3597fd3e11750f28c043d2696f3573c51956c6","observation_id":"05e84f1d-c50e-42e2-abff-77a382ff51e9","resolution":{"observed_at":"2026-08-01T02:57:35.224975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:35.325730Z","title":"CSTA: Cnn- based spatiotemporal attention for video summarization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-09T06:34:14.297495Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:35.325730Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:6b96c543962d08a169a6235aa866ce7cbcf5517f276b638cdd3b59e6b72e8154","observation_id":"129aa3b8-ae6f-44d0-b473-8fe1787e0a99","resolution":{"observed_at":"2026-08-01T02:57:35.325730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:35.330070Z","title":"Csta: Cnn- based spatiotemporal attention for video summarization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-09T06:34:14.297495Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:35.330070Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:8f9d015215933a80b67cbfbe2dbb9180521c732d582156d548d51a69433c4635","observation_id":"79796f32-ba54-46e4-9a8b-1e47c22205b8","resolution":{"observed_at":"2026-08-01T02:57:35.330070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:35.334102Z","title":"TVSum: Summarizing web videos using titles","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-09T06:34:14.297495Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:35.334102Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:a9a77fa20e41f5bca9eb3547b2a505ef34ee4db23578c1544b72911398587329","observation_id":"e7cc1cd1-8c6a-4491-aa08-5d0f4bdeeb89","resolution":{"observed_at":"2026-08-01T02:57:35.334102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:35.338185Z","title":"Language-guided self-supervised video summarization using text semantic matching considering the diversity of the video","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-09T06:34:14.297495Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:35.338185Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:a1c6138c3a1ea168aaf8d3f42e6ad00a3e4ae5aeb052830d691e17c00f4d5db8","observation_id":"4094f2cd-4abe-4731-b9d8-8afde550e466","resolution":{"observed_at":"2026-08-01T02:57:35.338185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:35.342337Z","title":"Gemini: A family of highly capable multimodal models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-09T06:34:14.297495Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:35.342337Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:71bb79d50dede82bc527892e2be9f37816b8dea6d24d9e568ceebedd0be0d2f8","observation_id":"04c50e48-d688-4b89-b878-b6073eca71b3","resolution":{"observed_at":"2026-08-01T02:57:35.342337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:35.347096Z","title":"QuickCut: An interactive tool for editing narrated video","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-09T06:34:14.297495Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:35.347096Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:3f94b257719c9c60c382a42409298303694b7b32a369d08dd9ae03e1b09ab8a5","observation_id":"9aeab3b7-f291-467e-9636-b198e9faf1b7","resolution":{"observed_at":"2026-08-01T02:57:35.347096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:35.351267Z","title":"Query Twice: Dual mixture attention meta learning for video summarization","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-09T06:34:14.297495Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:35.351267Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:486b4be90d9393422cb11ac344d9c67135a4bfd0ca9dd3b6945d331cc1abee0b","observation_id":"91f8cce7-7d4a-472f-a3f5-f575e5e5fff6","resolution":{"observed_at":"2026-08-01T02:57:35.351267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:35.356284Z","title":"Write-A-Video: Computational video montage from themed text.ACM Trans","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-09T06:34:14.297495Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:35.356284Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:1a1d21a21d6e43c6bee80e63f12011d9e6e75fb43c990ff5a66a09e511fcacee","observation_id":"3fb8ca8c-cf18-4fcf-839d-204a33781b98","resolution":{"observed_at":"2026-08-01T02:57:35.356284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18265","last_updated":"2025-08-27T14:39:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-25T17:58:17Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18265","snapshot_observed_at":"2026-08-01T02:57:35.360849Z","title":"InternVL3","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-09T06:34:14.297495Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:35.360849Z"},"links":{"cited_paper":"/paper/2508.18265","citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:e5765b18031bba4938fc50ebe85e4aead5a08d2bff721fb739db2ab6e7dc5f75","observation_id":"c2aa9254-6cd7-4399-80e8-efc9746a1a6f","resolution":{"observed_at":"2026-08-01T02:57:35.360849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:35.364941Z","title":"Time-R1: Post-training large vision language model for temporal video grounding.NeurIPS, 38:83330– 83364, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-09T06:34:14.297495Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:35.364941Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:8e9095bf0a2394689fa1683db186cd65e56aa0382c1cdb13a568fd07680a4fae","observation_id":"a1397759-3ae4-4575-a7bc-fe20cf4c8182","resolution":{"observed_at":"2026-08-01T02:57:35.364941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:35.368984Z","title":"LongVideoBench: a benchmark for long-context interleaved video-language understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-09T06:34:14.297495Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:35.368984Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:a4484740f09fa2c6e2284533241dea81767e393d3266b37489beb7f0d7df4499","observation_id":"a07e9033-6de5-465c-8aff-cee5b8e24bde","resolution":{"observed_at":"2026-08-01T02:57:35.368984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:35.372928Z","title":"Transcript to Video: Efficient clip sequencing from texts","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-09T06:34:14.297495Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:35.372928Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:15d03324fac12165b3d7f0ff32903e147d5279c3bedb80bf1c598eceff58a512","observation_id":"2a774dfc-600c-434f-899c-2654861e571b","resolution":{"observed_at":"2026-08-01T02:57:35.372928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:35.376928Z","title":"Vid2seq: Large-scale pretraining of a vi- sual language model for dense video captioning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-09T06:34:14.297495Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:35.376928Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:4d6d5df3c5018d11aa51538c0391e839e588f2e7bc8e7be9ce35da0e4f066bcb","observation_id":"000544e0-d069-4b55-a5de-b07b9c020bcb","resolution":{"observed_at":"2026-08-01T02:57:35.376928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:35.380934Z","title":"TimeLens: Rethinking video temporal grounding with multimodal LLMs","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-09T06:34:14.297495Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:35.380934Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:fd062a446b940412497dbe6e7f248bfeeb1755ac212bd56b262b8ed5743b3e9c","observation_id":"d2dd359e-a90e-45f9-bfb7-3443b4f3b7f7","resolution":{"observed_at":"2026-08-01T02:57:35.380934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01361","last_updated":"2023-11-02T16:11:09Z","snapshot_observed_at":"2026-08-09T06:34:06.783851Z","submitted_at":"2023-11-02T16:11:09Z","title":"GPT-4V(ision) as a Generalist Evaluator for Vision-Language Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01361","snapshot_observed_at":"2026-08-01T02:57:35.385182Z","title":"Gpt-4v(ision) as a generalist evalu- ator for vision-language tasks.CoRR, abs/2311.01361, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-09T06:34:14.297495Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:35.385182Z"},"links":{"cited_paper":"/paper/2311.01361","citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:5f0deaeaf18c8ca49312f9e232464f9a7e05b1117f2416da6c9aed06fe90b6d1","observation_id":"355f80e7-92a6-489f-bca3-d1ee81bf4c9d","resolution":{"observed_at":"2026-08-01T02:57:35.385182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:35.389309Z","title":"Re- constructive sequence-graph network for video summariza- tion.IEEE Trans","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-09T06:34:14.297495Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:35.389309Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:3eaebd0a5357c48a974fe0f46a88dcf00f317e338eda69e680ca2c397a2ede87","observation_id":"6d41d762-6f0e-471f-bb80-5be68a0be5f8","resolution":{"observed_at":"2026-08-01T02:57:35.389309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:35.393918Z","title":"Xing, Hao Zhang, Joseph E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-09T06:34:14.297495Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:35.393918Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:aaf15f21273d3515e1ba7b995b9eef1969217aab8add44018deaf13a0274bf58","observation_id":"1c464df8-65b5-4080-a5f1-2c97c1e014db","resolution":{"observed_at":"2026-08-01T02:57:35.393918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:35.397619Z","title":"Deep semantic and attentive network for unsupervised video summarization.ACM Trans","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-09T06:34:14.297495Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:35.397619Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:8552e99534229a11cc26410f4e9ffdf6a9d3e2fec6c598524f39c89cec887d77","observation_id":"38eaef64-af30-48cd-ab3a-81913c92698b","resolution":{"observed_at":"2026-08-01T02:57:35.397619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:35.401484Z","title":"MLVU: Benchmarking multi-task long video understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-09T06:34:14.297495Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:35.401484Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:8eb3b8d83ba21a7e384c8be17c2120c8bf80309fa1f19d6b44fb6b2ec1da790f","observation_id":"4d47acc8-b7f2-4d90-8e10-8ea365fe22cc","resolution":{"observed_at":"2026-08-01T02:57:35.401484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:35.405324Z","title":"Deep reinforce- ment learning for unsupervised video summarization with diversity-representativeness reward","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-09T06:34:14.297495Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:35.405324Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:36e4ea2636014447d93e934fcc283745d8bdfd104d60c28abd721894fae8727a","observation_id":"975ca5e2-7685-46d7-9015-5f25ee07038b","resolution":{"observed_at":"2026-08-01T02:57:35.405324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:35.408991Z","title":"Edits” counts edits with at least one temporal reversal; “Cuts","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-09T06:34:14.297495Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:35.408991Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:e59c40fc992681db138c4e468c5d1be4a4949265a587a8f6a66e33a824830610","observation_id":"a73ca798-edcd-4bac-baef-7dc7cf444de0","resolution":{"observed_at":"2026-08-01T02:57:35.408991Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:35.413753Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-09T06:34:14.297495Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:35.413753Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:5203396d7e4248551b9e9226f799e4505174cfb6603cdc23495f8470ef552e04","observation_id":"ec6c8238-0f87-4c20-b4c3-11eabcdd9401","resolution":{"observed_at":"2026-08-01T02:57:35.413753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:35.417802Z","title":"01:30:50","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-09T06:34:14.297495Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:35.417802Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:0ccecc348f2eaab934dc28370d2361efb05f79b90900bf39307ba82c2a83164d","observation_id":"5f239f22-9ad7-4f3d-83af-9b65558bdbf3","resolution":{"observed_at":"2026-08-01T02:57:35.417802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T06:34:14.297495Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing"},"reference_resolution":{"displayed":66,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":65,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":66},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 66 of 66 outbound references and 0 inbound Pith citation observations for arXiv:2607.25300."}