{"as_of":"2026-08-20T01:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c0cbc46b50c83918c10b400f73241678be5a3d932b9e4aa936ad4c5dd2e9e9cd","coverage":[{"denominator":53,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T15:14:36.146697Z","state":"measured"},{"denominator":53,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":53,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.01113/citation-record","integrity":"/paper/2608.01113/integrity","json":"/paper/2608.01113/citation-record.json","paper":"/paper/2608.01113"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:14:35.975532Z","title":"Scaling instruction-based video editing with a high-quality synthetic dataset.arXiv preprint arXiv:2510.15742, 2025","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-18T02:44:43.925012Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:35.975532Z"},"links":{"citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:1da335b0478f7706d26b181fb067c739f75dd203b281845f7acbcc1cb90eb6dd","observation_id":"657b10a4-a0bb-42b0-8f78-5823b143d706","resolution":{"observed_at":"2026-08-15T15:14:35.975532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:14:36.983653Z","title":"In- structpix2pix: Learning to follow image editing instructions","venue":null,"work_id":"93ba9512-0879-4cf5-bad1-ba3eeaee5b0b","year":2023},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-18T02:44:43.925012Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:35.979280Z"},"links":{"citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:2a52174b5352c31d49b0ba9b38d57169a76f33527abda1ab379c400b5b843422","observation_id":"1856cfa5-fccf-4d0a-825a-d496f3c5a391","resolution":{"observed_at":"2026-08-15T15:14:36.987406Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20156","last_updated":"2025-06-03T15:15:31Z","snapshot_observed_at":"2026-08-19T03:06:29.083756Z","submitted_at":"2025-05-26T15:57:27Z","title":"HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20156","snapshot_observed_at":"2026-08-15T15:14:35.982238Z","title":"Hunyuanvideo-avatar: High-fidelity audio-driven hu- man animation for multiple characters.arXiv preprint arXiv:2505.20156, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-18T02:44:43.925012Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:35.982238Z"},"links":{"cited_paper":"/paper/2505.20156","citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:dbc30262ebbe6f41be239eddb6351ed8748ef4e0df73495ade27909ed4087a43","observation_id":"408e0bc6-58b0-4827-b1be-96613547c5e7","resolution":{"observed_at":"2026-08-15T15:14:35.982238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.00213","last_updated":"2023-12-01T11:41:34Z","snapshot_observed_at":"2026-08-16T14:47:01.867872Z","submitted_at":"2023-11-01T01:20:12Z","title":"Consistent Video-to-Video Transfer Using Synthetic Dataset","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.00213","snapshot_observed_at":"2026-08-15T15:14:35.986744Z","title":"Consistent video- to-video transfer using synthetic dataset.arXiv preprint arXiv:2311.00213, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-18T02:44:43.925012Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:35.986744Z"},"links":{"cited_paper":"/paper/2311.00213","citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:589971785e62fad5f7f3295ddcb7546e3cf74a9d01020d02145a991f44eb8bea","observation_id":"18f9807a-5d72-4114-a3c3-70770a3eedaf","resolution":{"observed_at":"2026-08-15T15:14:35.986744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:14:36.972707Z","title":"Rass: Improving denoising diffusion sam- plers with reinforced active sampling scheduler","venue":null,"work_id":"c8dc66ad-20d0-4973-8646-ede5e44c52ab","year":2025},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-18T02:44:43.925012Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:35.990411Z"},"links":{"citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:2528356b88e89c2d939bba1be326d7599724f4df1bf7c91ee0202d8262984026","observation_id":"b75ff8c6-70e0-4f0d-9f67-4e751ab27f24","resolution":{"observed_at":"2026-08-15T15:14:36.976630Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:14:36.961998Z","title":"Why compress what you can generate? when gpt-4o generation ushers in image compression fields","venue":null,"work_id":"bdd74ad8-aa41-418f-afc2-24acaed121bf","year":2025},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-18T02:44:43.925012Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:35.994108Z"},"links":{"citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:16f5e633fc6364965f378224f2078a1f2342d6fe4390bddebaf33acb95905725","observation_id":"db7eded1-6605-4037-9244-54308783348a","resolution":{"observed_at":"2026-08-15T15:14:36.966130Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04007","last_updated":"2024-05-07T04:55:47Z","snapshot_observed_at":"2026-08-16T13:54:49.928296Z","submitted_at":"2024-05-07T04:55:47Z","title":"SEED-Data-Edit Technical Report: A Hybrid Dataset for Instructional Image Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04007","snapshot_observed_at":"2026-08-15T15:14:35.997634Z","title":"Seed-data-edit technical report: A hybrid dataset for in- structional image editing.arXiv preprint arXiv:2405.04007,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-18T02:44:43.925012Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:35.997634Z"},"links":{"cited_paper":"/paper/2405.04007","citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:867a1ec579271eff36c7695210e4d98afa5b01ffa6fc62662821058579bd6a51","observation_id":"c7e8d454-32fa-46ec-9c31-56a81201e8ce","resolution":{"observed_at":"2026-08-15T15:14:35.997634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:14:36.949430Z","title":"Clipscore: A reference-free evaluation met- ric for image captioning","venue":null,"work_id":"7db1e440-dc82-461d-afbd-e0b6403b95d6","year":2021},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-18T02:44:43.925012Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:36.001663Z"},"links":{"citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:95ad2aeef6dea5e9f20fd8b10e2722aa795784eb8f8f9a5f30945bd09baf34e9","observation_id":"eb512c56-8fb9-4959-b4af-05742885a328","resolution":{"observed_at":"2026-08-15T15:14:36.953342Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02303","last_updated":"2022-10-05T14:41:38Z","snapshot_observed_at":"2026-08-18T00:41:06.039123Z","submitted_at":"2022-10-05T14:41:38Z","title":"Imagen Video: High Definition Video Generation with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02303","snapshot_observed_at":"2026-08-15T15:14:36.005696Z","title":"Imagen video: High definition video generation with diffusion mod- els.arXiv preprint arXiv:2210.02303, 2022","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-18T02:44:43.925012Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:36.005696Z"},"links":{"cited_paper":"/paper/2210.02303","citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:22d3a739a2c68b29a1d5107f17433e140899c1b03c72a050cd8e4c8b28aebd8e","observation_id":"48d98d9a-6c21-44d9-86c0-995bf19d8587","resolution":{"observed_at":"2026-08-15T15:14:36.005696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:14:36.009394Z","title":"Video dif- fusion models.Advances in neural information processing systems, 35:8633–8646, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-18T02:44:43.925012Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:36.009394Z"},"links":{"citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:3f69eba948a9b915489b8b3074a61c74e2c5ae249f5589a20ac3cafae58e7264","observation_id":"f8cba0fc-3fa7-4c3d-93bf-6345952e11fa","resolution":{"observed_at":"2026-08-15T15:14:36.009394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.15868","last_updated":"2022-05-29T19:02:15Z","snapshot_observed_at":"2026-08-12T19:21:15.526321Z","submitted_at":"2022-05-29T19:02:15Z","title":"CogVideo: Large-scale Pretraining for Text-to-Video Generation via Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.15868","snapshot_observed_at":"2026-08-15T15:14:36.012707Z","title":"Cogvideo: Large-scale pretraining for text-to-video generation via transformers.arXiv preprint arXiv:2205.15868, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-18T02:44:43.925012Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:36.012707Z"},"links":{"cited_paper":"/paper/2205.15868","citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:381cf7edfd6077e21f3a8f82b9cfa2c88e92457e9a48453a92328f1b91323634","observation_id":"25ef2ba6-7d42-469c-831d-7876d2fdfc32","resolution":{"observed_at":"2026-08-15T15:14:36.012707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:14:36.930476Z","title":"Animate anyone: Consistent and controllable image- to-video synthesis for character animation","venue":null,"work_id":"5d189417-732b-462c-a9c0-f890941a50f3","year":2024},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-18T02:44:43.925012Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:36.016317Z"},"links":{"citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:3af42cf671c33f38afe496945acfc634a423bddcf40f0533a7a0e7e12173cddb","observation_id":"c1b5049f-49ca-4103-864e-8cf6af35b0b1","resolution":{"observed_at":"2026-08-15T15:14:36.934410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04512","last_updated":"2025-05-08T08:29:00Z","snapshot_observed_at":"2026-08-18T10:31:16.201312Z","submitted_at":"2025-05-07T15:33:18Z","title":"HunyuanCustom: A Multimodal-Driven Architecture for Customized Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.04512","snapshot_observed_at":"2026-08-15T15:14:36.019799Z","title":"Hunyuancustom: A multimodal-driven architecture for customized video gener- ation.arXiv preprint arXiv:2505.04512, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-18T02:44:43.925012Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:36.019799Z"},"links":{"cited_paper":"/paper/2505.04512","citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:3fb3cf4217a80776dbcc973e4537852f5a821639fbd37ceaa39094cff1b2c35c","observation_id":"49884281-ad6b-42ba-a8a2-3f56dd32d611","resolution":{"observed_at":"2026-08-15T15:14:36.019799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:14:36.023233Z","title":"Vbench: Comprehensive bench- mark suite for video generative models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-18T02:44:43.925012Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:36.023233Z"},"links":{"citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:f665e24cf8a18254ac3b8dda67e4c5cce38e0afc80a5615a414d23db17b76510","observation_id":"7cde7cc7-1d24-4b9c-aac6-7a87e4f26e5f","resolution":{"observed_at":"2026-08-15T15:14:36.023233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:14:36.026401Z","title":"Anyedit: Edit any knowledge encoded in language models.arXiv preprint arXiv:2502.05628, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-18T02:44:43.925012Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:36.026401Z"},"links":{"citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:40a3f7731c1f013141650c3a92e2f9d1c95ad6b3214fbf62571f3d56262ba60e","observation_id":"4dd9d16c-bfc1-46db-894b-b7216878607e","resolution":{"observed_at":"2026-08-15T15:14:36.026401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:14:36.029525Z","title":"Vace: All-in-one video creation and editing","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-18T02:44:43.925012Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:36.029525Z"},"links":{"citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:83959f668b89521eb03123202a09b9f43772755c947efaa021a8d17f61ace5cc","observation_id":"c4b2e429-8f5b-4a6f-b212-61d7d3bcaf88","resolution":{"observed_at":"2026-08-15T15:14:36.029525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:14:36.032244Z","title":"Text2video-zero: Text- to-image diffusion models are zero-shot video generators","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-18T02:44:43.925012Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:36.032244Z"},"links":{"citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:3ad908c7d05bb364bb37a86d31444f11ef32e2b672c0e654b3190474dd08fece","observation_id":"e2c88d85-f4ca-499b-becf-0f87bb95e566","resolution":{"observed_at":"2026-08-15T15:14:36.032244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-17T07:44:10.213698Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-15T15:14:36.035188Z","title":"Hunyuanvideo: A systematic framework for large video generative models.arXiv preprint arXiv:2412.03603, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-18T02:44:43.925012Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:36.035188Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:35878da6546567688b482d48ccc90308725f819d29e8c6d5c9b7d0afa701ed3a","observation_id":"0242e969-b0d2-454e-8224-5ea3437cee65","resolution":{"observed_at":"2026-08-15T15:14:36.035188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14468","last_updated":"2024-11-03T21:16:54Z","snapshot_observed_at":"2026-08-16T14:07:39.359261Z","submitted_at":"2024-03-21T15:15:00Z","title":"AnyV2V: A Tuning-Free Framework For Any Video-to-Video Editing Tasks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14468","snapshot_observed_at":"2026-08-15T15:14:36.039061Z","title":"Anyv2v: A tuning-free framework for any video-to- video editing tasks.arXiv preprint arXiv:2403.14468, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-18T02:44:43.925012Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:36.039061Z"},"links":{"cited_paper":"/paper/2403.14468","citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:348515fe142b62c914a1f2cc5a0e6a17a15080ea2b2624e9b9871c55fe804d50","observation_id":"05eb5eef-d43d-4443-912a-ad663df13610","resolution":{"observed_at":"2026-08-15T15:14:36.039061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01801","last_updated":"2025-06-02T15:42:06Z","snapshot_observed_at":"2026-08-17T06:53:13.203522Z","submitted_at":"2025-06-02T15:42:06Z","title":"OmniV2V: Versatile Video Generation and Editing via Dynamic Content Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01801","snapshot_observed_at":"2026-08-15T15:14:36.042340Z","title":"Omniv2v: Versatile video generation and edit- ing via dynamic content manipulation.arXiv preprint arXiv:2506.01801, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-18T02:44:43.925012Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:36.042340Z"},"links":{"cited_paper":"/paper/2506.01801","citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:727f2d7aebb7b29bcd6d3d04db0035d0c5c07d2908751427956ee13759d0f069","observation_id":"e3f22532-7f1b-41d9-85ae-d90033f338a7","resolution":{"observed_at":"2026-08-15T15:14:36.042340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19650","last_updated":"2024-09-29T10:46:19Z","snapshot_observed_at":"2026-08-17T13:40:44.437556Z","submitted_at":"2024-09-29T10:46:19Z","title":"Grounding 3D Scene Affordance From Egocentric Interactions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19650","snapshot_observed_at":"2026-08-15T15:14:36.046347Z","title":"Grounding 3d scene affordance from egocentric interactions.arXiv preprint arXiv:2409.19650, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-18T02:44:43.925012Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:36.046347Z"},"links":{"cited_paper":"/paper/2409.19650","citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:cded11b88de5e9f83e1d568c3f254f9a482410a65b6e1ed0ea7a82917a49712a","observation_id":"4c7772c1-8450-4621-a2fe-7362429c370a","resolution":{"observed_at":"2026-08-15T15:14:36.046347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:14:36.900425Z","title":"Stablev2v: Stabilizing shape consistency in video-to- video editing.IEEE Transactions on Circuits and Systems for Video Technology, 2025","venue":null,"work_id":"4b1d9150-1df1-4779-b1d8-8ce85f75350a","year":2025},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-18T02:44:43.925012Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:36.049901Z"},"links":{"citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:b0c1332a0f3523e4605bd7c73a47de6b1496afe03604917c085c74a5c88bb450","observation_id":"b1fa8719-768e-4bd2-bd97-7155ad412c6f","resolution":{"observed_at":"2026-08-15T15:14:36.904108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:14:36.890194Z","title":"The health- wealth gradient in labor markets: Integrating health, in- surance, and social metrics to predict employment density","venue":null,"work_id":"af4e57a1-4faf-42b2-afb0-593ff7bdaddb","year":2026},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-18T02:44:43.925012Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:36.052062Z"},"links":{"citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:2316fee01cc3dc68b356aa891db48876529c19aa39beeca87f222ced780abe0c","observation_id":"409ef355-6b9c-41e2-945a-6a7dd9d41699","resolution":{"observed_at":"2026-08-15T15:14:36.893023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:14:36.054760Z","title":"Video-p2p: Video editing with cross-attention control","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-18T02:44:43.925012Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:36.054760Z"},"links":{"citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:3ce45cef36bf7334df6eef9a7ae3837b244a2ac85fc9ce127183909c6d7df686","observation_id":"4f40e9e3-6641-4c18-a16c-9f04c1aa84a9","resolution":{"observed_at":"2026-08-15T15:14:36.054760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:14:36.057103Z","title":"Follow your pose: Pose- guided text-to-video generation using pose-free videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-18T02:44:43.925012Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:36.057103Z"},"links":{"citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:175ddc86280c7bd7b8f1414dbafd01a3fd8a320405ab597ec38e0051084e22a1","observation_id":"34839ddd-5a94-46ac-b8ce-f8a987f2cca6","resolution":{"observed_at":"2026-08-15T15:14:36.057103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:14:36.863675Z","title":"Magic- stick: Controllable video editing via control handle transfor- mations","venue":null,"work_id":"7b132ae1-132a-452a-9b54-e5b8bfffd3df","year":null},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-18T02:44:43.925012Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:36.059802Z"},"links":{"citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:0987f8fb36b10062191bd94becfe19a89f4853f48af5ee51aa49b7f62d9c910f","observation_id":"5be0a624-c720-4b35-ab97-43354a0f784d","resolution":{"observed_at":"2026-08-15T15:14:36.868611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:14:36.062312Z","title":"In- structx: Towards unified visual editing with mllm guidance","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-18T02:44:43.925012Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:36.062312Z"},"links":{"citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:e8c3d5cf8b0bfbce91a49d45a666785818256ac119057fbfdcebd077f6a5dade","observation_id":"6d48c170-3a29-4bf3-98e0-67d67d71e691","resolution":{"observed_at":"2026-08-15T15:14:36.062312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:14:36.851251Z","title":"Occluded video instance segmentation: A bench- mark.International Journal of Computer Vision, 130(8): 2022–2039, 2022","venue":null,"work_id":"aac95df6-c78e-4874-8d4a-b77edcffc530","year":2022},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-18T02:44:43.925012Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:36.064649Z"},"links":{"citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:fb2cf933c9963e307405dc33897eda69d29a412967135346ba57627b0310150c","observation_id":"d2585ad4-dec7-4090-9764-6c2391d8a21d","resolution":{"observed_at":"2026-08-15T15:14:36.855427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:14:36.840717Z","title":"Instructvid2vid: Controllable video editing with natural language instructions","venue":null,"work_id":"a4394b52-4c80-4258-a1a1-3a3ff22201ba","year":2024},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-18T02:44:43.925012Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:36.067106Z"},"links":{"citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:97dfbf701c45a63c07eff25ebac070d23d684feccd2fdb3944655f86277122e7","observation_id":"98cde1d6-e308-4324-ab13-0f0a5d78d10a","resolution":{"observed_at":"2026-08-15T15:14:36.843912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:14:36.829213Z","title":"Urvos: Unified referring video object segmentation network with a large-scale benchmark","venue":null,"work_id":"c3d4e7dd-4398-4dd3-aa9b-99b8b5923576","year":2020},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-18T02:44:43.925012Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:36.069273Z"},"links":{"citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:94454f285ebfdf3c5f3ad4b9727d896a791de2080ca9a631606dea3ffcb14146","observation_id":"64bf5aa5-8938-4b18-8474-807bb8e824c3","resolution":{"observed_at":"2026-08-15T15:14:36.832657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14792","last_updated":"2022-09-29T13:59:46Z","snapshot_observed_at":"2026-07-06T13:57:47.051387Z","submitted_at":"2022-09-29T13:59:46Z","title":"Make-A-Video: Text-to-Video Generation without Text-Video Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14792","snapshot_observed_at":"2026-08-15T15:14:36.071477Z","title":"Make-a-video: Text-to-video generation without text-video data.arXiv preprint arXiv:2209.14792,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-18T02:44:43.925012Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:36.071477Z"},"links":{"cited_paper":"/paper/2209.14792","citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:04ec2f27d9d517c8c1a257878c0bc74fe8311a1acd7b76b879f9e2b7e7dec354","observation_id":"2141106f-c39d-43ae-bfa7-3cc3fee87fb2","resolution":{"observed_at":"2026-08-15T15:14:36.071477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:14:36.818435Z","title":"Stylegan-v: A continuous video generator with the price, image quality and perks of stylegan2","venue":null,"work_id":"3fd2f691-1d23-4c0b-b6a1-cefc983faf01","year":2022},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-18T02:44:43.925012Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:36.075387Z"},"links":{"citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:7a69f07303a07549d8bb7abb7573765711c3cd5594fc70103f2e1ee6540d39c4","observation_id":"3fcd91b3-7f33-49e9-8c2f-baff1f40219b","resolution":{"observed_at":"2026-08-15T15:14:36.821389Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:14:36.078800Z","title":"Omni-video: Democratizing uni- fied video understanding and generation.arXiv preprint arXiv:2507.06119, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-18T02:44:43.925012Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:36.078800Z"},"links":{"citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:4c406515402aea9bd61839b6c274e246930111fa164276f865b6075290b17ea3","observation_id":"83fff1b4-c3a0-4f43-bf40-4a6491434b31","resolution":{"observed_at":"2026-08-15T15:14:36.078800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:14:36.808125Z","title":"Lucy edit: Open-weight text-guided video editing, 2025","venue":null,"work_id":"e0554366-93d0-4e41-a368-176cd7015cce","year":2025},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-18T02:44:43.925012Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:36.081791Z"},"links":{"citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:66880bdbff66df011d2e48d170aef3adbaafa97f4238c8ba75bc55270575d6aa","observation_id":"af04fc58-2e23-4c2a-bbe7-cc285382811b","resolution":{"observed_at":"2026-08-15T15:14:36.811263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-15T15:14:36.085011Z","title":"Gemini: a family of highly capable multimodal models.arXiv preprint arXiv:2312.11805, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-18T02:44:43.925012Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:36.085011Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:23b5335f0c55ec79888ba3fa5d0db3dfa7edde55f53f7fd90b2f330107b992d5","observation_id":"d0dc72c7-8972-4b1e-bc7e-45e9454f15ff","resolution":{"observed_at":"2026-08-15T15:14:36.085011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:14:36.796958Z","title":"Fvd: A new metric for video generation","venue":null,"work_id":"05fc3e45-214b-49bf-9824-553110196e5f","year":2019},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-18T02:44:43.925012Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:36.088655Z"},"links":{"citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:116f990d6ab23e50a60310b806526b4edb8c0febf9bc983327b1f4a889b15d59","observation_id":"57023dca-7e67-4dd7-8704-606aa4574292","resolution":{"observed_at":"2026-08-15T15:14:36.800032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02399","last_updated":"2022-10-05T17:18:28Z","snapshot_observed_at":"2026-08-15T13:11:17.068630Z","submitted_at":"2022-10-05T17:18:28Z","title":"Phenaki: Variable Length Video Generation From Open Domain Textual Description","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02399","snapshot_observed_at":"2026-08-15T15:14:36.091525Z","title":"Phenaki: Variable length video generation from open domain textual description.arXiv preprint arXiv:2210.02399, 2022","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-18T02:44:43.925012Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:36.091525Z"},"links":{"cited_paper":"/paper/2210.02399","citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:73a2ac1c2d3315f1699c81f947fddcea8d065b914783e78302be7d227d36d0ce","observation_id":"9ab29126-2f77-4800-ae0e-3ff4fbd845f6","resolution":{"observed_at":"2026-08-15T15:14:36.091525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06571","last_updated":"2023-08-12T13:53:10Z","snapshot_observed_at":"2026-08-14T13:59:50.878772Z","submitted_at":"2023-08-12T13:53:10Z","title":"ModelScope Text-to-Video Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06571","snapshot_observed_at":"2026-08-15T15:14:36.096079Z","title":"Modelscope text-to-video technical report.arXiv preprint arXiv:2308.06571, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-18T02:44:43.925012Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:36.096079Z"},"links":{"cited_paper":"/paper/2308.06571","citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:43bf09b08e8c630f680df98a0e0854d6a7c9d1d7159e6df0654c272b0ce381b9","observation_id":"3cb4d851-d6ff-425f-9239-27bf6f9efad8","resolution":{"observed_at":"2026-08-15T15:14:36.096079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:14:36.784802Z","title":"Koala-36m: A large-scale video dataset improving consistency between fine-grained conditions and video content","venue":null,"work_id":"3318bb09-f9ee-4fbf-a339-c413bfd95c10","year":2025},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-18T02:44:43.925012Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:36.099979Z"},"links":{"citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:e613f62357d1e7230e42a20173080a5541ddaff6897217a7d28b6e5992c5c90a","observation_id":"e663e69f-bf22-4cbb-9f2b-755e9db47ae8","resolution":{"observed_at":"2026-08-15T15:14:36.788680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:14:36.774108Z","title":"Tiv-diffusion: Towards object-centric movement for text-driven image to video gen- eration","venue":null,"work_id":"1b72604b-6d36-41dc-9b5c-383d77b440cf","year":2025},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-18T02:44:43.925012Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:36.103092Z"},"links":{"citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:d09d4591bfb719765cce45ac5e0b7198ecfd76463f30e8530ade915a05eb8af7","observation_id":"8fb1b249-ffac-4e93-a955-c98c5a7a2aa0","resolution":{"observed_at":"2026-08-15T15:14:36.778051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:14:36.762271Z","title":"Re-attentional con- trollable video diffusion editing","venue":null,"work_id":"b216fd1d-e5a5-4c24-aed0-743d46ce0385","year":2025},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-18T02:44:43.925012Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:36.106568Z"},"links":{"citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:f23577c2ba7c061fd570a72dd410b001211132c8f14ac46b255b0be111d182d8","observation_id":"f013a9ff-17b8-40ca-9547-f6c71f7c7fc6","resolution":{"observed_at":"2026-08-15T15:14:36.765446Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:14:36.751959Z","title":"Training-free controllable text-guided video editing.IEEE Transactions on Circuits and Systems for Video Technology, 2026","venue":null,"work_id":"113e5ca0-1bf3-4a1e-8ed1-cfd994622bd8","year":2026},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-18T02:44:43.925012Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:36.109921Z"},"links":{"citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:2d7f72a8c88a4f6e74987b3865a36a1a8ac88c234fde5d304718d1de9f283308","observation_id":"43379ae1-bdc5-4091-8111-ffe361a8a947","resolution":{"observed_at":"2026-08-15T15:14:36.755803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:14:36.741427Z","title":"Phrasecut: Language-based image segmen- tation in the wild","venue":null,"work_id":"be68f9ed-7695-4e46-abbd-84057b1d28bd","year":2020},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-18T02:44:43.925012Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:36.112795Z"},"links":{"citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:61a4a2089202cd49134276ca4b8631534edbc055fbab0719a68b73250135b0b9","observation_id":"d7a7aec6-83e1-4638-adb3-63faecad4f77","resolution":{"observed_at":"2026-08-15T15:14:36.745577Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:14:36.729388Z","title":"Tune-a-video: One-shot tuning of image diffusion models for text-to-video generation","venue":null,"work_id":"e05d87c1-4f28-4aff-a143-84393bb74c16","year":2023},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-18T02:44:43.925012Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:36.115970Z"},"links":{"citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:38d092681b5b74a72ffef2e7040fadbc19123b0f58e52355cc84a8b590d42df0","observation_id":"c685c6db-e0dd-4fca-b8ee-7b27984456af","resolution":{"observed_at":"2026-08-15T15:14:36.733642Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:14:36.717489Z","title":"Insvie-1m: Effective instruction-based video editing with elaborate dataset construction","venue":null,"work_id":"8ce2a9e9-bb5a-48d5-a7a9-33704a861172","year":2025},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-18T02:44:43.925012Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:36.119760Z"},"links":{"citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:caf7ac1c9fda33f8a7e1a59f91b599ba7069bbd24c0147b234b9b07f6c751ead","observation_id":"2f70e7ea-a7e9-4628-b819-5d9dc8fb09d1","resolution":{"observed_at":"2026-08-15T15:14:36.721670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:14:36.122798Z","title":"Veg- gie: Instructional editing and reasoning video concepts with grounded generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-18T02:44:43.925012Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:36.122798Z"},"links":{"citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:32fafa901c756a65d64fdd05114e9da967c8a458676f36e45952463c17f9cef2","observation_id":"67b4273c-b3c0-4edc-8f4b-aa0bce3e75e6","resolution":{"observed_at":"2026-08-15T15:14:36.122798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:14:36.700543Z","title":"Editworld: Simulating world dynamics for instruction- following image editing","venue":null,"work_id":"790fdce1-b4d1-4edb-b6ab-f96af65af0c0","year":null},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-18T02:44:43.925012Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:36.125635Z"},"links":{"citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:df4079d7b022e6de00b05995d3d92551344530122c1b46c12363e9a6da4fdc0b","observation_id":"222f1b9e-0d29-495a-98a4-845715a0059e","resolution":{"observed_at":"2026-08-15T15:14:36.704257Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04145","last_updated":"2023-11-07T17:16:06Z","snapshot_observed_at":"2026-08-02T12:25:34.488259Z","submitted_at":"2023-11-07T17:16:06Z","title":"I2VGen-XL: High-Quality Image-to-Video Synthesis via Cascaded Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04145","snapshot_observed_at":"2026-08-15T15:14:36.128527Z","title":"I2vgen-xl: High-quality image-to-video synthesis via cascaded diffusion models.arXiv preprint arXiv:2311.04145, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-18T02:44:43.925012Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:36.128527Z"},"links":{"cited_paper":"/paper/2311.04145","citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:c3162c335f2abe21c6d77ae28b88c47974604fc2970c1c7d9be44341829f82df","observation_id":"8ba8b5ea-f2e3-400f-bd20-5da9728d9eab","resolution":{"observed_at":"2026-08-15T15:14:36.128527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11568","last_updated":"2024-06-05T07:05:15Z","snapshot_observed_at":"2026-08-16T14:08:54.316361Z","submitted_at":"2024-03-18T08:42:08Z","title":"EffiVED:Efficient Video Editing via Text-instruction Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11568","snapshot_observed_at":"2026-08-15T15:14:36.132218Z","title":"Effived: Efficient video editing via text-instruction diffusion models.arXiv preprint arXiv:2403.11568, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-18T02:44:43.925012Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:36.132218Z"},"links":{"cited_paper":"/paper/2403.11568","citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:cf91d7e0957bc1a79aa1676fc8e0d441b241f27def4d6ee959919e5aab4c1214","observation_id":"89c0ee69-c1c6-411c-8e1c-6e5af7d15788","resolution":{"observed_at":"2026-08-15T15:14:36.132218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:14:36.689748Z","title":"Motionpro: A precise mo- tion controller for image-to-video generation","venue":null,"work_id":"935f5fd5-e898-4ec8-b024-2754bbfb87d0","year":2025},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-18T02:44:43.925012Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:36.135815Z"},"links":{"citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:6013fbd63ca389623a86b6e0b5a17b54c9a20faca796c059de07f806423b8566","observation_id":"106458a7-e319-4faf-9c0d-7a77c611b3f4","resolution":{"observed_at":"2026-08-15T15:14:36.693440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:14:36.678795Z","title":"Ultraedit: Instruction-based fine-grained im- age editing at scale.Advances in Neural Information Pro- cessing Systems, 37:3058–3093, 2024","venue":null,"work_id":"5217e8eb-7c09-4c43-8fc2-a0918bc62f2c","year":2024},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-18T02:44:43.925012Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:36.139111Z"},"links":{"citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:8880ea5b23d27c86cab8549dc0d5bb7fc931142c8d91b7f5cb21adcd4502fec0","observation_id":"892ca003-1808-4665-9ca2-76f4c6b06c01","resolution":{"observed_at":"2026-08-15T15:14:36.681969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:14:36.666517Z","title":"Semantic under- standing of scenes through the ade20k dataset.International journal of computer vision, 127(3):302–321, 2019","venue":null,"work_id":"f9cab4ab-d01d-4e05-b8ef-95e1ad3fdb4c","year":2019},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-18T02:44:43.925012Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:36.142912Z"},"links":{"citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:182fcad0c8cd49f1219095378e0d5abd47991785590443026c658dc0eb535ae9","observation_id":"6937549a-7058-4ae0-a562-31ce580c7c73","resolution":{"observed_at":"2026-08-15T15:14:36.670892Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06734","last_updated":"2025-03-12T07:47:48Z","snapshot_observed_at":"2026-08-13T19:05:32.473398Z","submitted_at":"2025-02-10T17:58:22Z","title":"Se\\~norita-2M: A High-Quality Instruction-based Dataset for General Video Editing by Video Specialists","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06734","snapshot_observed_at":"2026-08-15T15:14:36.146697Z","title":"Se\\˜ norita-2m: A high-quality instruction- based dataset for general video editing by video specialists","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-18T02:44:43.925012Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:36.146697Z"},"links":{"cited_paper":"/paper/2502.06734","citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:0bb376b116a02b9c950cbac79b5472760e645dec17dbd6fc97383cd997f37032","observation_id":"f2bbfc9a-9c3a-44b6-b89a-7f1cfbfb6813","resolution":{"observed_at":"2026-08-15T15:14:36.146697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T02:44:43.925012Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing"},"reference_resolution":{"displayed":53,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":28,"verified_exact":0,"verified_fuzzy":25},"total_outbound_references":53},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 0 inbound Pith citation observations for arXiv:2608.01113."}