{"as_of":"2026-08-14T02:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2e83e0aed7e3fffd437129d72fc669a303dbec4c5abc6618d983d19d285aba2a","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T21:41:23.282342Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.04325/citation-record","integrity":"/paper/2501.04325/integrity","json":"/paper/2501.04325/citation-record.json","paper":"/paper/2501.04325"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:41:23.985264Z","title":"Blended diffusion for text-driven editing of natural images","venue":null,"work_id":"12bbdcdb-e71c-4057-880b-8f9f76dae323","year":null},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-12T21:23:08.895092Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.048302Z"},"links":{"citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:9139df8d9563b448a2387cef3dca622c2ee1ee199c81f5410ce59742365d5d99","observation_id":"42b8a104-7d5a-4122-9737-66354e2c9150","resolution":{"observed_at":"2026-08-10T21:41:23.989202Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:41:23.974384Z","title":"Text2live: Text-driven layered image and video editing","venue":null,"work_id":"5988b34f-f91f-4b98-a733-aebd72b317a1","year":null},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-12T21:23:08.895092Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.053362Z"},"links":{"citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:c12c7017c9dcbd234d1cf3bd261dce13c7408be7ff966d1ffc07a209daa8389b","observation_id":"9cb97f2d-8cf6-42a1-a1c2-d3eb9da35884","resolution":{"observed_at":"2026-08-10T21:41:23.978351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:41:23.964025Z","title":"In- structpix2pix: Learning to follow image editing instructions","venue":null,"work_id":"38829795-5836-4ca9-8c1f-0ff0ac86445e","year":2023},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-12T21:23:08.895092Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.057864Z"},"links":{"citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:78e698b401eee6492202eff5254fa612a26994545a4d83498cad97cd1d86f261","observation_id":"0fcf37a5-6e79-4c3b-99c2-d52311add416","resolution":{"observed_at":"2026-08-10T21:41:23.967675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:41:23.952743Z","title":"Pix2video: Video editing using image diffusion","venue":null,"work_id":"0988e488-3829-426f-af5c-e338f068fe56","year":null},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-12T21:23:08.895092Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.063303Z"},"links":{"citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:d0c926d775f6b4cca9bd133f01c83cd5abb483ee404cd6050e0122ea7a8abfb8","observation_id":"3e7be476-1869-486d-9b28-9808f15909bb","resolution":{"observed_at":"2026-08-10T21:41:23.956733Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:41:23.939804Z","title":"Stable- video: Text-driven consistency-aware diffusion video edit- ing","venue":null,"work_id":"0edcae4c-dd64-42da-b80a-dfab47e5cfe6","year":2023},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-12T21:23:08.895092Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.069225Z"},"links":{"citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:4cbdd7c22c3e63c6ac5ab57dcffab6b8746369ac51003e1c5a6fcfd28da8e12d","observation_id":"3fa87c73-9e85-4344-8e4e-48911593c4de","resolution":{"observed_at":"2026-08-10T21:41:23.944429Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07547","last_updated":"2024-06-11T17:59:51Z","snapshot_observed_at":"2026-08-12T23:45:15.560756Z","submitted_at":"2024-06-11T17:59:51Z","title":"Zero-shot Image Editing with Reference Imitation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07547","snapshot_observed_at":"2026-08-10T21:41:23.074303Z","title":"Zero-shot image editing with reference imitation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-12T21:23:08.895092Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.074303Z"},"links":{"cited_paper":"/paper/2406.07547","citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:b0215fc1ccca2af515b17aa1711987cf02cbe119811947b05d7e3a2d222fb43b","observation_id":"a0f5fde4-86e9-4423-b57e-e194863c68c0","resolution":{"observed_at":"2026-08-10T21:41:23.074303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:41:23.925621Z","title":"Xmem: Long- term video object segmentation with an atkinson-shiffrin memory model","venue":null,"work_id":"785cee98-b0b6-4742-964a-4e7fccbb12e4","year":2022},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-12T21:23:08.895092Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.079713Z"},"links":{"citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:f30f95403cfcdd58fc56a4fc6516d7fdf9c3f13f5699784893fea7146be82929","observation_id":"0e6f196c-371a-4f18-81ea-501dc8838046","resolution":{"observed_at":"2026-08-10T21:41:23.931085Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:41:23.913387Z","title":"Compvis/stable-diffusion: A latent text-to- image diffusion model","venue":null,"work_id":"90605a50-e267-45cd-8159-38f9c7cb6dcf","year":null},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-12T21:23:08.895092Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.084951Z"},"links":{"citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:797c6558fb3347589c9712ef449c463553c4c7a4fef2501f119dbd4fb71b53df","observation_id":"cc5a1e3d-7f05-402e-9b34-ebf73f9ca1d0","resolution":{"observed_at":"2026-08-10T21:41:23.918275Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.11427","last_updated":"2022-10-20T17:16:37Z","snapshot_observed_at":"2026-08-13T22:13:36.544823Z","submitted_at":"2022-10-20T17:16:37Z","title":"DiffEdit: Diffusion-based semantic image editing with mask guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.11427","snapshot_observed_at":"2026-08-10T21:41:23.090284Z","title":"Diffedit: Diffusion-based seman- tic image editing with mask guidance","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-12T21:23:08.895092Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.090284Z"},"links":{"cited_paper":"/paper/2210.11427","citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:d709b20ccba5642ab1440c0e993ad8c7721145b24268a00336021b53213bf188","observation_id":"392b5eee-b0e5-4756-9ac6-ae9d16393a0d","resolution":{"observed_at":"2026-08-10T21:41:23.090284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:41:23.902178Z","title":"Videdit: Zero-shot and spatially aware text-driven video editing.IEEE Trans","venue":null,"work_id":"5008e2f5-0c69-4140-9e6c-f2e4ae440bf6","year":2023},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-12T21:23:08.895092Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.095632Z"},"links":{"citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:962e458469617fc9b86a6b991eee4406add54948c2bef88c9026c90c116b4c4c","observation_id":"8e3650e1-78ba-4ee5-bcdf-3b5ca474cc2a","resolution":{"observed_at":"2026-08-10T21:41:23.906371Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:41:23.890699Z","title":"Diffusion models beat gans on image synthesis","venue":null,"work_id":"ba2adae7-e9ee-4fa6-9ed9-bb2fc562afee","year":2021},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-12T21:23:08.895092Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.100475Z"},"links":{"citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:e3c3dd5b51b894411520656fb884ef9959c964531cdd9ace5eb8f8920b39da51","observation_id":"12e6d0ba-8e2b-4c86-b713-2e5465bd330a","resolution":{"observed_at":"2026-08-10T21:41:23.894691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:41:23.878805Z","title":"Editanything: Empower- ing unparalleled flexibility in image editing and generation","venue":null,"work_id":"4d6be6f5-9f58-480b-9008-d8ff51470428","year":2023},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-12T21:23:08.895092Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.104235Z"},"links":{"citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:724a7cd1e06e467c2a642aff057e8c8973f8c3958873987c7c1237a13d9a4769","observation_id":"b9ff7a3d-bf18-4496-8175-a42f42c738b5","resolution":{"observed_at":"2026-08-10T21:41:23.882900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.10373","last_updated":"2023-11-20T10:54:09Z","snapshot_observed_at":"2026-08-13T17:55:49.664545Z","submitted_at":"2023-07-19T18:00:03Z","title":"TokenFlow: Consistent Diffusion Features for Consistent Video Editing","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.10373","snapshot_observed_at":"2026-08-10T21:41:23.107577Z","title":"Tokenflow: Consistent diffusion features for consistent video editing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-12T21:23:08.895092Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.107577Z"},"links":{"cited_paper":"/paper/2307.10373","citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:09380b8188e8b0004434c30c307e8d1512dcd00fee00d5517154889e9a2835e5","observation_id":"499e42d0-3b1c-4c68-be94-31de4bc362c1","resolution":{"observed_at":"2026-08-10T21:41:23.107577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04725","last_updated":"2024-02-08T18:08:57Z","snapshot_observed_at":"2026-08-12T14:50:50.360929Z","submitted_at":"2023-07-10T17:34:16Z","title":"AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04725","snapshot_observed_at":"2026-08-10T21:41:23.111674Z","title":"Animatediff: Animate your personalized text- to-image diffusion models without specific tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-12T21:23:08.895092Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.111674Z"},"links":{"cited_paper":"/paper/2307.04725","citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:af1f4696889446813aa786eea95edcb416618a2c586a1a5ae52235da8b44df0f","observation_id":"c61d8e86-da4b-49e6-a4c5-6cf38dbfbb06","resolution":{"observed_at":"2026-08-10T21:41:23.111674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:41:23.868255Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":"f1f7cee8-b63e-4860-bec7-ca88c731a5e1","year":2022},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-12T21:23:08.895092Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.117261Z"},"links":{"citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:1e7a3c9ccd722cd943380f8428b01b6cb0146488784b3c273bfa642ec6049585","observation_id":"f1c5f390-96dd-4313-b408-6294732e2a52","resolution":{"observed_at":"2026-08-10T21:41:23.871666Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:41:23.858249Z","title":"Denoising dif- fusion probabilistic models","venue":null,"work_id":"5e3ca09d-f155-4e4b-bb7c-a0f1496306f5","year":2020},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-12T21:23:08.895092Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.121491Z"},"links":{"citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:4d597056aa0b0d7e6946d1f9549306f8823494d90cd2822eed6e70de35979336","observation_id":"0bad9104-fd8f-40cb-b153-c7c5ddda50a0","resolution":{"observed_at":"2026-08-10T21:41:23.861625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:41:23.846744Z","title":"Gritsenko, William Chan, Mohammad Norouzi, and David J","venue":null,"work_id":"7c0d3d29-d1ca-4985-9614-a6cc4eb289ad","year":2022},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-12T21:23:08.895092Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.125562Z"},"links":{"citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:ca489f6014a86654581111610854567ceaf718b2eb8005f679570d2f9b55b486","observation_id":"70106e01-8634-4d2a-a464-c6636c5f02f8","resolution":{"observed_at":"2026-08-10T21:41:23.850704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:41:23.834168Z","title":"Lite- flownet: A lightweight convolutional neural network for op- tical flow estimation","venue":null,"work_id":"635a3cf3-5dc5-4fd7-a0f6-bf225daf7d46","year":2018},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-12T21:23:08.895092Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.130447Z"},"links":{"citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:07de46664de38004a45ddf187ec633e3b1ff6a9e91de0ebc75c8eadf4dd49a52","observation_id":"22eb0cd0-27e1-4441-a6ff-efafc57f659a","resolution":{"observed_at":"2026-08-10T21:41:23.838500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:41:23.820685Z","title":"Vmc: Video motion customization using temporal attention adap- tion for text-to-video diffusion models","venue":null,"work_id":"f11fc2bd-290a-4f0c-87b5-89d70d896ca2","year":2024},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-12T21:23:08.895092Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.135093Z"},"links":{"citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:11d6fcdd6c67c4f4de0cd16986761424f4469f29f1860921fb05d3dedcf5f169","observation_id":"303cfef8-470b-4e47-955a-e4b3ab7fedd8","resolution":{"observed_at":"2026-08-10T21:41:23.825108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:41:23.808283Z","title":"Imagic: Text-based real image editing with diffusion models","venue":null,"work_id":"4934d235-3da8-45a7-b796-8e48aa1d993b","year":null},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-12T21:23:08.895092Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.139775Z"},"links":{"citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:b8871f93c550b519dc2b69a59df033603f611eb5b787060f6b4c5b1967a93543","observation_id":"2fbb744c-715f-4aa0-a16d-64183e423ae0","resolution":{"observed_at":"2026-08-10T21:41:23.813063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:41:23.796453Z","title":"Dif- fusionclip: Text-guided diffusion models for robust image manipulation","venue":null,"work_id":"71c7a395-05d5-4bfb-996d-fbe713153ccf","year":2022},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-12T21:23:08.895092Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.144193Z"},"links":{"citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:17527826c34ac64f85837e69189dd282fdc7502eab2b369dfc21d718da64bdd7","observation_id":"ba7ee9c9-93c2-4980-818b-b5d2eec3005a","resolution":{"observed_at":"2026-08-10T21:41:23.800802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:41:23.784566Z","title":"Segment any- thing","venue":null,"work_id":"d414a955-442d-4c2e-bae4-c67ff3f8a9d7","year":2023},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-12T21:23:08.895092Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.148464Z"},"links":{"citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:2c588abc6ddb3d1620cd116885a58b02804c5116c026f6d2ad8f7132bacf4617","observation_id":"21d1b036-6e13-49c2-9cfa-3c7771612fc2","resolution":{"observed_at":"2026-08-10T21:41:23.788808Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:41:23.772278Z","title":"Open-sora-plan, 2024","venue":null,"work_id":"5c385c7b-8b7c-4fd7-9cb1-83ae9a9952e0","year":2024},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-12T21:23:08.895092Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.152779Z"},"links":{"citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:af3299c4c46c0993c5354c04d7c24edb63c2779c8a06e286d39bb4c0933a9b27","observation_id":"1c400dbe-334a-4ce3-bc64-2226a555fd0a","resolution":{"observed_at":"2026-08-10T21:41:23.776350Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:41:23.760131Z","title":"Learning blind video temporal consistency","venue":null,"work_id":"e7fa3ace-7914-4163-b38d-a94ae4bdb59f","year":2018},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-12T21:23:08.895092Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.157139Z"},"links":{"citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:d0b834ea7d9da7056847e296955a13de099faa69c474fd4dd4dd89c2b5f097ad","observation_id":"28fe7f0e-30d1-4f9b-a908-377f16bc1f8a","resolution":{"observed_at":"2026-08-10T21:41:23.764665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:41:23.746207Z","title":"Generative image dynamics","venue":null,"work_id":"c38365c7-3214-4533-b896-c0c226770530","year":2024},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-12T21:23:08.895092Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.161189Z"},"links":{"citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:bc678761aa598359c701483286b6285f2fea9f43544c9ed0f57cbff088d47923","observation_id":"7b8feac7-bac0-47ea-910b-a825789673d9","resolution":{"observed_at":"2026-08-10T21:41:23.750869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:41:23.731092Z","title":"Video-p2p: Video editing with cross-attention control","venue":null,"work_id":"b21915c3-ce48-42aa-899c-273e9be0fb87","year":null},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-12T21:23:08.895092Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.165082Z"},"links":{"citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:dbb0ea2f13c0cf1c53bc43ce496b137757db4ca05de4795afd11fd7442cb97c8","observation_id":"6bf4ffda-2075-41f3-9724-4cd81b2aed1c","resolution":{"observed_at":"2026-08-10T21:41:23.735746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:41:23.717042Z","title":"Null-text inversion for editing real images using guided diffusion models","venue":null,"work_id":"e78cfe9f-14c7-47f9-a7cd-7414f40bf072","year":2023},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-12T21:23:08.895092Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.169506Z"},"links":{"citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:9111e2771e3debd9c038d4686dfa21a215cd5df3dca7ae1dbb4c237518ac4d54","observation_id":"351b6968-a739-4a8d-9c88-5f125db30d89","resolution":{"observed_at":"2026-08-10T21:41:23.721659Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.01329","last_updated":"2023-02-02T18:58:58Z","snapshot_observed_at":"2026-08-13T12:52:32.312931Z","submitted_at":"2023-02-02T18:58:58Z","title":"Dreamix: Video Diffusion Models are General Video Editors","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.01329","snapshot_observed_at":"2026-08-10T21:41:23.174350Z","title":"Dreamix: Video diffusion models are general video editors","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-12T21:23:08.895092Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.174350Z"},"links":{"cited_paper":"/paper/2302.01329","citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:2a22bfdd610f921d3be296c66b689a07e221a0d950e09919ae6238917a82b881","observation_id":"b7d3f3d1-ae61-48c9-8b46-e5f3b9286c63","resolution":{"observed_at":"2026-08-10T21:41:23.174350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10741","last_updated":"2022-03-08T18:18:49Z","snapshot_observed_at":"2026-08-07T12:21:17.790675Z","submitted_at":"2021-12-20T18:42:55Z","title":"GLIDE: Towards Photorealistic Image Generation and Editing with Text-Guided Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10741","snapshot_observed_at":"2026-08-10T21:41:23.178964Z","title":"Glide: Towards photorealistic image generation and editing with text-guided diffusion models.arXiv preprint arXiv:2112.10741, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-12T21:23:08.895092Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.178964Z"},"links":{"cited_paper":"/paper/2112.10741","citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:fba9f3baace0a012e70bc48fef96d7abb5ab31edaa26a30e66ba0e82eb7b0f7d","observation_id":"ff936bca-0c05-49c4-b8f1-d60b135f20cb","resolution":{"observed_at":"2026-08-10T21:41:23.178964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:41:23.702631Z","title":"The best free stock photos, royalty free images & videos shared by creators","venue":null,"work_id":"77ee8e32-b38e-4b2d-85ff-6b8651e3e736","year":null},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-12T21:23:08.895092Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.183312Z"},"links":{"citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:718678cfffa65def4e1509f86da10244f69adffa072ca83204bb5bcf356eca01","observation_id":"517e7d7a-a1e1-41e9-8386-0a1cad6064ae","resolution":{"observed_at":"2026-08-10T21:41:23.707660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:41:23.689237Z","title":"Fatezero: Fus- ing attentions for zero-shot text-based video editing","venue":null,"work_id":"d91339ea-1d6a-45e3-86b5-3f81eac17e7e","year":2023},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-12T21:23:08.895092Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.186953Z"},"links":{"citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:0031ac1ab0563410f2846dafdbeab6af0a1d7508d0e47eedf4f351707fdc8c05","observation_id":"cff524ce-59b4-409a-95cb-5f344c834a7f","resolution":{"observed_at":"2026-08-10T21:41:23.694231Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:41:23.675646Z","title":"High-resolution image syn- thesis with latent diffusion models","venue":null,"work_id":"500e70b8-3342-4dd2-96f6-b1ea76d37ac8","year":2022},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-12T21:23:08.895092Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.189983Z"},"links":{"citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:92f4d710e5c2dc1cc0a5a7c84718456c22047e08fd10516b3d783eb2ae80104e","observation_id":"e44e7ee3-8a06-474e-841b-62de9cf95fcd","resolution":{"observed_at":"2026-08-10T21:41:23.680598Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:41:23.193229Z","title":"pytorch-fid: FID Score for PyTorch","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-12T21:23:08.895092Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.193229Z"},"links":{"citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:0806a2971f3ff668851e24146eb991edfaa3ddcc8ccadec997b34ad187a0a7f5","observation_id":"f95c7446-3d04-448c-94d5-0893dc9c7a6a","resolution":{"observed_at":"2026-08-10T21:41:23.193229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:41:23.654741Z","title":"Motion-i2v: Consistent and controllable image-to-video generation with explicit motion modeling","venue":null,"work_id":"9d2c4ea2-401b-4322-8826-422c27fdcde8","year":2024},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-12T21:23:08.895092Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.197259Z"},"links":{"citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:93e6bb9decffa21f551b70f488c72e2c9c4353cdc21feb25fa723476ed2896a6","observation_id":"318fe1bd-0d9b-4182-a75b-4daf35332f0c","resolution":{"observed_at":"2026-08-10T21:41:23.658961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:41:23.642137Z","title":"Dragdiffusion: Harnessing diffusion models for interactive point-based image editing","venue":null,"work_id":"7de6c905-19ad-409d-9a52-b28e41cd3a64","year":2024},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-12T21:23:08.895092Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.201069Z"},"links":{"citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:19cb8d778c2809ca91cb3c4877bb45271a3215b7d14ffcf2b0a410041c8de75e","observation_id":"25c25d60-4a7e-4505-91ac-52ecb2aad6a5","resolution":{"observed_at":"2026-08-10T21:41:23.647253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14792","last_updated":"2022-09-29T13:59:46Z","snapshot_observed_at":"2026-07-06T13:57:47.051387Z","submitted_at":"2022-09-29T13:59:46Z","title":"Make-A-Video: Text-to-Video Generation without Text-Video Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14792","snapshot_observed_at":"2026-08-10T21:41:23.205165Z","title":"Make-a-video: Text-to-video generation without text-video data","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-12T21:23:08.895092Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.205165Z"},"links":{"cited_paper":"/paper/2209.14792","citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:3d714482c0f12dfb78b1a7b7d6dafbe8d1322b061ec3744f73ccb217913ed4a0","observation_id":"8536298f-97f5-47d7-8605-5557146a5510","resolution":{"observed_at":"2026-08-10T21:41:23.205165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-08-11T15:38:14.931716Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-10T21:41:23.210493Z","title":"Denoising diffusion implicit models","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-12T21:23:08.895092Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.210493Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:065d4e8443b6577d2e516cdcc4cbafcb852ff42f59bddedbe3b5b2cdd47d33bb","observation_id":"083f91fd-af46-4d96-9ebc-9182b87255c9","resolution":{"observed_at":"2026-08-10T21:41:23.210493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:41:23.630146Z","title":"Score-based generative modeling through stochastic differential equa- tions","venue":null,"work_id":"57dca760-2695-4dee-a96d-1000691e8327","year":null},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-12T21:23:08.895092Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.214836Z"},"links":{"citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:57b7d57656d17ba3b1dee70bf0fb0b5c736bb49faf2061358dc919320267b9cb","observation_id":"c352fc04-3141-449a-adb6-56113b1a92d3","resolution":{"observed_at":"2026-08-10T21:41:23.634223Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:41:23.612428Z","title":"Videomae: Masked autoencoders are data-efficient learners for self-supervised video pre-training","venue":null,"work_id":"a7051418-4f76-415c-bcfd-383a2595e4de","year":2022},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-12T21:23:08.895092Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.218661Z"},"links":{"citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:84fcd7f13c6923f861d34b281cf5a8cde6c94e7a14b327f222232c5429cc62bf","observation_id":"502916d0-8bbb-479d-8e24-5307fb3577bb","resolution":{"observed_at":"2026-08-10T21:41:23.618168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.17599","last_updated":"2024-01-04T01:30:50Z","snapshot_observed_at":"2026-08-13T12:13:03.222767Z","submitted_at":"2023-03-30T17:59:25Z","title":"Zero-Shot Video Editing Using Off-The-Shelf Image Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.17599","snapshot_observed_at":"2026-08-10T21:41:23.222710Z","title":"Zero-shot video editing using off-the-shelf image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-12T21:23:08.895092Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.222710Z"},"links":{"cited_paper":"/paper/2303.17599","citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:d8298cbce3143303ea8f59b47dd1c760711752f80391489368fdb1f6cd3caa98","observation_id":"ab4bff79-767a-4a6e-b913-a29a6cfb6975","resolution":{"observed_at":"2026-08-10T21:41:23.222710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.09043","last_updated":"2022-03-17T02:45:34Z","snapshot_observed_at":"2026-08-13T16:20:57.576804Z","submitted_at":"2022-03-17T02:45:34Z","title":"Latent Image Animator: Learning to Animate Images via Latent Space Navigation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.09043","snapshot_observed_at":"2026-08-10T21:41:23.227332Z","title":"Latent image animator: Learning to ani- mate images via latent space navigation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-12T21:23:08.895092Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.227332Z"},"links":{"cited_paper":"/paper/2203.09043","citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:323523242e637a13464598b4082bf17732061d5b40d04fa6cc206646b537ed02","observation_id":"70055fc3-79bc-432d-a0cc-067148524f7c","resolution":{"observed_at":"2026-08-10T21:41:23.227332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:41:23.600235Z","title":"Dynamicrafter: Animating open-domain images with video diffusion priors","venue":null,"work_id":"09ae5556-8007-4c5c-9b18-34185a6fc8ee","year":2025},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-12T21:23:08.895092Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.231637Z"},"links":{"citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:3923f65994e986ae590580f76214edecb119358aace891ed5870c3c10a601102","observation_id":"199495d0-fb7e-4021-9684-0400d74f479a","resolution":{"observed_at":"2026-08-10T21:41:23.604875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:41:23.586240Z","title":"Gmflow: Learning optical flow via global matching","venue":null,"work_id":"6e123c45-25b4-455a-913e-358bdaf9bc38","year":2022},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-12T21:23:08.895092Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.235517Z"},"links":{"citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:b7a4420fa2313e124435eb252a2be7008cdd46450895a72073c87b2b814ec3cf","observation_id":"1d8ae152-cffd-4991-a443-6e2d8181d4d4","resolution":{"observed_at":"2026-08-10T21:41:23.591772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00908","last_updated":"2023-09-02T11:13:29Z","snapshot_observed_at":"2026-08-13T10:22:12.772148Z","submitted_at":"2023-09-02T11:13:29Z","title":"MagicProp: Diffusion-based Video Editing via Motion-aware Appearance Propagation","version":1},"cited_work":{"arxiv_id":"2309.00908","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.00908","snapshot_observed_at":"2026-08-10T21:41:23.345954Z","title":"MagicProp: Diffusion-based Video Editing via Motion-aware Appearance Propagation","venue":"cs.CV","work_id":"1b6d71a2-b047-47b2-bf92-f30c74813e82","year":2023},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-12T21:23:08.895092Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.239654Z"},"links":{"cited_paper":"/paper/2309.00908","citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:a4bb2071fe9aba92b3f05ba6faf595bb59538d4a1eeb6a9ecc42af70e0dd3274","observation_id":"9910b07b-a008-48bb-9a9e-ae9c377efd05","resolution":{"observed_at":"2026-08-10T21:41:23.352369Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18827","last_updated":"2023-11-30T18:59:06Z","snapshot_observed_at":"2026-08-13T05:12:58.834430Z","submitted_at":"2023-11-30T18:59:06Z","title":"Motion-Conditioned Image Animation for Video Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.18827","snapshot_observed_at":"2026-08-10T21:41:23.244051Z","title":"Motion-conditioned image animation for video editing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-12T21:23:08.895092Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.244051Z"},"links":{"cited_paper":"/paper/2311.18827","citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:2668ca3bfac6856b33e7fd1bc5f689273f065aee7d6747cbded5394646f5e9e6","observation_id":"c0ed8248-855a-4756-8e54-53116e186248","resolution":{"observed_at":"2026-08-10T21:41:23.244051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:41:23.571308Z","title":"Paint by example: Exemplar-based image editing with diffusion models","venue":null,"work_id":"e8737c02-808b-45a4-ac52-f08fab0887dc","year":2023},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-12T21:23:08.895092Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.248392Z"},"links":{"citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:978b81e2e381860c865fc980b67d351c8dcc58f6f4882d552c5748692b65da7b","observation_id":"b5c1d703-ac6c-4917-83d6-66ab981fce06","resolution":{"observed_at":"2026-08-10T21:41:23.576761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:41:23.555769Z","title":"Depth anything: Unleashing the power of large-scale unlabeled data","venue":null,"work_id":"a284729d-6f53-43fc-94ec-ce7be7345cf9","year":2024},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-12T21:23:08.895092Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.252222Z"},"links":{"citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:dd6c1f2beae2f3747be6005333e22c0b9f8b936de9d242bb17fe5989efb4662b","observation_id":"2c8b40b6-e398-46f4-a5b6-572285736344","resolution":{"observed_at":"2026-08-10T21:41:23.561239Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:41:23.542868Z","title":"Rerender a video: Zero-shot text-guided video-to-video translation","venue":null,"work_id":"5826120d-9c91-4664-9925-84718ed4f78c","year":2023},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-12T21:23:08.895092Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.256073Z"},"links":{"citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:5611845df83ebbbcf507b43742373814a425213760968003d86800290beafb65","observation_id":"d8a2c9ab-1301-4f81-9103-53f53e9856b8","resolution":{"observed_at":"2026-08-10T21:41:23.547123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06721","last_updated":"2023-08-13T08:34:51Z","snapshot_observed_at":"2026-07-06T16:05:39.158819Z","submitted_at":"2023-08-13T08:34:51Z","title":"IP-Adapter: Text Compatible Image Prompt Adapter for Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06721","snapshot_observed_at":"2026-08-10T21:41:23.259850Z","title":"Ip- adapter: Text compatible image prompt adapter for text-to- image diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-12T21:23:08.895092Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.259850Z"},"links":{"cited_paper":"/paper/2308.06721","citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:a511e10bfdbdc4a34244b289070f1016b88f490382a666e25a494dd516d83da1","observation_id":"c8588efb-512a-4e5b-b889-c58d44f1794e","resolution":{"observed_at":"2026-08-10T21:41:23.259850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:41:23.530447Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":"d7fe6b6b-d89a-458c-ac3c-7cc252751e1a","year":2023},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-12T21:23:08.895092Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.264348Z"},"links":{"citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:fe5cbdcc14ca3de427f2fc4cfa6cfd340a07f43694c8071d8ab16067b41d0d28","observation_id":"0171d1bb-3607-4c92-97a5-a5bcbec45c7a","resolution":{"observed_at":"2026-08-10T21:41:23.534380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:41:23.518484Z","title":"Sine: Single image editing with text-to-image diffusion models","venue":null,"work_id":"ec9a8401-86aa-4acc-8a5d-a8a13cb9be6e","year":2023},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-12T21:23:08.895092Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.268609Z"},"links":{"citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:8bfa0f84971d7fc4790c0df75d3a8a9ca54b986a17f36651153552154af925a0","observation_id":"9dd04a1e-5fb1-45db-877a-6230a2db62ba","resolution":{"observed_at":"2026-08-10T21:41:23.522591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:41:23.504030Z","title":"Avid: Any-length video inpainting with dif- fusion model","venue":null,"work_id":"6633c47e-0cff-4fde-b3f0-8c235bf34924","year":2024},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-12T21:23:08.895092Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.273112Z"},"links":{"citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:7bbd61d5c65dbd4d02569d2cae60ab9c2e0a66da9bfa9b7b61e83998527c3d32","observation_id":"9c9fb6a3-1622-4fcc-9732-5645b813b3f3","resolution":{"observed_at":"2026-08-10T21:41:23.509453Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:41:23.489666Z","title":"Motiondirector: Motion customization of text-to-video diffusion models","venue":null,"work_id":"6ed86a7c-fd55-4f66-a382-e3e13360e1bb","year":2025},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-12T21:23:08.895092Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.277490Z"},"links":{"citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:1d77106885d1804f79a6e647776260fc7f0418f713412bf37e041905da036fba","observation_id":"655872eb-92ff-4783-a0db-3fd0baa50417","resolution":{"observed_at":"2026-08-10T21:41:23.494936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:41:23.475484Z","title":"clip-score: CLIP Score for Py- Torch","venue":null,"work_id":"8dc7e70b-c709-4890-863f-b683643db14f","year":2023},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-12T21:23:08.895092Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.282342Z"},"links":{"citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:47ae10c85af787e9774b3ecdefeb777b17c27a58c92f7d3fe9bdfe35f4181291","observation_id":"b79f31ca-b2ec-4a36-9ceb-54da19575f76","resolution":{"observed_at":"2026-08-10T21:41:23.480291Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T21:23:08.895092Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":1,"verified_fuzzy":40},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 0 inbound Pith citation observations for arXiv:2501.04325."}