{"as_of":"2026-08-10T03:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d589c3aa7c100b6618d0a8f0079cf004dc1c75cc4c86db871238be688f840623","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:25:29.212390Z","state":"measured"},{"denominator":58,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":58,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-03T16:19:51.348169Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T16:28:38.518422Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-09T00:50:03.032034Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"cited_work":{"arxiv_id":"2507.02857","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02857","snapshot_observed_at":"2026-07-03T16:28:38.518422Z","title":"arXiv preprint arXiv:2507.02857 (2025)","venue":null,"work_id":"8a6710d7-b3be-4460-94ed-ce786d78ee87","year":2025},"citing_paper":{"arxiv_id":"2607.01869","last_updated":"2026-07-02T08:25:38Z","snapshot_observed_at":"2026-07-07T00:07:23.664493Z","submitted_at":"2026-07-02T08:25:38Z","title":"QWERTY: Training-Free Motion Control via Query-Warped Video Diffusion Transformers","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-03T16:19:51.348169Z"},"links":{"cited_paper":"/paper/2507.02857","citing_paper":"/paper/2607.01869"},"observation_digest":"sha256:19ffa6335cd130b042a647341ad0f40cb55f0505c5566e6f548c253eb0de2b2b","observation_id":"bd2c33f3-ad0b-4654-8b84-00132bccf2f5","resolution":{"observed_at":"2026-07-03T16:28:38.520077Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.02857/citation-record","integrity":"/paper/2507.02857/integrity","json":"/paper/2507.02857/citation-record.json","paper":"/paper/2507.02857"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-06T20:25:24.234995Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-09T00:50:03.032034Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:24.234995Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:ebb03c85d804144df5cbc1a7bbfad5e588c582266c79416162a0aef9fad8f48d","observation_id":"1fed75c3-b20c-4f6b-96ac-78b1a717cd86","resolution":{"observed_at":"2026-08-06T20:25:24.234995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:25:34.389702Z","title":"Align your latents: High-resolution video synthesis with latent diffusion models","venue":null,"work_id":"58370bea-a0a5-4ad6-b507-b0976226df30","year":2023},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-09T00:50:03.032034Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:24.323877Z"},"links":{"citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:76fdcd6386eb3f8c47cc340e8359a203ac1ca6ec6fb325e3e2af309aa4bde11d","observation_id":"88234fc6-27ef-4f33-83cd-dc35b5f64f2a","resolution":{"observed_at":"2026-08-06T20:25:34.460141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:25:34.263832Z","title":"A unified 3d human motion synthesis model via conditional variational auto-encoder","venue":null,"work_id":"489748d0-88c7-4506-ae0b-02eb7a7f904b","year":null},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-09T00:50:03.032034Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:24.413431Z"},"links":{"citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:1e450df832d22be86cee89ddb7960ba6a2b8aa1c7dbc3ca3dbc7e419bf40adbb","observation_id":"efdf9c10-8737-47a9-a29a-4edda0d43b45","resolution":{"observed_at":"2026-08-06T20:25:34.328860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19512","last_updated":"2023-10-30T13:12:40Z","snapshot_observed_at":"2026-08-07T10:15:15.859263Z","submitted_at":"2023-10-30T13:12:40Z","title":"VideoCrafter1: Open Diffusion Models for High-Quality Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19512","snapshot_observed_at":"2026-08-06T20:25:24.503120Z","title":"Videocrafter1: Open diffusion models for high-quality video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-09T00:50:03.032034Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:24.503120Z"},"links":{"cited_paper":"/paper/2310.19512","citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:a84a32a5cce3a0266af6306c177768416658bb83a3ae3e0d645c4e9b3c7dac11","observation_id":"47fb6f8e-8c13-427a-8c2c-c82e2e41c664","resolution":{"observed_at":"2026-08-06T20:25:24.503120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:25:34.058888Z","title":"Videocrafter2: Overcoming data limitations for high-quality video diffusion models","venue":null,"work_id":"bd0b32a6-4181-4eaa-bbe1-2aeac59923bf","year":2024},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-09T00:50:03.032034Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:24.594083Z"},"links":{"citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:bbfdf53cad8c08f96d51bac661b94e4580c95f5127fc99074615e845f6fd138c","observation_id":"537051c3-c895-478e-8dab-e699d1e73474","resolution":{"observed_at":"2026-08-06T20:25:34.189521Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:25:33.935427Z","title":"MeViS: A large-scale benchmark for video segmentation with motion expressions","venue":null,"work_id":"fae34b24-b373-41fd-ba28-249bc5a88e84","year":2023},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-09T00:50:03.032034Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:24.679423Z"},"links":{"citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:5b7c82a2d59beaa9d934942321eadbfd30d473d6875ee1b7895558f52795ce54","observation_id":"78f7342e-fe75-436f-8721-6dfd29aad377","resolution":{"observed_at":"2026-08-06T20:25:33.997665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04725","last_updated":"2024-02-08T18:08:57Z","snapshot_observed_at":"2026-07-06T15:52:13.602170Z","submitted_at":"2023-07-10T17:34:16Z","title":"AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04725","snapshot_observed_at":"2026-08-06T20:25:24.769350Z","title":"Animatediff: Animate your personalized text- to-image diffusion models without specific tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-09T00:50:03.032034Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:24.769350Z"},"links":{"cited_paper":"/paper/2307.04725","citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:ce0557b44fb1959e9bc0fc9759c0acbaea2eee7cdd1400ed22b5155df0d48ad1","observation_id":"8991ac9c-0e5e-49cd-86b0-9fe1b6ca30f8","resolution":{"observed_at":"2026-08-06T20:25:24.769350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:25:33.783019Z","title":"Sparsectrl: Adding sparse controls to text-to-video diffusion models","venue":null,"work_id":"6b23d0b7-7b96-47cb-902f-af33664660a1","year":2025},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-09T00:50:03.032034Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:24.884766Z"},"links":{"citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:380906e24f558bb4639c5d35b48506ce01ef4ed9bbadd4221b142494fa2ee2dd","observation_id":"35b70089-05a0-4fa1-8c2b-22c36faedc0e","resolution":{"observed_at":"2026-08-06T20:25:33.854495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02101","last_updated":"2025-03-13T18:35:06Z","snapshot_observed_at":"2026-07-06T17:54:39.685251Z","submitted_at":"2024-04-02T16:52:41Z","title":"CameraCtrl: Enabling Camera Control for Text-to-Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02101","snapshot_observed_at":"2026-08-06T20:25:24.979478Z","title":"Cameractrl: Enabling camera control for text-to-video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-09T00:50:03.032034Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:24.979478Z"},"links":{"cited_paper":"/paper/2404.02101","citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:2f3afe5868ba68df6bbd3be9b403c5980314a5e6c983e2f0199e5994638ee4bb","observation_id":"84520573-1143-4c07-b930-d1d95e56baa1","resolution":{"observed_at":"2026-08-06T20:25:24.979478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-08-10T00:51:42.114461Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-08-06T20:25:25.057827Z","title":"Latent video diffusion models for high-fidelity long video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-09T00:50:03.032034Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:25.057827Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:f3163b2b181a92969dabb9d028e1a366473f3b33b075e75f2e98fef08d7fd495","observation_id":"00467e71-d160-4147-9adc-40188cf446b9","resolution":{"observed_at":"2026-08-06T20:25:25.057827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01626","last_updated":"2022-08-02T17:55:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-08-02T17:55:41Z","title":"Prompt-to-Prompt Image Editing with Cross Attention Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.01626","snapshot_observed_at":"2026-08-06T20:25:25.140993Z","title":"Prompt-to-prompt image editing with cross attention control","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-09T00:50:03.032034Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:25.140993Z"},"links":{"cited_paper":"/paper/2208.01626","citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:5ebfa600a99a69f3df2e6199ddddc54b4839abccba56d154f2c9ef927d69314f","observation_id":"c424eb1b-8aa8-43b4-960f-411cbbdaba4e","resolution":{"observed_at":"2026-08-06T20:25:25.140993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:25:33.576045Z","title":"Video diffusion models","venue":null,"work_id":"01dd119e-e68b-4d56-a63f-1224bb4eae3d","year":2022},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-09T00:50:03.032034Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:25.240688Z"},"links":{"citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:9a6717e8668ad7804945ee1d69e7afebe34ec43e6cbb68fca9d15fa64316d2eb","observation_id":"4a3287ac-ad55-4777-a748-4f898526342c","resolution":{"observed_at":"2026-08-06T20:25:33.684728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-06T20:25:25.318105Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-09T00:50:03.032034Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:25.318105Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:8e30a447b84e1e867d92c6393813d4ee4284990691105c529004e2229455f93d","observation_id":"c3b78684-d66f-476e-bafb-695ab7fa9ace","resolution":{"observed_at":"2026-08-06T20:25:25.318105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:25:33.433835Z","title":"Cocktail: Mixing multi-modality control for text-conditional image generation","venue":null,"work_id":"01c3fb8a-e709-4694-b081-a707abeeb34b","year":2023},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-09T00:50:03.032034Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:25.380684Z"},"links":{"citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:ba5ed30082d0c06f9b98ac498af1bd3a3ae621e953576f5b2dd2034dae6ed4d2","observation_id":"9fddd0ee-b922-46d1-9b73-51842255c65b","resolution":{"observed_at":"2026-08-06T20:25:33.505365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.14073","last_updated":"2023-08-03T09:34:24Z","snapshot_observed_at":"2026-07-06T15:58:43.241452Z","submitted_at":"2023-07-26T09:50:44Z","title":"VideoControlNet: A Motion-Guided Video-to-Video Translation Framework by Using Diffusion Model with ControlNet","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.14073","snapshot_observed_at":"2026-08-06T20:25:25.466570Z","title":"Videocontrolnet: A motion-guided video-to-video translation framework by using diffusion model with controlnet","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-09T00:50:03.032034Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:25.466570Z"},"links":{"cited_paper":"/paper/2307.14073","citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:17f130a349a2cc5a70980fdc18b5327a7d7874a5cd357deaff563563b097e3a2","observation_id":"475fe6c3-411c-4d7c-be8a-a8000066e717","resolution":{"observed_at":"2026-08-06T20:25:25.466570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:25:33.322605Z","title":"Arbitrary style transfer in real-time with adaptive instance normalization","venue":null,"work_id":"0064b5e0-cd22-4605-9565-0b29ed710569","year":null},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-09T00:50:03.032034Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:25.558706Z"},"links":{"citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:b3dfce02d12ace16016cbc818c2b941fd0e8dbcb8ea742398b9b99a3907c494c","observation_id":"bc66d003-8b0c-4769-bb91-666dc3eb6548","resolution":{"observed_at":"2026-08-06T20:25:33.367870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:25:33.152008Z","title":"Cotracker: It is better to track together","venue":null,"work_id":"08b20110-ff09-4ca2-ba8b-6dc24523027b","year":2024},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-09T00:50:03.032034Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:25.679527Z"},"links":{"citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:ccd5c84b0a27eaf2ed7afcac3a5e8b4fab88e1d4b4b82b870ee7c297a505d868","observation_id":"d19d4810-6fc5-4c9f-a904-61b8c942574f","resolution":{"observed_at":"2026-08-06T20:25:33.236726Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:25:25.815397Z","title":"Text2video-zero: Text- to-image diffusion models are zero-shot video generators","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-09T00:50:03.032034Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:25.815397Z"},"links":{"citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:55835541156c2b83711de59a4bd7c4b64ebf8d2cf995647c768c539fc56e04d3","observation_id":"79574eae-be01-4584-ad52-ea507b4c5876","resolution":{"observed_at":"2026-08-06T20:25:25.815397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15194","last_updated":"2025-08-26T04:40:29Z","snapshot_observed_at":"2026-07-06T15:32:35.999476Z","submitted_at":"2023-05-24T14:31:20Z","title":"DiffBlender: Composable and Versatile Multimodal Text-to-Image Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15194","snapshot_observed_at":"2026-08-06T20:25:25.914025Z","title":"Diffblender: Scalable and composable multimodal text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-09T00:50:03.032034Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:25.914025Z"},"links":{"cited_paper":"/paper/2305.15194","citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:b1584b459f34418a33bda59e3ec3e6be031fd299932631a035de91d7261db33b","observation_id":"b8490783-78ba-40ff-bd46-73591113df79","resolution":{"observed_at":"2026-08-06T20:25:25.914025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09048","last_updated":"2024-01-17T08:30:47Z","snapshot_observed_at":"2026-08-06T18:16:18.072404Z","submitted_at":"2024-01-17T08:30:47Z","title":"Compose and Conquer: Diffusion-Based 3D Depth Aware Composable Image Synthesis","version":1},"cited_work":{"arxiv_id":"2401.09048","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.09048","snapshot_observed_at":"2026-08-06T20:25:29.799831Z","title":"Compose and Conquer: Diffusion-Based 3D Depth Aware Composable Image Synthesis","venue":"cs.CV","work_id":"b7cbf160-ce5b-488c-97df-afdb2f600c25","year":2024},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-09T00:50:03.032034Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:26.042201Z"},"links":{"cited_paper":"/paper/2401.09048","citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:6fceb9b3c3973bb530f794aba47b886ab617fe62b5cc246ef2f6a92ae714d71e","observation_id":"f0a79e52-683e-471f-834b-a8b00b4bf615","resolution":{"observed_at":"2026-08-06T20:25:29.851895Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15339","last_updated":"2024-06-21T17:55:05Z","snapshot_observed_at":"2026-07-06T18:35:00.245966Z","submitted_at":"2024-06-21T17:55:05Z","title":"Image Conductor: Precision Control for Interactive Video Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15339","snapshot_observed_at":"2026-08-06T20:25:26.170396Z","title":"Image conductor: Precision control for interactive video synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-09T00:50:03.032034Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:26.170396Z"},"links":{"cited_paper":"/paper/2406.15339","citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:d0c501ab70b89c415c986ebf40410a5529c22b6cc57387de72cb0c37b6b7d584","observation_id":"d3b52798-77ba-4689-a296-1a3266b80d7b","resolution":{"observed_at":"2026-08-06T20:25:26.170396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09711","last_updated":"2024-05-28T07:04:03Z","snapshot_observed_at":"2026-08-03T07:06:32.760790Z","submitted_at":"2023-10-15T02:39:25Z","title":"LOVECon: Text-driven Training-Free Long Video Editing with ControlNet","version":3},"cited_work":{"arxiv_id":"2310.09711","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.09711","snapshot_observed_at":"2026-08-06T20:25:29.661242Z","title":"LOVECon: Text-driven Training-Free Long Video Editing with ControlNet","venue":"cs.CV","work_id":"c79779fb-1e14-49e0-b756-ebe47dbc3c72","year":2023},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-09T00:50:03.032034Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:26.239158Z"},"links":{"cited_paper":"/paper/2310.09711","citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:be61daaf67eabdaa1a5b4c060275786252251703241db3c4c5a16806f74bf112","observation_id":"5feeba51-a878-426d-afe4-e1017b07d665","resolution":{"observed_at":"2026-08-06T20:25:29.716487Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:25:32.955112Z","title":"Trailblazer: Trajectory control for diffusion-based video generation","venue":null,"work_id":"74df7234-5695-4cf9-9a69-ad49ce885975","year":2024},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-09T00:50:03.032034Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:26.320914Z"},"links":{"citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:380c2bce11525fd99498e935349d57a3d8fd3ce6bf77a12869ab0ed6242e994b","observation_id":"00524d34-72b6-4ca3-a573-6b5d1407a5dc","resolution":{"observed_at":"2026-08-06T20:25:33.012633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:25:32.801683Z","title":"Some methods for classification and analysis of multivariate observations","venue":null,"work_id":"313f36a4-baf6-4cb2-b28e-54e828db8ba3","year":1967},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-09T00:50:03.032034Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:26.403459Z"},"links":{"citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:e36e13dd47b6458e441317992245aa75c7bcc6d2f71db4dba64fc563866fd188","observation_id":"e796bd06-2fb9-498a-8b85-e3ccb432bbb7","resolution":{"observed_at":"2026-08-06T20:25:32.881148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:25:32.655576Z","title":"Large-scale video panoptic segmentation in the wild: A benchmark","venue":null,"work_id":"68bd689b-4e55-42fb-860d-6072edc16025","year":2022},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-09T00:50:03.032034Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:26.474151Z"},"links":{"citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:b717176d1664c2670f408cd3a11dc0ce7e82105d024828d95929875bbeeae9fc","observation_id":"661d2f45-91d9-4fc7-9bda-a2cced54d8c5","resolution":{"observed_at":"2026-08-06T20:25:32.735514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:25:32.501136Z","title":"Freecontrol: Training-free spatial control of any text-to-image diffusion model with any condition","venue":null,"work_id":"d3ceed85-f15a-4bac-af75-06735e089ee8","year":2024},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-09T00:50:03.032034Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:26.553258Z"},"links":{"citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:8ae4f801bf580188acd96296b81dcc45a5c605ab24c9403b3b896fe7d4d4e171","observation_id":"d73ee21d-b3cd-43af-97c1-0bea7ea1e6ca","resolution":{"observed_at":"2026-08-06T20:25:32.562331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04989","last_updated":"2025-02-25T17:27:47Z","snapshot_observed_at":"2026-08-04T03:59:52.003288Z","submitted_at":"2024-11-07T18:56:11Z","title":"SG-I2V: Self-Guided Trajectory Control in Image-to-Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04989","snapshot_observed_at":"2026-08-06T20:25:26.611739Z","title":"Sg-i2v: Self-guided trajectory control in image-to-video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-09T00:50:03.032034Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:26.611739Z"},"links":{"cited_paper":"/paper/2411.04989","citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:fa4a97b636bc6275857b051ac7bf8cd95aef02c6bc3ecbe05bdfbd1f7b44b50d","observation_id":"8526d6aa-bf06-4f6b-85a0-d2c9887d5ca2","resolution":{"observed_at":"2026-08-06T20:25:26.611739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:25:32.337371Z","title":"Mofa-video: Controllable image animation via generative motion field adaptions in frozen image-to-video diffusion model","venue":null,"work_id":"673bc3ad-2c8d-4e1a-bb5f-d9c08f44e178","year":2024},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-09T00:50:03.032034Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:26.685839Z"},"links":{"citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:37bf47d1c72061e08e3dc8299b98171b59368c1f77fab1d7a54031009f6fa941","observation_id":"0afba912-7f85-4603-bfd0-d1ec67db126d","resolution":{"observed_at":"2026-08-06T20:25:32.433431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:25:32.165082Z","title":"Drag your gan: Interactive point-based manipulation on the generative image manifold","venue":null,"work_id":"27051190-7f40-4d6d-b10e-0c30de66f607","year":2023},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-09T00:50:03.032034Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:26.760190Z"},"links":{"citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:1ce44f04494a16c0261e5ffbcbff9c8313c2928e7bb428fbaa7decba73476fd0","observation_id":"92e86803-561b-43a2-b383-9cdfb26ad7d8","resolution":{"observed_at":"2026-08-06T20:25:32.218979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11147","last_updated":"2023-11-02T17:59:06Z","snapshot_observed_at":"2026-08-06T14:12:33.767391Z","submitted_at":"2023-05-18T17:41:34Z","title":"UniControl: A Unified Diffusion Model for Controllable Visual Generation In the Wild","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11147","snapshot_observed_at":"2026-08-06T20:25:26.818684Z","title":"Unicontrol: A unified diffusion model for controllable visual generation in the wild","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-09T00:50:03.032034Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:26.818684Z"},"links":{"cited_paper":"/paper/2305.11147","citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:51e5ae24581750c8806bb74bff72715e4f3a7614a07f2fd560c70d621ad29ea7","observation_id":"38b44cb9-bcc3-40a5-8436-4c7176e5d212","resolution":{"observed_at":"2026-08-06T20:25:26.818684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16863","last_updated":"2024-06-24T17:59:56Z","snapshot_observed_at":"2026-07-06T18:36:12.298104Z","submitted_at":"2024-06-24T17:59:56Z","title":"FreeTraj: Tuning-Free Trajectory Control in Video Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16863","snapshot_observed_at":"2026-08-06T20:25:26.881733Z","title":"Freetraj: Tuning-free trajectory control in video diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-09T00:50:03.032034Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:26.881733Z"},"links":{"cited_paper":"/paper/2406.16863","citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:9d70c99a4ef9b37d3e277d3c1d23cb871230660d4b222dd9905ecae3c83dcf86","observation_id":"42402254-5ab4-4997-be70-b199df2bf15c","resolution":{"observed_at":"2026-08-06T20:25:26.881733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:25:26.900124Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-09T00:50:03.032034Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:26.900124Z"},"links":{"citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:32980f9f0df22145cf2319fdc84eee9ca143dd99800d2539d676bc53adfc1322","observation_id":"baed88d4-efb6-4686-a27d-15a66c5355a1","resolution":{"observed_at":"2026-08-06T20:25:26.900124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:25:32.030701Z","title":"Motion-i2v: Consistent and controllable image-to-video generation with explicit motion modeling","venue":null,"work_id":"5c003880-678d-4f14-853f-b2827d85f63c","year":2024},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-09T00:50:03.032034Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:26.970264Z"},"links":{"citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:45f9da37745aca0bc734f60e40ac91df3f3931c3d7f8ff264d2db288e89c11b3","observation_id":"fd175d70-34e2-448a-b6f4-b2577bf1b0ce","resolution":{"observed_at":"2026-08-06T20:25:32.068727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:25:31.910721Z","title":"Dragdiffusion: Harnessing diffusion models for interactive point-based image editing","venue":null,"work_id":"9c3ab27b-dea0-4f61-b1eb-871ba6b940c6","year":2024},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-09T00:50:03.032034Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:27.078636Z"},"links":{"citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:7b624396ca1aca9f302175f87466fa6da62e015c2ac8100497d8217a96d9dd6f","observation_id":"15eb4f40-dd58-403c-b2c4-ed011779c61b","resolution":{"observed_at":"2026-08-06T20:25:31.963843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14555","last_updated":"2024-06-20T17:58:52Z","snapshot_observed_at":"2026-08-08T18:59:34.400882Z","submitted_at":"2024-06-20T17:58:52Z","title":"A Survey of Multimodal-Guided Image Editing with Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14555","snapshot_observed_at":"2026-08-06T20:25:27.267209Z","title":"A survey of multimodal-guided image editing with text-to-image diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-09T00:50:03.032034Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:27.267209Z"},"links":{"cited_paper":"/paper/2406.14555","citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:948ccfbc76b64d2af252abd6334d5b8e2ba8a111e309b041274f1c5ec9e54d02","observation_id":"40b743f7-bc70-444f-8b57-053c8fc6fc83","resolution":{"observed_at":"2026-08-06T20:25:27.267209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:25:27.408167Z","title":"Free-form motion control: A synthetic video generation dataset with controllable camera and object motions","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-09T00:50:03.032034Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:27.408167Z"},"links":{"citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:b7b5b634d5f451bab933213504d740da71d1eb6e65005b7c571d4bf677ac4e83","observation_id":"32df7593-0501-4d21-bc58-60be5e71da60","resolution":{"observed_at":"2026-08-06T20:25:27.408167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14792","last_updated":"2022-09-29T13:59:46Z","snapshot_observed_at":"2026-07-06T13:57:47.051387Z","submitted_at":"2022-09-29T13:59:46Z","title":"Make-A-Video: Text-to-Video Generation without Text-Video Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14792","snapshot_observed_at":"2026-08-06T20:25:27.446167Z","title":"Make-a-video: Text-to-video generation without text-video data","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-09T00:50:03.032034Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:27.446167Z"},"links":{"cited_paper":"/paper/2209.14792","citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:6936bfdda61b5622356f0843352a103dd383abc72341eb229671cc272afcfd74","observation_id":"d3201c98-aac7-4366-8a95-f8f259a0d87d","resolution":{"observed_at":"2026-08-06T20:25:27.446167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-07-06T10:01:50.133383Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-06T20:25:27.533479Z","title":"Denoising diffusion implicit models","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-09T00:50:03.032034Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:27.533479Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:c047b6767c99ad16e5bf662708992585f4a8a0dfaec699fb2a7183494e853d59","observation_id":"b5292019-0b83-4721-be2b-ae7ff2d5fb28","resolution":{"observed_at":"2026-08-06T20:25:27.533479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:25:31.744382Z","title":"Anycontrol: create your artwork with versatile control on text-to-image generation","venue":null,"work_id":"86016459-f6dc-451d-9d97-ef77d06534aa","year":2025},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-09T00:50:03.032034Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:27.623943Z"},"links":{"citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:81966891f2c6cfb5ec5c799eb381d19d239ad8c9879b228cc3a072168b09d6c7","observation_id":"f6a8d720-8439-483d-a44e-83d33bed5481","resolution":{"observed_at":"2026-08-06T20:25:31.798937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:25:31.592617Z","title":"Plug-and-play diffusion features for text-driven image-to-image translation","venue":null,"work_id":"dcd3f61e-1eb0-4ceb-a7e0-5f697b31e695","year":2023},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-09T00:50:03.032034Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:27.774197Z"},"links":{"citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:f3a77fe123d1918039254aa8fc29ac754b2e2fd6b6ccf328064dcb3eaa82f78c","observation_id":"27c0b93b-146f-400e-91c5-0aa28818b3fd","resolution":{"observed_at":"2026-08-06T20:25:31.654118Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06571","last_updated":"2023-08-12T13:53:10Z","snapshot_observed_at":"2026-08-10T01:52:30.999213Z","submitted_at":"2023-08-12T13:53:10Z","title":"ModelScope Text-to-Video Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06571","snapshot_observed_at":"2026-08-06T20:25:27.903864Z","title":"Modelscope text-to-video technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-09T00:50:03.032034Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:27.903864Z"},"links":{"cited_paper":"/paper/2308.06571","citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:637a8a8d13ca1b6fb69f368ed3a3d83431e688cf7cd0253265c8b9250452e842","observation_id":"d3771b2c-ec8f-4c5b-af71-83e19304621e","resolution":{"observed_at":"2026-08-06T20:25:27.903864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01566","last_updated":"2024-02-02T16:59:48Z","snapshot_observed_at":"2026-08-05T10:16:25.180895Z","submitted_at":"2024-02-02T16:59:48Z","title":"Boximator: Generating Rich and Controllable Motions for Video Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01566","snapshot_observed_at":"2026-08-06T20:25:28.032439Z","title":"Boximator: Generating rich and controllable motions for video synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-09T00:50:03.032034Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:28.032439Z"},"links":{"cited_paper":"/paper/2402.01566","citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:56ff52ee1c020cf6611258a856384d0fd92f4091a0daf5e0a612bd0aa0865fb9","observation_id":"ef2b81e3-e487-4b92-a6da-fb15b3fc5765","resolution":{"observed_at":"2026-08-06T20:25:28.032439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:25:31.441870Z","title":"Videocomposer: Compositional video synthesis with motion controllability","venue":null,"work_id":"c0dc1369-4202-43d4-9704-9c42c8a525cf","year":2024},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-09T00:50:03.032034Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:28.197918Z"},"links":{"citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:ddb0e6beaac55f0bee268cf82033ddcc8b7533c917ecea26e5bb815654d8408f","observation_id":"d856d6b6-8afc-4eee-a71d-a74b60ec6519","resolution":{"observed_at":"2026-08-06T20:25:31.526763Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:25:31.069240Z","title":"Lavie: High-quality video generation with cascaded latent diffusion models","venue":null,"work_id":"fd391ef8-614a-4c50-96a7-c37169892537","year":2024},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-09T00:50:03.032034Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:28.282240Z"},"links":{"citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:91166ebd650f361e382cef639aa4f28ae79e4d14190d76124a5b3aaf52facac5","observation_id":"37898861-1e15-4fec-b544-e391ee84143d","resolution":{"observed_at":"2026-08-06T20:25:31.177524Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.07721","last_updated":"2025-06-24T17:19:15Z","snapshot_observed_at":"2026-07-06T20:04:48.422043Z","submitted_at":"2024-12-10T18:14:30Z","title":"ObjCtrl-2.5D: Training-free Object Control with Camera Poses","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.07721","snapshot_observed_at":"2026-08-06T20:25:28.341243Z","title":"Objctrl-2.5 d: Training-free object control with camera poses","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-09T00:50:03.032034Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:28.341243Z"},"links":{"cited_paper":"/paper/2412.07721","citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:aa45f17de594d167eb8cd4e8570b72a50067b57d2ea77f42672d50b95c5ff2ae","observation_id":"c9840de4-56e8-4fd6-9acd-8ff050e23d5c","resolution":{"observed_at":"2026-08-06T20:25:28.341243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:25:30.799014Z","title":"Motionctrl: A unified and flexible motion controller for video generation","venue":null,"work_id":"ad8624fa-a3f3-4651-977f-894af90e9f3a","year":2024},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-09T00:50:03.032034Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:28.415133Z"},"links":{"citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:a90492cf7a24f17c7e609b8fa8abd4a5be8da35953be8a53558e5524e787e0f4","observation_id":"91b33beb-3f62-4ddb-969e-f0e49dd75f68","resolution":{"observed_at":"2026-08-06T20:25:30.904545Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:25:30.519420Z","title":"Principal component analysis","venue":null,"work_id":"99e29fbd-3dc8-4cbe-991c-f2d404f16a01","year":1987},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-09T00:50:03.032034Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:28.525885Z"},"links":{"citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:be337813001333f41478ffb528b7d7664a88705331dbd885f6be9ec91f88828e","observation_id":"396d7879-b606-43e1-a74c-6cba50ac1ae1","resolution":{"observed_at":"2026-08-06T20:25:30.631228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17758","last_updated":"2024-10-29T11:56:27Z","snapshot_observed_at":"2026-07-06T18:36:51.761148Z","submitted_at":"2024-06-25T17:42:25Z","title":"MotionBooth: Motion-Aware Customized Text-to-Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17758","snapshot_observed_at":"2026-08-06T20:25:28.608683Z","title":"Motionbooth: Motion-aware customized text-to-video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-09T00:50:03.032034Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:28.608683Z"},"links":{"cited_paper":"/paper/2406.17758","citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:f1076cac645c2195740959c00cee1acefa9017d3ebe2440448a0d63646006ecb","observation_id":"39f036ab-5588-464d-8392-59af76ab3bf2","resolution":{"observed_at":"2026-08-06T20:25:28.608683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:25:30.280878Z","title":"Draganything: Motion control for anything using entity representation","venue":null,"work_id":"b096c3db-cf06-4b2c-8971-a99616f4ff89","year":2024},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-09T00:50:03.032034Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:28.647601Z"},"links":{"citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:1058634b3ea55f8cc97e82ce950771b71b2ff9ea527b3d13b588bd38c24c521c","observation_id":"15b79da1-3c97-477f-b11c-507de6af68ec","resolution":{"observed_at":"2026-08-06T20:25:30.383936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14864","last_updated":"2024-11-12T01:31:41Z","snapshot_observed_at":"2026-07-06T18:18:51.814306Z","submitted_at":"2024-05-23T17:59:40Z","title":"Video Diffusion Models are Training-free Motion Interpreter and Controller","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14864","snapshot_observed_at":"2026-08-06T20:25:28.728755Z","title":"Video diffusion models are training-free motion interpreter and controller","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-09T00:50:03.032034Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:28.728755Z"},"links":{"cited_paper":"/paper/2405.14864","citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:e5612ba59bb02c08048c42f01dcfd81f1abee6fc888af34f20f63f18ab5baec5","observation_id":"d8787f87-8def-4463-8b24-f76278b73f0c","resolution":{"observed_at":"2026-08-06T20:25:28.728755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:25:28.790311Z","title":"Dynamicrafter: Animating open-domain images with video diffusion priors","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-09T00:50:03.032034Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:28.790311Z"},"links":{"citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:2b51fe3632c0721941619a35e8bffddb0d1260f1157b089a32f66a0d3a660e27","observation_id":"4ab67a9c-61ea-49c4-a657-7d1bc1f651b0","resolution":{"observed_at":"2026-08-06T20:25:28.790311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:25:30.000642Z","title":"Direct-a-video: Customized video generation with user- directed camera movement and object motion","venue":null,"work_id":"988f66eb-32de-413c-909f-3a7fffbfb0b4","year":2024},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-09T00:50:03.032034Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:28.847157Z"},"links":{"citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:56a0567cc3e2d38466407b9501620484af246ab3bf83358cfc302969763778bc","observation_id":"ec32a8f0-e334-4054-882a-570f449f538f","resolution":{"observed_at":"2026-08-06T20:25:30.116321Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.08089","last_updated":"2023-08-16T01:43:41Z","snapshot_observed_at":"2026-07-06T16:06:38.424057Z","submitted_at":"2023-08-16T01:43:41Z","title":"DragNUWA: Fine-grained Control in Video Generation by Integrating Text, Image, and Trajectory","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.08089","snapshot_observed_at":"2026-08-06T20:25:28.946126Z","title":"Dragnuwa: Fine-grained control in video generation by integrating text, image, and trajectory","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-09T00:50:03.032034Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:28.946126Z"},"links":{"cited_paper":"/paper/2308.08089","citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:aa284bb5c089675954a21b4e54df403aaf19ed6d97bfe1617f48b72a143905d3","observation_id":"695822a8-cc50-409c-8cf6-d9736a99a273","resolution":{"observed_at":"2026-08-06T20:25:28.946126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:25:28.992068Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-09T00:50:03.032034Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:28.992068Z"},"links":{"citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:5866032fc1975ba09c05e48987e7ebbab5be29035516acf702847d2cec44fef4","observation_id":"5b748225-0f62-4468-8f00-57e762518ba8","resolution":{"observed_at":"2026-08-06T20:25:28.992068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13077","last_updated":"2023-05-22T14:48:53Z","snapshot_observed_at":"2026-08-08T20:41:37.700266Z","submitted_at":"2023-05-22T14:48:53Z","title":"ControlVideo: Training-free Controllable Text-to-Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13077","snapshot_observed_at":"2026-08-06T20:25:29.057301Z","title":"Controlvideo: Training-free controllable text-to-video generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-09T00:50:03.032034Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:29.057301Z"},"links":{"cited_paper":"/paper/2305.13077","citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:e588d6d224d9d5199ceffe78c1edbb60f61fef23a753096368360e33905dd782","observation_id":"1dc34cde-99a8-4f00-8daa-3face3f52316","resolution":{"observed_at":"2026-08-06T20:25:29.057301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21705","last_updated":"2025-03-14T03:03:31Z","snapshot_observed_at":"2026-08-09T21:44:46.398850Z","submitted_at":"2024-07-31T15:53:20Z","title":"Tora: Trajectory-oriented Diffusion Transformer for Video Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21705","snapshot_observed_at":"2026-08-06T20:25:29.127199Z","title":"Tora: Trajectory-oriented diffusion transformer for video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-09T00:50:03.032034Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:29.127199Z"},"links":{"cited_paper":"/paper/2407.21705","citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:e827c2619f19d2517675ff11c5491cf686edc69c39a44fda917aee25ce4fe1b7","observation_id":"1351d6ee-1961-4baa-95d3-85db563283d7","resolution":{"observed_at":"2026-08-06T20:25:29.127199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11475","last_updated":"2025-01-05T08:45:44Z","snapshot_observed_at":"2026-07-06T19:03:56.484389Z","submitted_at":"2024-08-21T09:42:04Z","title":"TrackGo: A Flexible and Efficient Method for Controllable Video Generation","version":3},"cited_work":{"arxiv_id":"2408.11475","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.11475","snapshot_observed_at":"2026-08-06T20:25:29.329857Z","title":"TrackGo: A Flexible and Efficient Method for Controllable Video Generation","venue":"cs.CV","work_id":"e66c984b-afe4-41e9-ac6d-49a5696c0bc0","year":2024},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-09T00:50:03.032034Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:29.212390Z"},"links":{"cited_paper":"/paper/2408.11475","citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:7c510893b30bcc32498de7c14c350e3dd57898ba374c0069bf459ec4fad90190","observation_id":"cdcdc99d-47e6-4ea1-8476-9548690d5220","resolution":{"observed_at":"2026-08-06T20:25:29.416173Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T00:50:03.032034Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":29,"verified_exact":3,"verified_fuzzy":25},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 1 inbound Pith citation observation for arXiv:2507.02857."}