{"as_of":"2026-08-09T19:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9d689dcdb92a60dccef7897733f9c63c4b0efedb440e0da52401eb14fa5068a9","coverage":[{"denominator":100,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T19:40:21.496477Z","state":"measured"},{"denominator":111,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":111,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":11,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":11,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T12:31:41.897280Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T03:19:31.349497Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10059","snapshot_observed_at":"2026-08-08T12:31:41.897280Z","title":"Realcam- i2v: Real-world image-to-video generation with interactive complex camera control,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.07531","last_updated":"2026-06-17T07:15:21Z","snapshot_observed_at":"2026-08-08T15:16:55.431018Z","submitted_at":"2025-02-11T13:11:59Z","title":"VidCRAFT3: Camera, Object, and Lighting Control for Image-to-Video Generation","version":5},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-08T12:31:41.897280Z"},"links":{"cited_paper":"/paper/2502.10059","citing_paper":"/paper/2502.07531"},"observation_digest":"sha256:5050a8cc9ed8f21992cee42459f74b85d42d2f7ee5c29fad0c71b6efcc218cf5","observation_id":"eb297e61-b024-4be0-84f0-1d7d9bcf66e8","resolution":{"observed_at":"2026-08-08T12:31:41.897280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10059","snapshot_observed_at":"2026-08-07T13:28:12.000971Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21876","last_updated":"2026-05-28T08:11:37Z","snapshot_observed_at":"2026-08-07T13:18:12.902974Z","submitted_at":"2025-05-28T01:45:26Z","title":"EPiC: Efficient Video Camera Control Learning with Precise Anchor-Video Guidance","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T13:28:12.000971Z"},"links":{"cited_paper":"/paper/2502.10059","citing_paper":"/paper/2505.21876"},"observation_digest":"sha256:64b7f42a8aab8131ad4d6f92c6c7e7846913bdb5b74c497ddd8becde6b304e17","observation_id":"4fd54093-9559-4f49-94a6-720d161b4a10","resolution":{"observed_at":"2026-08-07T13:28:12.000971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10059","snapshot_observed_at":"2026-08-07T10:43:21.802720Z","title":"Realcam- i2v: Real-world image-to-video generation with interactive complex camera control.arXiv preprint arXiv:2502.10059, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.04590","last_updated":"2025-06-05T03:11:48Z","snapshot_observed_at":"2026-08-08T12:28:30.144231Z","submitted_at":"2025-06-05T03:11:48Z","title":"Follow-Your-Creation: Empowering 4D Creation through Video Inpainting","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T10:43:21.802720Z"},"links":{"cited_paper":"/paper/2502.10059","citing_paper":"/paper/2506.04590"},"observation_digest":"sha256:4ac9aed31c4f1d8f8d47a5de7a4195d9564dfe6b0e8e33d632794540136e2727","observation_id":"b85c2bbe-2a88-4409-9129-7586a1b45e37","resolution":{"observed_at":"2026-08-07T10:43:21.802720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10059","snapshot_observed_at":"2026-08-06T19:25:28.257406Z","title":"Realcam-i2v: Real-world image- to-video generation with interactive complex camera con- trol","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.05678","last_updated":"2025-07-08T05:00:17Z","snapshot_observed_at":"2026-08-06T19:17:57.988428Z","submitted_at":"2025-07-08T05:00:17Z","title":"LiON-LoRA: Rethinking LoRA Fusion to Unify Controllable Spatial and Temporal Generation for Video Diffusion","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:28.257406Z"},"links":{"cited_paper":"/paper/2502.10059","citing_paper":"/paper/2507.05678"},"observation_digest":"sha256:99f696b947976b9de73bab77f17fb5a6bb60266c0118d12516424b40b939c2c7","observation_id":"a2f7f41d-cd25-4ba8-b417-106690dcdd37","resolution":{"observed_at":"2026-08-06T19:25:28.257406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10059","snapshot_observed_at":"2026-08-03T21:01:08.294175Z","title":"Realcam-i2v: Real-world image-to- video generation with interactive complex camera control","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.17185","last_updated":"2026-05-29T08:17:11Z","snapshot_observed_at":"2026-08-03T21:01:05.108421Z","submitted_at":"2025-11-21T12:05:46Z","title":"PostCam: Camera-Controllable Novel-View Video Generation with Query-Shared Cross-Attention","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T21:01:08.294175Z"},"links":{"cited_paper":"/paper/2502.10059","citing_paper":"/paper/2511.17185"},"observation_digest":"sha256:b2c82348b4159a251a56d128e26904037dbaf7ad0489b17c11928b7295d73113","observation_id":"2802c1a3-9967-4d99-b519-26a9dde2b0aa","resolution":{"observed_at":"2026-08-03T21:01:08.294175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10059","snapshot_observed_at":"2026-08-03T18:26:34.566308Z","title":"Realcam-i2v: Real-world image- to-video generation with interactive complex camera control","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.05672","last_updated":"2026-07-06T07:23:46Z","snapshot_observed_at":"2026-08-04T17:03:44.669117Z","submitted_at":"2025-12-05T12:31:09Z","title":"InverseCrafter: Efficient Video ReCapture as a Latent Domain Inverse Problem","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T18:26:34.566308Z"},"links":{"cited_paper":"/paper/2502.10059","citing_paper":"/paper/2512.05672"},"observation_digest":"sha256:bf6558fa6621e3d839dc7e15672c7928401b3c2c9a9eae891941cc50be72f724","observation_id":"ef33dc2f-bb6f-4f78-9967-fc48a5c3fb65","resolution":{"observed_at":"2026-08-03T18:26:34.566308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"cited_work":{"arxiv_id":"2502.10059","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.10059","snapshot_observed_at":"2026-07-04T03:19:31.349497Z","title":"Realcam- i2v: Real-world image-to-video generation with interactive complex camera control","venue":null,"work_id":"8e79f659-4adf-449f-837c-d88b14005e60","year":2025},"citing_paper":{"arxiv_id":"2604.06010","last_updated":"2026-04-07T16:06:02Z","snapshot_observed_at":"2026-08-04T14:31:48.441764Z","submitted_at":"2026-04-07T16:06:02Z","title":"OmniCamera: A Unified Framework for Multi-task Video Generation with Arbitrary Camera Control","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T20:11:35.077141Z"},"links":{"cited_paper":"/paper/2502.10059","citing_paper":"/paper/2604.06010"},"observation_digest":"sha256:4addcb0dbb9be9f3a7ce2b312c667a3832a661ba6f9ea695e9a941d457579b9d","observation_id":"9a0d90f2-8fdd-44f7-8ea6-3bf884023211","resolution":{"observed_at":"2026-05-10T22:10:48.909442Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"cited_work":{"arxiv_id":"2502.10059","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.10059","snapshot_observed_at":"2026-07-04T03:19:31.349497Z","title":"Realcam- i2v: Real-world image-to-video generation with interactive complex camera control","venue":null,"work_id":"8e79f659-4adf-449f-837c-d88b14005e60","year":2025},"citing_paper":{"arxiv_id":"2604.07209","last_updated":"2026-04-13T13:03:18Z","snapshot_observed_at":"2026-07-06T22:55:28.855291Z","submitted_at":"2026-04-08T15:31:22Z","title":"INSPATIO-WORLD: A Real-Time 4D World Simulator via Spatiotemporal Autoregressive Modeling","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-10T19:08:56.588282Z"},"links":{"cited_paper":"/paper/2502.10059","citing_paper":"/paper/2604.07209"},"observation_digest":"sha256:22b324922af153ba16dd77a031d4addf3827053dbf1debd4fd693f9cdbdc90ad","observation_id":"65b0129b-ecc7-4841-a15c-0fd021e0a8a7","resolution":{"observed_at":"2026-05-10T23:25:53.451201Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"cited_work":{"arxiv_id":"2502.10059","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.10059","snapshot_observed_at":"2026-07-04T03:19:31.349497Z","title":"Realcam- i2v: Real-world image-to-video generation with interactive complex camera control","venue":null,"work_id":"8e79f659-4adf-449f-837c-d88b14005e60","year":2025},"citing_paper":{"arxiv_id":"2605.30855","last_updated":"2026-06-01T09:19:36Z","snapshot_observed_at":"2026-08-06T20:31:32.180972Z","submitted_at":"2026-05-29T05:21:33Z","title":"Robust Dreamer: Deviation-Aware Latent Gaussian Memory for Action-Controlled AR Video Generation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-28T22:56:35.530309Z"},"links":{"cited_paper":"/paper/2502.10059","citing_paper":"/paper/2605.30855"},"observation_digest":"sha256:ce8c2da4ac5a4469d7392fa0a1e257c542d050dc922550807ab0044e0c1de695","observation_id":"17d5dad0-6677-41d8-8786-4921c642a80a","resolution":{"observed_at":"2026-06-28T23:02:46.967200Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"cited_work":{"arxiv_id":"2502.10059","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.10059","snapshot_observed_at":"2026-07-04T03:19:31.349497Z","title":"Realcam- i2v: Real-world image-to-video generation with interactive complex camera control","venue":null,"work_id":"8e79f659-4adf-449f-837c-d88b14005e60","year":2025},"citing_paper":{"arxiv_id":"2606.01590","last_updated":"2026-06-01T02:37:56Z","snapshot_observed_at":"2026-08-02T14:53:31.726245Z","submitted_at":"2026-06-01T02:37:56Z","title":"Effective Multi-sensor Conditioning for Street-view Novel-view Synthesis","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-28T15:33:51.064212Z"},"links":{"cited_paper":"/paper/2502.10059","citing_paper":"/paper/2606.01590"},"observation_digest":"sha256:8058dad9e5001f846e4cc10d30fdde74e300be29fc7c4ce5c40eb9e07438bcb8","observation_id":"a7c8dee2-0acf-471f-b17a-7ad5edc1ff2f","resolution":{"observed_at":"2026-07-01T22:16:16.469884Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"cited_work":{"arxiv_id":"2502.10059","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.10059","snapshot_observed_at":"2026-07-04T03:19:31.349497Z","title":"Realcam- i2v: Real-world image-to-video generation with interactive complex camera control","venue":null,"work_id":"8e79f659-4adf-449f-837c-d88b14005e60","year":2025},"citing_paper":{"arxiv_id":"2606.20774","last_updated":"2026-06-18T16:07:05Z","snapshot_observed_at":"2026-08-02T15:04:03.513314Z","submitted_at":"2026-06-18T16:07:05Z","title":"TriMotion: Modality-Agnostic Camera Control for Video Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-26T18:11:49.696524Z"},"links":{"cited_paper":"/paper/2502.10059","citing_paper":"/paper/2606.20774"},"observation_digest":"sha256:23ac8fb971f917f4d2834e70765b63e5488bad5ed77683d6e306f4417c3310e8","observation_id":"bb39dbd6-6a6c-4fb4-97c3-400406696c18","resolution":{"observed_at":"2026-07-04T03:19:31.352039Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.10059/citation-record","integrity":"/paper/2502.10059/integrity","json":"/paper/2502.10059/citation-record.json","paper":"/paper/2502.10059"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.18673","last_updated":"2025-05-06T13:11:14Z","snapshot_observed_at":"2026-07-06T19:58:13.816588Z","submitted_at":"2024-11-27T18:49:13Z","title":"AC3D: Analyzing and Improving 3D Camera Control in Video Diffusion Transformers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.18673","snapshot_observed_at":"2026-08-07T19:40:21.137622Z","title":"Ac3d: Analyzing and improving 3d camera control in video diffusion trans- formers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.137622Z"},"links":{"cited_paper":"/paper/2411.18673","citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:8dfe5ee6a886905acbe5fa56a1bb409f7b1add0dec38f767a98e71d781d0ef8e","observation_id":"77cebbe8-1fb8-4f4e-ba6b-49c4bfe0614e","resolution":{"observed_at":"2026-08-07T19:40:21.137622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12781","last_updated":"2025-03-22T15:40:42Z","snapshot_observed_at":"2026-08-06T09:54:26.134418Z","submitted_at":"2024-07-17T17:59:05Z","title":"VD3D: Taming Large Video Diffusion Transformers for 3D Camera Control","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12781","snapshot_observed_at":"2026-08-07T19:40:21.142101Z","title":"Vd3d: Taming large video diffu- sion transformers for 3d camera control","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.142101Z"},"links":{"cited_paper":"/paper/2407.12781","citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:81f2f2c6b9cafb976b3ac44c01725816f536fb575507471abf907b03a65d13d7","observation_id":"e7eb67a3-55c2-429b-9ced-4c584a68a90b","resolution":{"observed_at":"2026-08-07T19:40:21.142101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04233","last_updated":"2024-05-07T11:52:49Z","snapshot_observed_at":"2026-08-09T05:07:43.521969Z","submitted_at":"2024-05-07T11:52:49Z","title":"Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04233","snapshot_observed_at":"2026-08-07T19:40:21.146056Z","title":"Vidu: a highly consistent, dynamic and skilled text-to-video generator with diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.146056Z"},"links":{"cited_paper":"/paper/2405.04233","citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:d80cc2aa870807c8b8c00437bd9fcb55e6602cc3695533f66027f3f741a91acf","observation_id":"fc8f9a49-89b8-4ed5-918f-0115d6e9b55d","resolution":{"observed_at":"2026-08-07T19:40:21.146056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-07T19:40:21.149980Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.149980Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:0d1ca28bad51e77343438026e82fb3a2faddd435771ec9048cd860b7b0eaf7ba","observation_id":"c64eb1dd-b605-4c30-9720-0d44fad4a11e","resolution":{"observed_at":"2026-08-07T19:40:21.149980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:40:21.153777Z","title":"Align your latents: High-resolution video synthe- sis with latent diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.153777Z"},"links":{"citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:20164651218a482a0afd7ce30a6ff2d498d47e87161d362f0fdf49fd43cd3870","observation_id":"0e811991-1879-48bc-8f75-667574d6422f","resolution":{"observed_at":"2026-08-07T19:40:21.153777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:40:21.157515Z","title":"Video generation models as world simulators","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.157515Z"},"links":{"citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:e1c8723d8e5e2b16beee05de7641fd213bf9a08a8d1cd191b0635ad2e355f89b","observation_id":"759ff2fc-00ec-40aa-a650-5e2d3ef91d99","resolution":{"observed_at":"2026-08-07T19:40:21.157515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08674","last_updated":"2024-07-11T17:06:53Z","snapshot_observed_at":"2026-08-08T19:58:33.185924Z","submitted_at":"2024-07-11T17:06:53Z","title":"Still-Moving: Customized Video Generation without Customized Video Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08674","snapshot_observed_at":"2026-08-07T19:40:21.160921Z","title":"Still-moving: Customized video generation without customized video data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.160921Z"},"links":{"cited_paper":"/paper/2407.08674","citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:ae8aa0ebfb745e141cb6a8c3181593458012be4754505955a5986e9806d22424","observation_id":"5bc15549-271e-4adb-9f99-87a909221389","resolution":{"observed_at":"2026-08-07T19:40:21.160921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10150","last_updated":"2025-01-08T15:15:12Z","snapshot_observed_at":"2026-07-06T17:17:27.444056Z","submitted_at":"2024-01-18T17:22:37Z","title":"Motion-Zero: Zero-Shot Moving Object Control Framework for Diffusion-Based Video Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10150","snapshot_observed_at":"2026-08-07T19:40:21.164960Z","title":"Motion-zero: Zero-shot mov- ing object control framework for diffusion-based video gen- eration","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.164960Z"},"links":{"cited_paper":"/paper/2401.10150","citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:caa27d76fb50e56a4246ea97c76788ef2604fbc3ef12d0a65c52a693012f1218","observation_id":"0d0eae9c-ecc7-4401-97c7-0d9e89fd77a8","resolution":{"observed_at":"2026-08-07T19:40:21.164960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19512","last_updated":"2023-10-30T13:12:40Z","snapshot_observed_at":"2026-08-07T10:15:15.859263Z","submitted_at":"2023-10-30T13:12:40Z","title":"VideoCrafter1: Open Diffusion Models for High-Quality Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19512","snapshot_observed_at":"2026-08-07T19:40:21.168551Z","title":"Videocrafter1: Open diffusion models for high-quality video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.168551Z"},"links":{"cited_paper":"/paper/2310.19512","citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:d31182abfc8856c5053c7a9eee174d53e702faf4a456f54ba73da1bf03a1f4d0","observation_id":"57c99bf9-18da-4ef2-b928-78e5db4d7753","resolution":{"observed_at":"2026-08-07T19:40:21.168551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:40:21.172166Z","title":"Videocrafter2: Overcoming data limitations for high-quality video diffu- sion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.172166Z"},"links":{"citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:34c7b401040aea31a18023a884f01bb32ada9d34da5770e8871971b0c7fa8937","observation_id":"fc3f29a8-8a31-460f-96a7-b928db82a5dd","resolution":{"observed_at":"2026-08-07T19:40:21.172166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04896","snapshot_observed_at":"2026-08-07T19:40:21.175552Z","title":"Goku: Flow based video genera- tive foundation models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.175552Z"},"links":{"cited_paper":"/paper/2502.04896","citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:73c44ed690699397b3c41ccd57b33ff630118553f085f90393de75add69f9abf","observation_id":"71b37e6c-4cb2-4c83-90b0-407a482a8972","resolution":{"observed_at":"2026-08-07T19:40:21.175552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:40:21.179119Z","title":"Panda-70m: Captioning 70m videos with multiple cross-modality teachers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.179119Z"},"links":{"citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:0e9d9981d1facfeeef206a3a16358f1e572264bb032d9eba59e43d50103ef3ff","observation_id":"d38edfe3-8b96-4468-9517-62860d17ad9e","resolution":{"observed_at":"2026-08-07T19:40:21.179119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:40:21.182314Z","title":"Seine: Short-to-long video diffu- sion model for generative transition and prediction","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.182314Z"},"links":{"citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:a0f6dface0cb91b3b9b66beb61ef6e3326e23788e4e81fe2de165e63673425b2","observation_id":"9138ad6d-57b2-4f78-b41e-530dda079b94","resolution":{"observed_at":"2026-08-07T19:40:21.182314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08453","last_updated":"2025-01-14T21:53:11Z","snapshot_observed_at":"2026-07-06T20:21:09.148018Z","submitted_at":"2025-01-14T21:53:11Z","title":"Vchitect-2.0: Parallel Transformer for Scaling Up Video Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.08453","snapshot_observed_at":"2026-08-07T19:40:21.185472Z","title":"Vchitect-2.0: Parallel transformer for scaling up video diffusion models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.185472Z"},"links":{"cited_paper":"/paper/2501.08453","citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:207278524bdbc3073b184ada7b268b1c3b25d8e816cbc13a22224c017b3e0ca1","observation_id":"728d888d-49af-4855-a942-ed157d68db7c","resolution":{"observed_at":"2026-08-07T19:40:21.185472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:40:21.188922Z","title":"I2vcontrol-camera: Precise video camera control with adjustable motion strength","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.188922Z"},"links":{"citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:3b82494c492cbc8c58713652314f61e92570698f5566c679c7764ec4bcac4730","observation_id":"15b7ee4b-08a9-405c-abb4-e70261789f03","resolution":{"observed_at":"2026-08-07T19:40:21.188922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05945","last_updated":"2024-06-13T11:13:39Z","snapshot_observed_at":"2026-07-06T18:12:13.931421Z","submitted_at":"2024-05-09T17:35:16Z","title":"Lumina-T2X: Transforming Text into Any Modality, Resolution, and Duration via Flow-based Large Diffusion Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05945","snapshot_observed_at":"2026-08-07T19:40:21.192239Z","title":"Lumina-t2x: Transforming text into any modality, resolution, and duration via flow-based large diffusion transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.192239Z"},"links":{"cited_paper":"/paper/2405.05945","citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:f6734649a7f2e7dd793e391795b48a7579a1d4a00ad8fe8af81f19e969692b6e","observation_id":"e6debad6-641c-428b-8ca2-12cf1f884dcf","resolution":{"observed_at":"2026-08-07T19:40:21.192239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:40:21.195702Z","title":"Preserve your own cor- relation: A noise prior for video diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.195702Z"},"links":{"citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:aae48d4433c943364d241c3933b47ea0b00675efe2aa86508e68047b916d85b5","observation_id":"d806d53c-648f-47bd-bce5-86a111f01613","resolution":{"observed_at":"2026-08-07T19:40:21.195702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10709","last_updated":"2024-08-02T18:55:25Z","snapshot_observed_at":"2026-08-02T11:56:15.393496Z","submitted_at":"2023-11-17T18:59:04Z","title":"Emu Video: Factorizing Text-to-Video Generation by Explicit Image Conditioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10709","snapshot_observed_at":"2026-08-07T19:40:21.199001Z","title":"Emu video: Factoriz- ing text-to-video generation by explicit image conditioning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.199001Z"},"links":{"cited_paper":"/paper/2311.10709","citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:c77080ed501e476164f1bde7dd8de7d96672955cca79a234e38fe7c18bf2f2a6","observation_id":"9622a6ce-725c-4a86-812f-9090e3a01a44","resolution":{"observed_at":"2026-08-07T19:40:21.199001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.01800","last_updated":"2024-03-05T08:19:51Z","snapshot_observed_at":"2026-08-07T13:32:19.731078Z","submitted_at":"2024-03-04T07:41:50Z","title":"AtomoVideo: High Fidelity Image-to-Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.01800","snapshot_observed_at":"2026-08-07T19:40:21.202281Z","title":"Atomovideo: High fidelity image-to-video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.202281Z"},"links":{"cited_paper":"/paper/2403.01800","citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:69f9673ac6f79b25e7ef81e5c1433d2bfdc77d408a2449fa487364a66f4e75bb","observation_id":"45717a7c-5bf4-459c-910e-38503dfee19a","resolution":{"observed_at":"2026-08-07T19:40:21.202281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04725","last_updated":"2024-02-08T18:08:57Z","snapshot_observed_at":"2026-07-06T15:52:13.602170Z","submitted_at":"2023-07-10T17:34:16Z","title":"AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04725","snapshot_observed_at":"2026-08-07T19:40:21.205920Z","title":"Animatediff: Animate your personalized text- to-image diffusion models without specific tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.205920Z"},"links":{"cited_paper":"/paper/2307.04725","citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:8e39e1551d18772eb58424b4612a27843328c5fbd2c3116d0184b7b91457161e","observation_id":"6dd8f1ff-4a0b-4703-aabb-4de5b202f25c","resolution":{"observed_at":"2026-08-07T19:40:21.205920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:40:21.209493Z","title":"Sparsectrl: Adding sparse controls to text-to-video diffusion models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.209493Z"},"links":{"citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:7b4fb30c1eba2911e08d13853a2b93b8a544ee2c8ad3a4d156f4870f2b7a4acd","observation_id":"4871a3b8-e7e7-40a4-9430-92da7f9dedc6","resolution":{"observed_at":"2026-08-07T19:40:21.209493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02101","last_updated":"2025-03-13T18:35:06Z","snapshot_observed_at":"2026-07-06T17:54:39.685251Z","submitted_at":"2024-04-02T16:52:41Z","title":"CameraCtrl: Enabling Camera Control for Text-to-Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02101","snapshot_observed_at":"2026-08-07T19:40:21.212934Z","title":"Cameractrl: En- abling camera control for text-to-video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.212934Z"},"links":{"cited_paper":"/paper/2404.02101","citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:43d7137cb93b83ce9e234b6d0a08dccbe1a21c13f7f4af2258293303d117aa3a","observation_id":"075082e0-8d28-4f7d-9ad6-7722792eb6b0","resolution":{"observed_at":"2026-08-07T19:40:21.212934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:40:21.216500Z","title":"Co-speech gesture video gen- eration via motion-decoupled diffusion model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.216500Z"},"links":{"citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:36028dae9b2d2e3c6468421d8b383db9007bd677cc3a972f263b257c470539c1","observation_id":"719e1c52-b55f-4995-b3d1-56c2468b6fa6","resolution":{"observed_at":"2026-08-07T19:40:21.216500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-08-07T19:40:21.220155Z","title":"Latent video diffusion models for high-fidelity long video generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.220155Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:8728d544336a874b9d1e0e4ce1e1176244a0ad66dad59a41cbe027f4622b0803","observation_id":"cc8139ed-5abd-4efe-83d7-dfb9ec101d90","resolution":{"observed_at":"2026-08-07T19:40:21.220155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10126","last_updated":"2025-02-25T00:32:29Z","snapshot_observed_at":"2026-08-07T18:45:05.745904Z","submitted_at":"2024-06-14T15:33:00Z","title":"Training-free Camera Control for Video Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10126","snapshot_observed_at":"2026-08-07T19:40:21.223995Z","title":"Training-free camera control for video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.223995Z"},"links":{"cited_paper":"/paper/2406.10126","citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:ecf851fd694116a3cf5277e73821a5c1d7428328213fb8cda21976fb3f392d42","observation_id":"e95a7490-3159-49f1-bc76-611408f228f6","resolution":{"observed_at":"2026-08-07T19:40:21.223995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-07T19:40:21.227679Z","title":"Lora: Low-rank adaptation of large language models.arXiv preprint arXiv:2106.09685, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.227679Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:a4093b0f941a7e3d687456e2cbe88d91f9e870234abea9e6fd24ebed5dfa93be","observation_id":"cd6a1001-c8ae-43c5-9770-165fbbe83119","resolution":{"observed_at":"2026-08-07T19:40:21.227679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:40:21.231056Z","title":"Animate anyone: Consistent and controllable image-to-video synthesis for character animation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.231056Z"},"links":{"citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:8e11442bd589fb75fbfea15467b21dcf7c1591452fae97edea38fcc7bdab080a","observation_id":"5815411c-452d-4b29-923b-1a95f02d04d2","resolution":{"observed_at":"2026-08-07T19:40:21.231056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:40:21.234457Z","title":"Metric3d v2: A versatile monocular geomet- ric foundation model for zero-shot metric depth and surface normal estimation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.234457Z"},"links":{"citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:7ac24172bb5ded8989eed437eac07c0a842be1ea16b8914b02dec0566e72852e","observation_id":"0e830ffd-1f08-4662-a734-bcc531c2ffcd","resolution":{"observed_at":"2026-08-07T19:40:21.234457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.15789","last_updated":"2024-05-01T02:37:18Z","snapshot_observed_at":"2026-07-06T18:04:54.726338Z","submitted_at":"2024-04-24T10:28:54Z","title":"MotionMaster: Training-free Camera Motion Transfer For Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.15789","snapshot_observed_at":"2026-08-07T19:40:21.237795Z","title":"Mo- tionmaster: Training-free camera motion transfer for video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.237795Z"},"links":{"cited_paper":"/paper/2404.15789","citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:c09b0fc565336adb2559648644eafbfc0d409e9e17ccab9a7ed2f18f41c3b06c","observation_id":"f323cac7-4d87-4403-93d4-784e78d0f728","resolution":{"observed_at":"2026-08-07T19:40:21.237795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13503","last_updated":"2024-11-20T17:54:41Z","snapshot_observed_at":"2026-07-06T19:53:17.024873Z","submitted_at":"2024-11-20T17:54:41Z","title":"VBench++: Comprehensive and Versatile Benchmark Suite for Video Generative Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13503","snapshot_observed_at":"2026-08-07T19:40:21.241441Z","title":"Vbench++: Comprehensive and versatile bench- mark suite for video generative models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.241441Z"},"links":{"cited_paper":"/paper/2411.13503","citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:129004ac6d263e8331d91c08a6b5b13c245a09e77beb3538dbdc6d736e0b1c04","observation_id":"c8ff900c-1987-4a7d-8947-af3cd03e90ef","resolution":{"observed_at":"2026-08-07T19:40:21.241441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:40:21.245043Z","title":"Peekaboo: Interactive video generation via masked- diffusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.245043Z"},"links":{"citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:7f4722762c872a71f045697290ced1d8377406122f75b1176774796f7ff0de35","observation_id":"ee40d91d-1295-47c1-8864-213f98065797","resolution":{"observed_at":"2026-08-07T19:40:21.245043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:40:21.248535Z","title":"A survey of multimodal con- trollable diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.248535Z"},"links":{"citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:2fa0f7fa73a5117763601e5292fbfa15e76200c214ab9a1c0746d8b16b2a4044","observation_id":"a3da4e02-038c-41bc-8ef2-455755da4025","resolution":{"observed_at":"2026-08-07T19:40:21.248535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:40:21.252052Z","title":"Videobooth: Diffusion-based video generation with image prompts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.252052Z"},"links":{"citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:3e88244e2c48e90d650de4e820a7b344fbdc779b3ad7ff9c7ac79ba12e9f5002","observation_id":"d7e11437-28b1-45f9-906e-4bc664832cbe","resolution":{"observed_at":"2026-08-07T19:40:21.252052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:40:21.255538Z","title":"Miradata: A large-scale video dataset with long du- rations and structured captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.255538Z"},"links":{"citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:52d586243063297f1b0b3be1a617a01a59f0ce42de973d570b640f1018c346c6","observation_id":"b4e0806e-0fa6-4a76-9cd1-d73db307a1b6","resolution":{"observed_at":"2026-08-07T19:40:21.255538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-07T19:40:21.258855Z","title":"Hunyuanvideo: A systematic frame- work for large video generative models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.258855Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:38edafa856c45e0a43d8984c0dd014290cbcf119f758fb1bbe9ef03a0a969c00","observation_id":"7f06eeb3-e551-4eaf-ab12-0464c2dea9bd","resolution":{"observed_at":"2026-08-07T19:40:21.258855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17414","last_updated":"2024-05-27T17:58:01Z","snapshot_observed_at":"2026-07-06T18:20:44.070255Z","submitted_at":"2024-05-27T17:58:01Z","title":"Collaborative Video Diffusion: Consistent Multi-video Generation with Camera Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17414","snapshot_observed_at":"2026-08-07T19:40:21.262469Z","title":"Collaborative video diffusion: Consistent multi- video generation with camera control","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.262469Z"},"links":{"cited_paper":"/paper/2405.17414","citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:15756873fe41f6e51ebb5d8b247040673e898e15803d6e56526c579791b8bf7e","observation_id":"2d61fcb1-2184-450e-b769-452b7154191a","resolution":{"observed_at":"2026-08-07T19:40:21.262469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17048","last_updated":"2025-03-16T01:40:29Z","snapshot_observed_at":"2026-07-06T19:57:01.568072Z","submitted_at":"2024-11-26T02:25:38Z","title":"PersonalVideo: High ID-Fidelity Video Customization without Dynamic and Semantic Degradation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17048","snapshot_observed_at":"2026-08-07T19:40:21.266003Z","title":"Personalvideo: High id-fidelity video customization without dynamic and semantic degradation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.266003Z"},"links":{"cited_paper":"/paper/2411.17048","citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:9e3cd947d567b7a22bc30169f2b94dc5340dc3462b97f6acbc644baec95ef810","observation_id":"dce6cb94-f616-4f80-842c-bdedf90af48d","resolution":{"observed_at":"2026-08-07T19:40:21.266003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15339","last_updated":"2024-06-21T17:55:05Z","snapshot_observed_at":"2026-07-06T18:35:00.245966Z","submitted_at":"2024-06-21T17:55:05Z","title":"Image Conductor: Precision Control for Interactive Video Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15339","snapshot_observed_at":"2026-08-07T19:40:21.269776Z","title":"Image conductor: Precision control for interactive video synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.269776Z"},"links":{"cited_paper":"/paper/2406.15339","citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:be871fe63f5c9406afa5e4660fea72fe31eddebd454b12888826475e62d4a85d","observation_id":"fdba3d11-0cf8-4dba-ae86-822f6a9c9091","resolution":{"observed_at":"2026-08-07T19:40:21.269776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:40:21.273439Z","title":"Generative image dynamics","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.273439Z"},"links":{"citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:4fc96b1709c61baafd7eed77da6464e72903205450fcfe34cab5e74866f07bd9","observation_id":"41d8fc9a-2c5d-4718-aa95-f5fda2284eb5","resolution":{"observed_at":"2026-08-07T19:40:21.273439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00131","last_updated":"2024-11-28T14:07:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-28T14:07:45Z","title":"Open-Sora Plan: Open-Source Large Video Generation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00131","snapshot_observed_at":"2026-08-07T19:40:21.276932Z","title":"Open-sora plan: Open-source large video generation model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.276932Z"},"links":{"cited_paper":"/paper/2412.00131","citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:b1e4c1d31543ce16a3c3c8eab189339ed6a0b76f0d8a4d44e3c1c22f26a889a9","observation_id":"f644a4f8-ae2f-453d-bb8b-fbfabe940d36","resolution":{"observed_at":"2026-08-07T19:40:21.276932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10248","snapshot_observed_at":"2026-08-07T19:40:21.280872Z","title":"Step-video-t2v technical report: The practice, challenges, and future of video foun- dation model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.280872Z"},"links":{"cited_paper":"/paper/2502.10248","citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:0ed097e49f78da01dde84e0250a634eedaad024db2b5e9e5a5d0a2bffbdba982","observation_id":"92578637-7967-47d2-9a25-f3486182c2dc","resolution":{"observed_at":"2026-08-07T19:40:21.280872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.03048","last_updated":"2025-05-01T09:40:21Z","snapshot_observed_at":"2026-08-02T13:01:06.918463Z","submitted_at":"2024-01-05T19:55:15Z","title":"Latte: Latent Diffusion Transformer for Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.03048","snapshot_observed_at":"2026-08-07T19:40:21.284372Z","title":"Latte: Latent diffusion transformer for video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.284372Z"},"links":{"cited_paper":"/paper/2401.03048","citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:718dad5df3467f2db414cb826a80b67d01ee95330f033c0138faef385046a424","observation_id":"2dde68cd-b4dc-42fc-b14b-8cb00a04c232","resolution":{"observed_at":"2026-08-07T19:40:21.284372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:40:21.287947Z","title":"Follow your pose: Pose- guided text-to-video generation using pose-free videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.287947Z"},"links":{"citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:fe245db5380b2b658dd4722ba96f0d565564e5c9e1696f6d728e13a39a9f681d","observation_id":"d630fbb2-fffc-4faf-9476-b0227081ac6f","resolution":{"observed_at":"2026-08-07T19:40:21.287947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.01073","last_updated":"2022-01-05T00:07:35Z","snapshot_observed_at":"2026-08-08T06:35:17.078531Z","submitted_at":"2021-08-02T17:59:47Z","title":"SDEdit: Guided Image Synthesis and Editing with Stochastic Differential Equations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.01073","snapshot_observed_at":"2026-08-07T19:40:21.291125Z","title":"Sdedit: Guided image synthesis and editing with stochastic differential equations","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.291125Z"},"links":{"cited_paper":"/paper/2108.01073","citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:b475e063f4b0f939cca3e0551d10f469cc69e6e17a49d7fcdcc71e10ee264a1c","observation_id":"471666e3-f3cd-4d89-b600-e4001e3b8578","resolution":{"observed_at":"2026-08-07T19:40:21.291125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:40:21.294654Z","title":"T2i-adapter: Learn- ing adapters to dig out more controllable ability for text-to- image diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.294654Z"},"links":{"citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:5f58ee52d3d050450ce52219a98919381d41cb2ce38a8141ec80e1284fd0e1fc","observation_id":"c4528bdd-154a-4051-912c-5b0ef2727bd1","resolution":{"observed_at":"2026-08-07T19:40:21.294654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04989","last_updated":"2025-02-25T17:27:47Z","snapshot_observed_at":"2026-08-04T03:59:52.003288Z","submitted_at":"2024-11-07T18:56:11Z","title":"SG-I2V: Self-Guided Trajectory Control in Image-to-Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04989","snapshot_observed_at":"2026-08-07T19:40:21.297879Z","title":"Sg-i2v: Self- guided trajectory control in image-to-video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.297879Z"},"links":{"cited_paper":"/paper/2411.04989","citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:7a1b0a5463d73dd10a3ffbaa15b34509f8dac295f2fdbe2311a31864c34f5ebf","observation_id":"3ccbef77-c1a9-4f94-8bca-cc28a06ab00a","resolution":{"observed_at":"2026-08-07T19:40:21.297879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02371","last_updated":"2025-02-13T10:13:24Z","snapshot_observed_at":"2026-08-07T10:03:56.902190Z","submitted_at":"2024-07-02T15:40:29Z","title":"OpenVid-1M: A Large-Scale High-Quality Dataset for Text-to-video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02371","snapshot_observed_at":"2026-08-07T19:40:21.301552Z","title":"Openvid-1m: A large-scale high-quality dataset for text-to- video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.301552Z"},"links":{"cited_paper":"/paper/2407.02371","citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:961402e0cbdffa9cfcaa63d96641bf0b6870cc8415d11b8646705e01e492952a","observation_id":"ca0397db-64f4-46a6-bc9f-5bbbeef28a49","resolution":{"observed_at":"2026-08-07T19:40:21.301552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:40:21.305580Z","title":"Global Structure-from-Motion Revisited","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.305580Z"},"links":{"citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:7ab88102031cbbe611c44f725807bbff863713a2b4ca1b8649f411c69259be4e","observation_id":"c7c71467-c0af-42fe-9daf-7b3a9b4df3e0","resolution":{"observed_at":"2026-08-07T19:40:21.305580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:40:21.309099Z","title":"Scalable diffusion mod- els with transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.309099Z"},"links":{"citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:902884502c8f1155531884367cfb4954639e208644c0bbfa609fe062210e583b","observation_id":"352b8391-84ca-4333-8a04-be163cd6119c","resolution":{"observed_at":"2026-08-07T19:40:21.309099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06070","last_updated":"2025-03-08T08:43:03Z","snapshot_observed_at":"2026-07-06T18:59:34.520274Z","submitted_at":"2024-08-12T11:41:18Z","title":"ControlNeXt: Powerful and Efficient Control for Image and Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06070","snapshot_observed_at":"2026-08-07T19:40:21.312673Z","title":"Controlnext: Powerful and effi- cient control for image and video generation.arXiv preprint arXiv:2408.06070, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.312673Z"},"links":{"cited_paper":"/paper/2408.06070","citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:47421766f5bcf9da55884264c026c397fb928dc7bfa9a4871e0dc27e5ecc68cb","observation_id":"445efcdd-69d7-43db-99a4-7eb21f814ec5","resolution":{"observed_at":"2026-08-07T19:40:21.312673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-07T19:40:21.316366Z","title":"Sdxl: Improving latent diffusion mod- els for high-resolution image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.316366Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:182c307326c90fe0e0e3483bbbf692a89b803f0aad8b3dc754e67dcfb6c7a957","observation_id":"0674dd69-5565-4487-a73c-8795119858f5","resolution":{"observed_at":"2026-08-07T19:40:21.316366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-07T19:40:21.320165Z","title":"Hierarchical text-conditional image generation with clip latents","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.320165Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:848606d3c80c8502df0457d72878cbdfff825aea05f22529ff68731a5c708924","observation_id":"ceefe584-122d-4b46-8a3a-8b53aa2f4cf5","resolution":{"observed_at":"2026-08-07T19:40:21.320165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:40:21.323756Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.323756Z"},"links":{"citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:d372036b68dfc2c2157edbb3bba3a5f152c8e08cd1f538f7181f8e1cf24f3ec9","observation_id":"92310b51-b8f1-41d3-9fe3-d1105a80e3d1","resolution":{"observed_at":"2026-08-07T19:40:21.323756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:40:22.341514Z","title":"Structure-from-motion revisited","venue":null,"work_id":"8ed98f33-2ef7-463e-8f7c-1ad3b76146f5","year":2016},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.327109Z"},"links":{"citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:a0b6f0445a1884e72246f4855cd38d9540f0f2a62441faa91474c8d85b308f62","observation_id":"6ac708ad-ffce-4b1f-86fb-51f8049d6741","resolution":{"observed_at":"2026-08-07T19:40:22.345462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08994","last_updated":"2025-01-15T18:20:37Z","snapshot_observed_at":"2026-08-09T09:07:55.826536Z","submitted_at":"2025-01-15T18:20:37Z","title":"RepVideo: Rethinking Cross-Layer Representation for Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.08994","snapshot_observed_at":"2026-08-07T19:40:21.330519Z","title":"Repvideo: Rethinking cross- layer representation for video generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.330519Z"},"links":{"cited_paper":"/paper/2501.08994","citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:8c8ba055ba8010616acb5d39aadb43f98cbcbed6d59b28243094f673ad504d23","observation_id":"eceadd37-142c-48c2-81f5-6f7e03fa6a06","resolution":{"observed_at":"2026-08-07T19:40:21.330519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-07-06T10:01:50.133383Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-07T19:40:21.334218Z","title":"Denoising diffusion implicit models","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.334218Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:8e5ad6685df0daf3988a29d0d3a05d81d0d964a688abe74f5d3e7557d7bce536","observation_id":"68faeff1-a8fd-46bc-a9c7-1d4190497480","resolution":{"observed_at":"2026-08-07T19:40:21.334218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05674","last_updated":"2024-04-08T16:55:49Z","snapshot_observed_at":"2026-08-05T11:14:17.753389Z","submitted_at":"2024-04-08T16:55:49Z","title":"MoMA: Multimodal LLM Adapter for Fast Personalized Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05674","snapshot_observed_at":"2026-08-07T19:40:21.337688Z","title":"Moma: Multimodal llm adapter for fast personalized image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.337688Z"},"links":{"cited_paper":"/paper/2404.05674","citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:bb9aad063517a255138c94edec0a80b6098eeb026cdcca0dad82625ce1a012ce","observation_id":"2d978e6d-4aef-4caf-8beb-6d2ab1decf14","resolution":{"observed_at":"2026-08-07T19:40:21.337688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:40:21.341368Z","title":"Any-to-any generation via composable diffusion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.341368Z"},"links":{"citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:bb2e0aa6b0dd1b21823e13fee4cc44cde5581aa2fd02e1bea3fed88a7729038e","observation_id":"0b363525-2c69-4260-8b41-8ccd5bc04a59","resolution":{"observed_at":"2026-08-07T19:40:21.341368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17485","last_updated":"2024-08-08T03:48:38Z","snapshot_observed_at":"2026-07-06T17:36:11.854303Z","submitted_at":"2024-02-27T13:10:11Z","title":"EMO: Emote Portrait Alive -- Generating Expressive Portrait Videos with Audio2Video Diffusion Model under Weak Conditions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17485","snapshot_observed_at":"2026-08-07T19:40:21.344685Z","title":"Emo: Emote portrait alive-generating expressive portrait videos with audio2video diffusion model under weak conditions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.344685Z"},"links":{"cited_paper":"/paper/2402.17485","citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:7ff424fa73ec2dfc528e19f5f664819bf2d7e1316dff471a1e2fbd9c6e3b150f","observation_id":"0c4b4348-9a3a-4e09-84a6-87f878e649c7","resolution":{"observed_at":"2026-08-07T19:40:21.344685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:40:22.323039Z","title":"Consistent view syn- thesis with pose-guided diffusion models","venue":null,"work_id":"47acf10c-c259-405e-975e-c4029ac3541e","year":2023},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.348551Z"},"links":{"citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:4830aff70ebd18bd42d7f35832976a39e0ffa7789cac0e42bd7ba71409dbe0f1","observation_id":"84cbb3cc-044a-4d10-adc1-1dbb89de3f81","resolution":{"observed_at":"2026-08-07T19:40:22.326878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.01717","last_updated":"2019-03-27T16:43:17Z","snapshot_observed_at":"2026-07-06T07:19:11.957225Z","submitted_at":"2018-12-03T03:57:42Z","title":"Towards Accurate Generative Models of Video: A New Metric & Challenges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.01717","snapshot_observed_at":"2026-08-07T19:40:21.352134Z","title":"Towards accurate generative models of video: A new met- ric & challenges","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.352134Z"},"links":{"cited_paper":"/paper/1812.01717","citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:86b0b69d3b548cdb19d78f0035177787ecec63f47e98b8f83ceef6e26db2de76","observation_id":"2f1f1ecb-5278-42e0-bf16-2248f1e40caf","resolution":{"observed_at":"2026-08-07T19:40:21.352134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06571","last_updated":"2023-08-12T13:53:10Z","snapshot_observed_at":"2026-08-07T17:54:54.749604Z","submitted_at":"2023-08-12T13:53:10Z","title":"ModelScope Text-to-Video Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06571","snapshot_observed_at":"2026-08-07T19:40:21.355794Z","title":"Modelscope text-to-video technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.355794Z"},"links":{"cited_paper":"/paper/2308.06571","citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:6377980a301105fba5b40f28254222d2c5e1f163c0b255e4772271fc5ed2da1c","observation_id":"f38fcef3-8223-451d-ae8e-1ea0b3776240","resolution":{"observed_at":"2026-08-07T19:40:21.355794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08260","last_updated":"2025-04-26T17:58:24Z","snapshot_observed_at":"2026-08-01T11:16:30.883699Z","submitted_at":"2024-10-10T17:57:49Z","title":"Koala-36M: A Large-scale Video Dataset Improving Consistency between Fine-grained Conditions and Video Content","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08260","snapshot_observed_at":"2026-08-07T19:40:21.359520Z","title":"Koala-36m: A large-scale video dataset improving consistency between fine-grained conditions and video content","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.359520Z"},"links":{"cited_paper":"/paper/2410.08260","citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:12c4e42336dbe8754ac0a9df2bd1b2986cb6cbd6c7a936034956a9cb93a210dd","observation_id":"0795e7db-6fae-45d7-a184-52ade494cd94","resolution":{"observed_at":"2026-08-07T19:40:21.359520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:40:22.312591Z","title":"Disco: Disentangled control for referring hu- man dance generation in real world","venue":null,"work_id":"39d86389-a11f-4b10-bc62-be04a4d2ab2c","year":2023},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.363957Z"},"links":{"citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:c04b2dc7a8487bb5a412e2281835462550150ca8eac1062aa4c7820db4c00422","observation_id":"a712b159-e72f-445d-8911-9c6c8257ad53","resolution":{"observed_at":"2026-08-07T19:40:22.316353Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:40:22.301742Z","title":"Videofactory: Swap attention in spatiotemporal diffusions for text-to-video gen- eration, 2024","venue":null,"work_id":"f9fe05da-364d-4fe7-b472-6219727b387e","year":2024},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.367130Z"},"links":{"citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:1035b38c742817af39cbcae411f5d3c957418fcb4aadffab4b75f28a24ad4ff4","observation_id":"fe18a473-9fe0-4591-ae46-24a6c1a77d8f","resolution":{"observed_at":"2026-08-07T19:40:22.305572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:40:22.291427Z","title":"Videocomposer: Compositional video syn- thesis with motion controllability","venue":null,"work_id":"10fa0912-d3a0-4843-aab5-5e1ee866d6a9","year":2024},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.370449Z"},"links":{"citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:2efab57ff2843f90e816ee8e96d2a08a3600645331cb8d1fba0b9a568f5071f0","observation_id":"47dc2786-b64c-423f-b964-a6fc08069ee0","resolution":{"observed_at":"2026-08-07T19:40:22.294954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15103","last_updated":"2023-09-27T03:51:52Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:52:03Z","title":"LAVIE: High-Quality Video Generation with Cascaded Latent Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15103","snapshot_observed_at":"2026-08-07T19:40:21.373762Z","title":"Lavie: High-quality video genera- tion with cascaded latent diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.373762Z"},"links":{"cited_paper":"/paper/2309.15103","citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:fba9f308c8fb1a9bc4d806df0008eae09101680cc8f13bf364d74c530ce3282a","observation_id":"12cab16c-7ac8-40d9-b8db-565f0e2572f1","resolution":{"observed_at":"2026-08-07T19:40:21.373762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:40:21.377294Z","title":"Customvideo: Customizing text- to-video generation with multiple subjects","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.377294Z"},"links":{"citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:6bbb33cac7cfb5bc4b92a01efac6bdacf7475d1ed2e58afba63936ada58b9522","observation_id":"8c8b5d87-2b3a-442d-b509-68657c1339f9","resolution":{"observed_at":"2026-08-07T19:40:21.377294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:40:22.281123Z","title":"Motionctrl: A unified and flexible motion controller for video generation","venue":null,"work_id":"be74c482-1f26-44a6-a096-cc2368eac21d","year":2024},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.380373Z"},"links":{"citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:b6432ba710c8aed1fa1ae7610e04e0c9da4a75b4b28f88e32223e85dbf3e770e","observation_id":"559cbab4-92cc-4888-9c29-834249ac51ee","resolution":{"observed_at":"2026-08-07T19:40:22.284988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07860","last_updated":"2025-04-20T04:48:38Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:23:33Z","title":"Controlling Space and Time with Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07860","snapshot_observed_at":"2026-08-07T19:40:21.383547Z","title":"Controlling space and time with diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.383547Z"},"links":{"cited_paper":"/paper/2407.07860","citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:2ff3672c14416d585b039b5c0349c86da6ccb3d9cf3c7ae124e7a9f98b5f3c79","observation_id":"1457c665-5c49-4b48-8c48-42fdf71d3af0","resolution":{"observed_at":"2026-08-07T19:40:21.383547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17758","last_updated":"2024-10-29T11:56:27Z","snapshot_observed_at":"2026-07-06T18:36:51.761148Z","submitted_at":"2024-06-25T17:42:25Z","title":"MotionBooth: Motion-Aware Customized Text-to-Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17758","snapshot_observed_at":"2026-08-07T19:40:21.387136Z","title":"Motionbooth: Motion-aware customized text-to- video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.387136Z"},"links":{"cited_paper":"/paper/2406.17758","citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:38bd7a31a5a7fce9edba7b1c410994f9c50c3a07b9d4cedd90e5974834b1586b","observation_id":"2c3e4e67-a0b9-42eb-9399-72863f46e516","resolution":{"observed_at":"2026-08-07T19:40:21.387136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:40:21.390749Z","title":"Spherediffusion: Spherical geometry-aware distortion resilient diffusion model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.390749Z"},"links":{"citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:05851fcf5376b6434da201914e5d27ee7fb5d2832e2233d735fb3591e1bc8354","observation_id":"8a1d03f8-c7ce-4ddb-848a-c0e3d47c09b0","resolution":{"observed_at":"2026-08-07T19:40:21.390749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19645","last_updated":"2024-12-30T02:50:45Z","snapshot_observed_at":"2026-07-06T20:13:40.548345Z","submitted_at":"2024-12-27T13:49:25Z","title":"VideoMaker: Zero-shot Customized Video Generation with the Inherent Force of Video Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19645","snapshot_observed_at":"2026-08-07T19:40:21.394334Z","title":"Videomaker: Zero-shot customized video generation with the inherent force of video diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.394334Z"},"links":{"cited_paper":"/paper/2412.19645","citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:3a75245897f1ea80b03de2f771cf0bc92d8a8111464ed9908f0c39bf58b05be5","observation_id":"3032288c-c5d5-45b8-9240-017192d0beeb","resolution":{"observed_at":"2026-08-07T19:40:21.394334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13239","last_updated":"2024-12-27T13:58:39Z","snapshot_observed_at":"2026-08-06T22:56:59.304423Z","submitted_at":"2024-08-23T17:26:06Z","title":"CustomCrafter: Customized Video Generation with Preserving Motion and Concept Composition Abilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.13239","snapshot_observed_at":"2026-08-07T19:40:21.397928Z","title":"Customcrafter: Customized video generation with pre- serving motion and concept composition abilities","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.397928Z"},"links":{"cited_paper":"/paper/2408.13239","citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:51eb30d14368a63d903bdbbd285eaa8140958e7b21a2f7be03147ceafd3fca1d","observation_id":"b4d0a053-9bd3-4269-bd8e-3d3ff2bffe38","resolution":{"observed_at":"2026-08-07T19:40:21.397928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.08240","last_updated":"2024-11-06T13:03:20Z","snapshot_observed_at":"2026-08-06T07:05:06.994888Z","submitted_at":"2024-09-12T17:39:23Z","title":"IFAdapter: Instance Feature Control for Grounded Text-to-Image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.08240","snapshot_observed_at":"2026-08-07T19:40:21.401711Z","title":"Ifadapter: Instance feature con- trol for grounded text-to-image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.401711Z"},"links":{"cited_paper":"/paper/2409.08240","citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:54b3eaf40be6f3894fc302c852cd69bff19c2ea978cdef382b72bcdc26049b52","observation_id":"d78fd1a6-26be-4bc0-ae71-588ce016b29f","resolution":{"observed_at":"2026-08-07T19:40:21.401711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12190","last_updated":"2023-11-27T13:36:04Z","snapshot_observed_at":"2026-08-08T04:50:57.819787Z","submitted_at":"2023-10-18T14:42:16Z","title":"DynamiCrafter: Animating Open-domain Images with Video Diffusion Priors","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12190","snapshot_observed_at":"2026-08-07T19:40:21.405317Z","title":"Dynamicrafter: Animating open-domain images with video diffusion pri- ors","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.405317Z"},"links":{"cited_paper":"/paper/2310.12190","citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:d6d4861cd0d66c758a4da5bf6593b4bc142ebc5aaa24605515db8bd0a29c3c80","observation_id":"13842956-6a20-4fc5-89f9-45a2ea620f12","resolution":{"observed_at":"2026-08-07T19:40:21.405317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10774","last_updated":"2024-10-14T17:46:32Z","snapshot_observed_at":"2026-08-09T19:17:53.546163Z","submitted_at":"2024-10-14T17:46:32Z","title":"Cavia: Camera-controllable Multi-view Video Diffusion with View-Integrated Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10774","snapshot_observed_at":"2026-08-07T19:40:21.409020Z","title":"Cavia: Camera-controllable multi-view video diffusion with view-integrated attention","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.409020Z"},"links":{"cited_paper":"/paper/2410.10774","citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:6b84f894b48433beacacf93d449b6b5180f52405702676dc0670e84f4d930310","observation_id":"bc589411-2a2a-43dc-a287-e928e9c0016c","resolution":{"observed_at":"2026-08-07T19:40:21.409020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02509","last_updated":"2024-06-04T17:27:19Z","snapshot_observed_at":"2026-08-04T13:02:12.217544Z","submitted_at":"2024-06-04T17:27:19Z","title":"CamCo: Camera-Controllable 3D-Consistent Image-to-Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02509","snapshot_observed_at":"2026-08-07T19:40:21.416481Z","title":"Camco: Camera-controllable 3d-consistent image-to-video genera- tion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.416481Z"},"links":{"cited_paper":"/paper/2406.02509","citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:4d2a7b5279d7857e4b23c3d80ea6cccdf7c05c62a60bb8c049aa961ee32e656a","observation_id":"693aa996-4b57-44b2-8e0b-70dd9617581f","resolution":{"observed_at":"2026-08-07T19:40:21.416481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:40:22.264346Z","title":"Magicanimate: Temporally consistent human image animation using diffusion model","venue":null,"work_id":"cd28a12c-41c4-4b9e-a88f-74b5d3932dfc","year":2024},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.420741Z"},"links":{"citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:c6949f1aa6b03ecb1e33367bec581de2c058a81b532af3105b927aeb427250a4","observation_id":"82bc9369-a58c-43b8-a202-96d2029c03fa","resolution":{"observed_at":"2026-08-07T19:40:22.268263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09414","last_updated":"2024-10-20T11:24:09Z","snapshot_observed_at":"2026-07-06T18:30:32.982860Z","submitted_at":"2024-06-13T17:59:56Z","title":"Depth Anything V2","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09414","snapshot_observed_at":"2026-08-07T19:40:21.424302Z","title":"Depth any- thing v2","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.424302Z"},"links":{"cited_paper":"/paper/2406.09414","citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:8a9d2ad10b07f9b5e896a70da5595de0bc4b2c43085adaa74b1ec18b24bb1c0b","observation_id":"aeb6d39f-4972-4b0a-bf29-4c77fde9f607","resolution":{"observed_at":"2026-08-07T19:40:21.424302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:40:22.253087Z","title":"Direct-a-video: Customized video generation with user- directed camera movement and object motion","venue":null,"work_id":"71dab1dd-52d9-4aa4-a7c0-bb96cab02344","year":2024},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.427784Z"},"links":{"citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:1dcc698f4ef9ba20be76077e6b3badf203fd26940fa33ca8c6b1bb957a2c5bdf","observation_id":"33a95072-829b-483c-a95c-c594c87e38ae","resolution":{"observed_at":"2026-08-07T19:40:22.256945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-07T19:40:21.431080Z","title":"Cogvideox: Text-to- video diffusion models with an expert transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.431080Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:46f4e7abb2962c9cdc8a40a82a09dbbe944daa56876ca941d039c2f455838fc1","observation_id":"3bc59a96-4261-4d18-a10f-939e084fae8f","resolution":{"observed_at":"2026-08-07T19:40:21.431080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06721","last_updated":"2023-08-13T08:34:51Z","snapshot_observed_at":"2026-07-06T16:05:39.158819Z","submitted_at":"2023-08-13T08:34:51Z","title":"IP-Adapter: Text Compatible Image Prompt Adapter for Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06721","snapshot_observed_at":"2026-08-07T19:40:21.434785Z","title":"Ip- adapter: Text compatible image prompt adapter for text-to- image diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.434785Z"},"links":{"cited_paper":"/paper/2308.06721","citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:d58f79c383accfbe2ccdfd56abe6a5cba87fe6ef245bd36c0f5782a23031005c","observation_id":"5f73eeff-c1c4-48d4-9a93-bfa5413033a2","resolution":{"observed_at":"2026-08-07T19:40:21.434785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.08089","last_updated":"2023-08-16T01:43:41Z","snapshot_observed_at":"2026-07-06T16:06:38.424057Z","submitted_at":"2023-08-16T01:43:41Z","title":"DragNUWA: Fine-grained Control in Video Generation by Integrating Text, Image, and Trajectory","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.08089","snapshot_observed_at":"2026-08-07T19:40:21.439359Z","title":"Dragnuwa: Fine-grained control in video generation by integrating text, image, and trajectory","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.439359Z"},"links":{"cited_paper":"/paper/2308.08089","citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:e8c4f88e410eae8ecfada16f85233d8b3e3aef554207221a326cc7069f3eca9b","observation_id":"2b4fef1a-896e-4088-a6a5-73e489703a11","resolution":{"observed_at":"2026-08-07T19:40:21.439359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-07T19:40:21.443079Z","title":"Scaling autore- gressive models for content-rich text-to-image generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.443079Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:8a295144f0a9f53e65e0c5161eab3bb9e7c6f1cf3c7920a4d8c8d79c1510754d","observation_id":"5edf496e-fb40-4a8e-91f7-514112de257b","resolution":{"observed_at":"2026-08-07T19:40:21.443079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14148","last_updated":"2024-03-21T05:48:48Z","snapshot_observed_at":"2026-07-06T17:48:08.016138Z","submitted_at":"2024-03-21T05:48:48Z","title":"Efficient Video Diffusion Models via Content-Frame Motion-Latent Decomposition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14148","snapshot_observed_at":"2026-08-07T19:40:21.446765Z","title":"Efficient video diffusion mod- els via content-frame motion-latent decomposition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.446765Z"},"links":{"cited_paper":"/paper/2403.14148","citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:281d373f9b767f285d5a2bc6913e1e1078a39bd94796877471b3c72783a2cd1a","observation_id":"0d1c3ef4-277f-4ce8-a5c0-a0a74267e956","resolution":{"observed_at":"2026-08-07T19:40:21.446765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:40:22.242255Z","title":"Make pixels dance: High-dynamic video generation","venue":null,"work_id":"0e0eab3d-5655-4d99-8e5f-abf14f80dc06","year":2024},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.450939Z"},"links":{"citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:2b5e89e63d611b1aa720ddadeb5d1e994ed43aea88c4096d1bb75b032719c918","observation_id":"047ad930-e347-47f7-a28a-522c7cad84df","resolution":{"observed_at":"2026-08-07T19:40:22.246044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01827","last_updated":"2024-01-03T16:43:47Z","snapshot_observed_at":"2026-07-06T17:11:17.528395Z","submitted_at":"2024-01-03T16:43:47Z","title":"Moonshot: Towards Controllable Video Generation and Editing with Multimodal Conditions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.01827","snapshot_observed_at":"2026-08-07T19:40:21.454140Z","title":"Moonshot: To- wards controllable video generation and editing with multi- modal conditions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.454140Z"},"links":{"cited_paper":"/paper/2401.01827","citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:bf4a7d313647903bc755ef4742c4c56bfce7c245267b1d5aa68c559167a812a7","observation_id":"21571eba-56b4-4079-ab48-3cc3bfda4890","resolution":{"observed_at":"2026-08-07T19:40:21.454140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03825","last_updated":"2025-05-08T08:32:16Z","snapshot_observed_at":"2026-07-06T19:28:08.374354Z","submitted_at":"2024-10-04T18:00:07Z","title":"MonST3R: A Simple Approach for Estimating Geometry in the Presence of Motion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03825","snapshot_observed_at":"2026-08-07T19:40:21.457782Z","title":"Monst3r: A simple approach for esti- mating geometry in the presence of motion","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.457782Z"},"links":{"cited_paper":"/paper/2410.03825","citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:4b7185573db4a04b0101b7e5402bb77f80f974a31f54a1e8098d947d6da53f03","observation_id":"7762dc97-3b58-4da6-95eb-d0438fbcc851","resolution":{"observed_at":"2026-08-07T19:40:21.457782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:40:21.461363Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.461363Z"},"links":{"citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:5e33d6dea68456d802231f172bf92f5165cfa0dda8485bf8ebbf531bc8744bdb","observation_id":"fd673b2b-4e03-4252-a946-311252f1306e","resolution":{"observed_at":"2026-08-07T19:40:21.461363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04145","last_updated":"2023-11-07T17:16:06Z","snapshot_observed_at":"2026-08-02T12:25:34.488259Z","submitted_at":"2023-11-07T17:16:06Z","title":"I2VGen-XL: High-Quality Image-to-Video Synthesis via Cascaded Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04145","snapshot_observed_at":"2026-08-07T19:40:21.464778Z","title":"I2vgen-xl: High-quality image-to-video synthesis via cascaded diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.464778Z"},"links":{"cited_paper":"/paper/2311.04145","citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:506d8adda0a9cd06b1b69bb57d1e91aaaa9afd1991d1597236208d309c745e2c","observation_id":"553428bd-717f-4a52-8df3-1ccb39deb46e","resolution":{"observed_at":"2026-08-07T19:40:21.464778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:40:22.224045Z","title":"Pia: Your personalized image ani- mator via plug-and-play modules in text-to-image models","venue":null,"work_id":"ce23f5ef-bb4d-42c1-9951-5a1339e03faf","year":2024},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.468452Z"},"links":{"citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:0a41840c4893a195cc713a438911f1a2e71689511f4d762efb9d31d6e4a60504","observation_id":"d4b61114-5609-4c13-a7c2-aa71ec0f3603","resolution":{"observed_at":"2026-08-07T19:40:22.228023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12935","last_updated":"2025-01-22T15:06:30Z","snapshot_observed_at":"2026-08-07T01:27:03.735858Z","submitted_at":"2025-01-22T15:06:30Z","title":"3D Object Manipulation in a Single Image using Generative Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12935","snapshot_observed_at":"2026-08-07T19:40:21.471689Z","title":"3d object manipulation in a single image using generative models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.471689Z"},"links":{"cited_paper":"/paper/2501.12935","citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:c4f668c839670779b3a999fa003a151bb492a462f11351b194ccb052a73ba5e8","observation_id":"299ce33a-f5db-49bf-9224-534899f8d1bf","resolution":{"observed_at":"2026-08-07T19:40:21.471689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:40:22.212988Z","title":"Entropy-driven sampling and training scheme for conditional diffusion gen- eration","venue":null,"work_id":"cde82929-0a8c-4e98-9074-1b48dee1f93a","year":2022},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.475105Z"},"links":{"citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:e06bcc4dc40660439284cc9bdecd5ed570ad7fb5e0aea54639dd1a537ef9b596","observation_id":"8a1a982b-62fd-4494-8855-a58618ce719c","resolution":{"observed_at":"2026-08-07T19:40:22.216676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:40:22.201666Z","title":"Layoutdiffusion: Controllable diffusion model for layout-to-image generation","venue":null,"work_id":"b622f022-ac39-4d7b-9b64-ce8a8b93366c","year":2023},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.478750Z"},"links":{"citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:184dbf2fd8f4073e55c3df093ec0a9ae3eaaf93dfa97ad251c7d611f738ca6af","observation_id":"ce6c78f7-25a4-4296-8db1-e890d822c7f6","resolution":{"observed_at":"2026-08-07T19:40:22.205456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15957","last_updated":"2024-12-04T12:54:44Z","snapshot_observed_at":"2026-07-06T19:37:03.013065Z","submitted_at":"2024-10-21T12:36:27Z","title":"CamI2V: Camera-Controlled Image-to-Video Diffusion Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.15957","snapshot_observed_at":"2026-08-07T19:40:21.482120Z","title":"Cami2v: Camera-controlled image-to-video dif- fusion model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.482120Z"},"links":{"cited_paper":"/paper/2410.15957","citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:35a9966b1f37193a720daaff840d15d9fc74e673e77dfce49c3a2821a1e88900","observation_id":"b6c99579-aa0d-4eb9-b95f-575fc40dd821","resolution":{"observed_at":"2026-08-07T19:40:21.482120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08212","last_updated":"2025-04-11T02:35:19Z","snapshot_observed_at":"2026-08-07T16:06:40.368261Z","submitted_at":"2025-04-11T02:35:19Z","title":"RealCam-Vid: High-resolution Video Dataset with Dynamic Scenes and Metric-scale Camera Movements","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08212","snapshot_observed_at":"2026-08-07T19:40:21.485597Z","title":"Realcam-vid: High-resolution video dataset with dynamic scenes and metric-scale camera movements","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.485597Z"},"links":{"cited_paper":"/paper/2504.08212","citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:4789b9318dd3ea62f56ddd510712fe7b81d0d5690f540d9e7dadf159adea2f09","observation_id":"ac9223ba-949d-4a51-8ef6-e0756fbc78b4","resolution":{"observed_at":"2026-08-07T19:40:21.485597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.20404","last_updated":"2024-12-29T08:52:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-29T08:52:49Z","title":"Open-Sora: Democratizing Efficient Video Production for All","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.20404","snapshot_observed_at":"2026-08-07T19:40:21.489186Z","title":"Open-sora: Democratizing efficient video production for all","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.489186Z"},"links":{"cited_paper":"/paper/2412.20404","citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:0c5130eea52346b3da25984a059f71c77857227e547ab973b73b3f2b08566014","observation_id":"db2c850c-19e2-49f5-acd1-5dbb554ab207","resolution":{"observed_at":"2026-08-07T19:40:21.489186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.09847","last_updated":"2018-01-30T04:33:20Z","snapshot_observed_at":"2026-07-06T06:20:51.245757Z","submitted_at":"2018-01-30T04:33:20Z","title":"Open3D: A Modern Library for 3D Data Processing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.09847","snapshot_observed_at":"2026-08-07T19:40:21.492748Z","title":"Open3D: A modern library for 3D data processing","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.492748Z"},"links":{"cited_paper":"/paper/1801.09847","citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:30dbe2329029caa563fecb123a1731b6fa1edb577624bdbac9e5d410d1ed9148","observation_id":"2ad8e3d9-8732-4d71-826a-1793fb4a36f9","resolution":{"observed_at":"2026-08-07T19:40:21.492748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:40:22.188574Z","title":"Stereo magnification: Learning view synthesis using multiplane images","venue":null,"work_id":"5e8595b7-170e-4c82-b99d-218d1e90f61c","year":2018},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.496477Z"},"links":{"citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:c7cba3aeb4ae97cf369c45d6272323fecd3b928255487edf22ca550abe93fccd","observation_id":"00425a8b-9a63-4680-b41f-cfe5afd07cbc","resolution":{"observed_at":"2026-08-07T19:40:22.194088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":87,"verified_exact":0,"verified_fuzzy":13},"total_outbound_references":100},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 100 of 100 outbound references and 11 inbound Pith citation observations for arXiv:2502.10059."}