{"as_of":"2026-08-09T19:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f44828ace3fddbd29c2b07b617256019fca7b3173076ad6d0b9e085096dd962b","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":69,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":69,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":69,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":69,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T10:42:54.348203Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T19:50:11.362384Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2405.04233","last_updated":"2024-05-07T11:52:49Z","snapshot_observed_at":"2026-08-09T05:07:43.521969Z","submitted_at":"2024-05-07T11:52:49Z","title":"Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models","version":1},"cited_work":{"arxiv_id":"2405.04233","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.04233","snapshot_observed_at":"2026-07-04T19:50:11.362384Z","title":"Vidu: a highly consistent, dynamic and skilled text-to-video generator with diffusion models","venue":null,"work_id":"c2c10794-bc91-4c9f-9ed4-32fdb1cc4c19","year":2024},"citing_paper":{"arxiv_id":"2406.03736","last_updated":"2026-03-23T09:46:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-06T04:22:11Z","title":"Your Absorbing Discrete Diffusion Secretly Models the Conditional Distributions of Clean Data","version":4},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-05-18T12:06:09.047780Z"},"links":{"cited_paper":"/paper/2405.04233","citing_paper":"/paper/2406.03736"},"observation_digest":"sha256:847939c8f59319b2994802ba69c747f436a87e08d573e9496029f6f422d4ee44","observation_id":"18bbe2b2-819f-4c89-97c9-ff43643b7d4e","resolution":{"observed_at":"2026-05-18T12:06:09.126266Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04233","last_updated":"2024-05-07T11:52:49Z","snapshot_observed_at":"2026-08-09T05:07:43.521969Z","submitted_at":"2024-05-07T11:52:49Z","title":"Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04233","snapshot_observed_at":"2026-08-09T10:42:54.348203Z","title":"Vidu: a highly consistent, dynamic and skilled text-to- video generator with diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02922","last_updated":"2025-04-30T09:04:48Z","snapshot_observed_at":"2026-08-09T12:40:49.551097Z","submitted_at":"2025-02-05T06:30:37Z","title":"Elucidating the Preconditioning in Consistency Distillation","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-09T10:42:54.348203Z"},"links":{"cited_paper":"/paper/2405.04233","citing_paper":"/paper/2502.02922"},"observation_digest":"sha256:1ef8fa7a2b1d7cebac5133df7d8dd2b7266f44572c5bc6f1406e446edcdf8dc2","observation_id":"3f1a83bc-06f2-4c58-bf62-a40c1d175703","resolution":{"observed_at":"2026-08-09T10:42:54.348203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04233","last_updated":"2024-05-07T11:52:49Z","snapshot_observed_at":"2026-08-09T05:07:43.521969Z","submitted_at":"2024-05-07T11:52:49Z","title":"Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04233","snapshot_observed_at":"2026-08-09T04:42:05.761410Z","title":"Vidu: a highly consis- tent, dynamic and skilled text-to-video generator with diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.03465","last_updated":"2025-03-17T06:29:41Z","snapshot_observed_at":"2026-08-09T04:36:06.051909Z","submitted_at":"2025-02-05T18:59:52Z","title":"Seeing World Dynamics in a Nutshell","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-09T04:42:05.761410Z"},"links":{"cited_paper":"/paper/2405.04233","citing_paper":"/paper/2502.03465"},"observation_digest":"sha256:76e388cce6d0fcf7f3a2ce8a91db80602623d552ec9edc1eb4c002a1a705bf39","observation_id":"e12fadcf-51da-4a5c-b584-4ab1e0be4858","resolution":{"observed_at":"2026-08-09T04:42:05.761410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04233","last_updated":"2024-05-07T11:52:49Z","snapshot_observed_at":"2026-08-09T05:07:43.521969Z","submitted_at":"2024-05-07T11:52:49Z","title":"Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04233","snapshot_observed_at":"2026-08-08T21:07:32.168829Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-08T21:07:32.168829Z"},"links":{"cited_paper":"/paper/2405.04233","citing_paper":"/paper/2502.04896"},"observation_digest":"sha256:80415174f18d751df80ec8c3229b0dc6cfea2fe4ce0b0fa269a2f85a3bea7234","observation_id":"b5b4c075-a60f-453f-8102-d9a4c7949249","resolution":{"observed_at":"2026-08-08T21:07:32.168829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04233","last_updated":"2024-05-07T11:52:49Z","snapshot_observed_at":"2026-08-09T05:07:43.521969Z","submitted_at":"2024-05-07T11:52:49Z","title":"Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04233","snapshot_observed_at":"2026-08-08T10:09:43.574143Z","title":"Vidu: a highly consistent, dynamic and skilled text-to-video generator with diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08189","last_updated":"2025-05-21T05:46:18Z","snapshot_observed_at":"2026-08-09T05:09:02.211543Z","submitted_at":"2025-02-12T07:59:41Z","title":"AnyCharV: Bootstrap Controllable Character Video Generation with Fine-to-Coarse Guidance","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-08T10:09:43.574143Z"},"links":{"cited_paper":"/paper/2405.04233","citing_paper":"/paper/2502.08189"},"observation_digest":"sha256:84f7e76a0d870d664c7ece6c0d0f408d5503c19beaf58878a4033cc43f75c2a0","observation_id":"ff15710d-5d38-4a39-9939-51666f77cd8c","resolution":{"observed_at":"2026-08-08T10:09:43.574143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04233","last_updated":"2024-05-07T11:52:49Z","snapshot_observed_at":"2026-08-09T05:07:43.521969Z","submitted_at":"2024-05-07T11:52:49Z","title":"Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04233","snapshot_observed_at":"2026-08-07T19:40:21.146056Z","title":"Vidu: a highly consistent, dynamic and skilled text-to-video generator with diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-08T15:17:56.424720Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.146056Z"},"links":{"cited_paper":"/paper/2405.04233","citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:d80cc2aa870807c8b8c00437bd9fcb55e6602cc3695533f66027f3f741a91acf","observation_id":"fc8f9a49-89b8-4ed5-918f-0115d6e9b55d","resolution":{"observed_at":"2026-08-07T19:40:21.146056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04233","last_updated":"2024-05-07T11:52:49Z","snapshot_observed_at":"2026-08-09T05:07:43.521969Z","submitted_at":"2024-05-07T11:52:49Z","title":"Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models","version":1},"cited_work":{"arxiv_id":"2405.04233","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.04233","snapshot_observed_at":"2026-07-04T19:50:11.362384Z","title":"Vidu: a highly consistent, dynamic and skilled text-to-video generator with diffusion models","venue":null,"work_id":"c2c10794-bc91-4c9f-9ed4-32fdb1cc4c19","year":2024},"citing_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-22T23:05:32.595632Z"},"links":{"cited_paper":"/paper/2405.04233","citing_paper":"/paper/2503.20314"},"observation_digest":"sha256:0f22816ee7eb25aaa03ecf7679e70d007a936ffaaeeebee9c21feff01e518242","observation_id":"aefb1f88-d662-4015-8ba2-8f0d9d14bed6","resolution":{"observed_at":"2026-05-22T23:07:14.436097Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04233","last_updated":"2024-05-07T11:52:49Z","snapshot_observed_at":"2026-08-09T05:07:43.521969Z","submitted_at":"2024-05-07T11:52:49Z","title":"Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04233","snapshot_observed_at":"2026-08-07T14:01:02.311605Z","title":"Vidu: a Highly Consistent, Dy- namic and Skilled Text-to-Video Generator with Diffusion Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20287","last_updated":"2025-05-26T17:59:03Z","snapshot_observed_at":"2026-08-08T15:17:55.449062Z","submitted_at":"2025-05-26T17:59:03Z","title":"MotionPro: A Precise Motion Controller for Image-to-Video Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:01:02.311605Z"},"links":{"cited_paper":"/paper/2405.04233","citing_paper":"/paper/2505.20287"},"observation_digest":"sha256:538c7beb3f76335d54a92862c0ad48b462a3090d07e2e4be32dfbcbc8648943d","observation_id":"aabdfd97-d1db-47a9-a6b5-03483b016066","resolution":{"observed_at":"2026-08-07T14:01:02.311605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04233","last_updated":"2024-05-07T11:52:49Z","snapshot_observed_at":"2026-08-09T05:07:43.521969Z","submitted_at":"2024-05-07T11:52:49Z","title":"Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04233","snapshot_observed_at":"2026-08-07T13:59:28.048350Z","title":"Vidu: a highly consistent, dynamic and skilled text-to-video generator with diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:28.048350Z"},"links":{"cited_paper":"/paper/2405.04233","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:5ad151ebb80bde3484211240d9cfc17b3781e336e6532e49521a3126373fa668","observation_id":"e211f830-c275-4c09-812e-117d517cad8a","resolution":{"observed_at":"2026-08-07T13:59:28.048350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04233","last_updated":"2024-05-07T11:52:49Z","snapshot_observed_at":"2026-08-09T05:07:43.521969Z","submitted_at":"2024-05-07T11:52:49Z","title":"Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04233","snapshot_observed_at":"2026-08-07T13:17:00.981355Z","title":"arXiv preprint arXiv:2405.04233 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22306","last_updated":"2025-08-21T03:53:43Z","snapshot_observed_at":"2026-08-09T05:08:13.777831Z","submitted_at":"2025-05-28T12:45:39Z","title":"Versatile Cardiovascular Signal Generation with a Unified Diffusion Transformer","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T13:17:00.981355Z"},"links":{"cited_paper":"/paper/2405.04233","citing_paper":"/paper/2505.22306"},"observation_digest":"sha256:b75a61c8238e5fb1aabbf9cc67c5b391e51f1fcf2416029b6f999fb280b6ae64","observation_id":"3f76c878-9e6d-4e47-9621-6bc259ad158c","resolution":{"observed_at":"2026-08-07T13:17:00.981355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04233","last_updated":"2024-05-07T11:52:49Z","snapshot_observed_at":"2026-08-09T05:07:43.521969Z","submitted_at":"2024-05-07T11:52:49Z","title":"Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04233","snapshot_observed_at":"2026-08-07T12:48:03.021385Z","title":"Vidu: a highly consistent, dynamic and skilled text-to-video generator with diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23484","last_updated":"2025-05-29T14:34:25Z","snapshot_observed_at":"2026-08-09T05:32:01.732887Z","submitted_at":"2025-05-29T14:34:25Z","title":"VCapsBench: A Large-scale Fine-grained Benchmark for Video Caption Quality Evaluation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:03.021385Z"},"links":{"cited_paper":"/paper/2405.04233","citing_paper":"/paper/2505.23484"},"observation_digest":"sha256:9842dc41b2c60011d7592ac61b93c4213febde3a3a792d1632660439aa60deec","observation_id":"108ea320-d8ba-4fa5-945f-d231ff320481","resolution":{"observed_at":"2026-08-07T12:48:03.021385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04233","last_updated":"2024-05-07T11:52:49Z","snapshot_observed_at":"2026-08-09T05:07:43.521969Z","submitted_at":"2024-05-07T11:52:49Z","title":"Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04233","snapshot_observed_at":"2026-08-07T11:56:18.834828Z","title":"Vidu: a highly consistent, dynamic and skilled text-to-video generator with diffusion models.arXiv preprint arXiv:2405.04233, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01037","last_updated":"2025-06-01T14:36:25Z","snapshot_observed_at":"2026-08-09T05:08:42.295320Z","submitted_at":"2025-06-01T14:36:25Z","title":"Self-supervised ControlNet with Spatio-Temporal Mamba for Real-world Video Super-resolution","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:56:18.834828Z"},"links":{"cited_paper":"/paper/2405.04233","citing_paper":"/paper/2506.01037"},"observation_digest":"sha256:fbfeee734861022cf96372d5832982e3c724b935e3443028b569a6cf43b61134","observation_id":"bbf9ac7e-42af-4848-945d-545a386a0e00","resolution":{"observed_at":"2026-08-07T11:56:18.834828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04233","last_updated":"2024-05-07T11:52:49Z","snapshot_observed_at":"2026-08-09T05:07:43.521969Z","submitted_at":"2024-05-07T11:52:49Z","title":"Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04233","snapshot_observed_at":"2026-08-07T11:46:59.897735Z","title":"Vidu: a highly consistent, dynamic and skilled text-to-video generator with diffusion models.arXiv preprint arXiv:2405.04233, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01546","last_updated":"2025-06-02T11:19:23Z","snapshot_observed_at":"2026-08-09T10:49:37.282985Z","submitted_at":"2025-06-02T11:19:23Z","title":"LongDWM: Cross-Granularity Distillation for Building a Long-Term Driving World Model","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:46:59.897735Z"},"links":{"cited_paper":"/paper/2405.04233","citing_paper":"/paper/2506.01546"},"observation_digest":"sha256:1f7ea46a14c3411a1a93cb87c08e6a3a762af1f3de8c5df745e27984c4e6e389","observation_id":"5adca448-c3bb-461f-997c-2bfb5c6fbb01","resolution":{"observed_at":"2026-08-07T11:46:59.897735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04233","last_updated":"2024-05-07T11:52:49Z","snapshot_observed_at":"2026-08-09T05:07:43.521969Z","submitted_at":"2024-05-07T11:52:49Z","title":"Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04233","snapshot_observed_at":"2026-08-07T11:26:55.744800Z","title":"Vidu: a highly consistent, dynamic and skilled text-to-video generator with diffusion models.arXiv preprint arXiv:2405.04233,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02698","last_updated":"2025-06-06T03:14:26Z","snapshot_observed_at":"2026-08-09T04:25:20.294383Z","submitted_at":"2025-06-03T09:47:22Z","title":"Smoothed Preference Optimization via ReNoise Inversion for Aligning Diffusion Models with Varied Human Preferences","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:55.744800Z"},"links":{"cited_paper":"/paper/2405.04233","citing_paper":"/paper/2506.02698"},"observation_digest":"sha256:b0292aae12ec27c0d11d1f069ddb788b258fc5b74ba6306fecca9f234e6c9ab3","observation_id":"b48ef145-51f6-43df-867a-cd77217e437f","resolution":{"observed_at":"2026-08-07T11:26:55.744800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04233","last_updated":"2024-05-07T11:52:49Z","snapshot_observed_at":"2026-08-09T05:07:43.521969Z","submitted_at":"2024-05-07T11:52:49Z","title":"Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04233","snapshot_observed_at":"2026-08-07T11:12:17.523287Z","title":"arXiv preprint arXiv:2405.04233 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03141","last_updated":"2025-08-12T02:27:56Z","snapshot_observed_at":"2026-08-07T11:05:41.212982Z","submitted_at":"2025-06-03T17:59:05Z","title":"Context as Memory: Scene-Consistent Interactive Long Video Generation with Memory Retrieval","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:17.523287Z"},"links":{"cited_paper":"/paper/2405.04233","citing_paper":"/paper/2506.03141"},"observation_digest":"sha256:d19164ff8a669f127cac5d165de3a594e87c9950d6de797c2ffd8202b2c39d13","observation_id":"96500013-c643-49cf-bbf2-11d951ccd5f1","resolution":{"observed_at":"2026-08-07T11:12:17.523287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04233","last_updated":"2024-05-07T11:52:49Z","snapshot_observed_at":"2026-08-09T05:07:43.521969Z","submitted_at":"2024-05-07T11:52:49Z","title":"Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04233","snapshot_observed_at":"2026-08-06T23:49:53.402851Z","title":"Vidu: a highly consistent, dynamic and skilled text-to-video generator with diffusion models.arXiv preprint arXiv:2405.04233, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16119","last_updated":"2025-06-19T08:11:45Z","snapshot_observed_at":"2026-08-09T04:34:38.916366Z","submitted_at":"2025-06-19T08:11:45Z","title":"FastInit: Fast Noise Initialization for Temporally Consistent Video Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:53.402851Z"},"links":{"cited_paper":"/paper/2405.04233","citing_paper":"/paper/2506.16119"},"observation_digest":"sha256:cb3d062f735164227c26da83e0122fb78a0b664bf390e7cd0d88f64cbf6844c7","observation_id":"a6c3ec74-a015-42f8-9241-a2e75cc0d662","resolution":{"observed_at":"2026-08-06T23:49:53.402851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04233","last_updated":"2024-05-07T11:52:49Z","snapshot_observed_at":"2026-08-09T05:07:43.521969Z","submitted_at":"2024-05-07T11:52:49Z","title":"Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04233","snapshot_observed_at":"2026-08-06T21:28:18.123749Z","title":"Vidu: a highly consistent, dynamic and skilled text-to-video generator with diffusion models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00162","last_updated":"2025-06-30T18:11:21Z","snapshot_observed_at":"2026-08-07T22:12:22.087190Z","submitted_at":"2025-06-30T18:11:21Z","title":"FreeLong++: Training-Free Long Video Generation via Multi-band SpectralFusion","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T21:28:18.123749Z"},"links":{"cited_paper":"/paper/2405.04233","citing_paper":"/paper/2507.00162"},"observation_digest":"sha256:a9358b984c26224840e3e1c06f64da47ab0cdec53d7513a089b85812a5ea04ff","observation_id":"bf5f1056-59cb-49c0-84c8-15847e188534","resolution":{"observed_at":"2026-08-06T21:28:18.123749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04233","last_updated":"2024-05-07T11:52:49Z","snapshot_observed_at":"2026-08-09T05:07:43.521969Z","submitted_at":"2024-05-07T11:52:49Z","title":"Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04233","snapshot_observed_at":"2026-08-06T19:19:32.682892Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05963","last_updated":"2025-07-09T07:01:34Z","snapshot_observed_at":"2026-08-08T15:17:23.406292Z","submitted_at":"2025-07-08T13:11:40Z","title":"Tora2: Motion and Appearance Customized Diffusion Transformer for Multi-Entity Video Generation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:32.682892Z"},"links":{"cited_paper":"/paper/2405.04233","citing_paper":"/paper/2507.05963"},"observation_digest":"sha256:48613339fbf4a96ba6e9c8e9562e15e64159903db07ef0168dc02eaf9271fb17","observation_id":"e7c00d3a-a334-42de-98db-1afb1b1e3d4b","resolution":{"observed_at":"2026-08-06T19:19:32.682892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04233","last_updated":"2024-05-07T11:52:49Z","snapshot_observed_at":"2026-08-09T05:07:43.521969Z","submitted_at":"2024-05-07T11:52:49Z","title":"Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models","version":1},"cited_work":{"arxiv_id":"2405.04233","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.04233","snapshot_observed_at":"2026-07-04T19:50:11.362384Z","title":"Vidu: a highly consistent, dynamic and skilled text-to-video generator with diffusion models","venue":null,"work_id":"c2c10794-bc91-4c9f-9ed4-32fdb1cc4c19","year":2024},"citing_paper":{"arxiv_id":"2507.12768","last_updated":"2026-05-06T08:19:11Z","snapshot_observed_at":"2026-08-09T16:47:00.380383Z","submitted_at":"2025-07-17T03:48:57Z","title":"AnyPos: Automated Task-Agnostic Actions for Bimanual Manipulation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-19T03:52:18.984005Z"},"links":{"cited_paper":"/paper/2405.04233","citing_paper":"/paper/2507.12768"},"observation_digest":"sha256:56cb5e85f0423b048c232c9f7ef01662d9c7ecabdf957fcfe87ea6c07a5b4745","observation_id":"545dcd23-e751-45b1-8d86-22b24255c284","resolution":{"observed_at":"2026-05-19T03:52:57.579444Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04233","last_updated":"2024-05-07T11:52:49Z","snapshot_observed_at":"2026-08-09T05:07:43.521969Z","submitted_at":"2024-05-07T11:52:49Z","title":"Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models","version":1},"cited_work":{"arxiv_id":"2405.04233","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.04233","snapshot_observed_at":"2026-07-04T19:50:11.362384Z","title":"Vidu: a highly consistent, dynamic and skilled text-to-video generator with diffusion models","venue":null,"work_id":"c2c10794-bc91-4c9f-9ed4-32fdb1cc4c19","year":2024},"citing_paper":{"arxiv_id":"2507.12898","last_updated":"2025-12-20T02:16:12Z","snapshot_observed_at":"2026-07-30T09:36:32.113048Z","submitted_at":"2025-07-17T08:31:55Z","title":"Vidar: Embodied Video Diffusion Model for Generalist Manipulation","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-16T09:54:28.271928Z"},"links":{"cited_paper":"/paper/2405.04233","citing_paper":"/paper/2507.12898"},"observation_digest":"sha256:936db46870ed506ee4554744a0cd8972cca08eb578bca498d645bf0f5930b1ea","observation_id":"313702cf-e86a-48ed-895f-f83b9e3c3c4f","resolution":{"observed_at":"2026-05-16T09:54:28.303206Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04233","last_updated":"2024-05-07T11:52:49Z","snapshot_observed_at":"2026-08-09T05:07:43.521969Z","submitted_at":"2024-05-07T11:52:49Z","title":"Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04233","snapshot_observed_at":"2026-08-06T15:47:24.337873Z","title":"Vidu: a highly consistent, dynamic and skilled text-to-video generator with diffusion models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15064","last_updated":"2025-07-20T17:59:26Z","snapshot_observed_at":"2026-08-09T09:47:36.038947Z","submitted_at":"2025-07-20T17:59:26Z","title":"StableAnimator++: Overcoming Pose Misalignment and Face Distortion for Human Image Animation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T15:47:24.337873Z"},"links":{"cited_paper":"/paper/2405.04233","citing_paper":"/paper/2507.15064"},"observation_digest":"sha256:96e31971c15cbbd0d2604332672133a43ca8b3faf22aba664510ebddca87d53a","observation_id":"19fcc1b4-f978-469b-bae8-ef51b579d778","resolution":{"observed_at":"2026-08-06T15:47:24.337873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04233","last_updated":"2024-05-07T11:52:49Z","snapshot_observed_at":"2026-08-09T05:07:43.521969Z","submitted_at":"2024-05-07T11:52:49Z","title":"Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04233","snapshot_observed_at":"2026-08-05T15:19:37.068815Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-09T16:12:19.928163Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:37.068815Z"},"links":{"cited_paper":"/paper/2405.04233","citing_paper":"/paper/2508.20210"},"observation_digest":"sha256:7337ab666c5318e49ef490479f89e929d8c7cd42cf02b5ac53e43b4d7d1cbe54","observation_id":"36bc65c8-c9c2-4d2d-af15-bb7aad95c0f7","resolution":{"observed_at":"2026-08-05T15:19:37.068815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04233","last_updated":"2024-05-07T11:52:49Z","snapshot_observed_at":"2026-08-09T05:07:43.521969Z","submitted_at":"2024-05-07T11:52:49Z","title":"Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04233","snapshot_observed_at":"2026-08-05T12:42:39.584121Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01362","last_updated":"2025-09-01T11:03:13Z","snapshot_observed_at":"2026-08-09T00:52:28.062011Z","submitted_at":"2025-09-01T11:03:13Z","title":"Identity-Preserving Text-to-Video Generation via Training-Free Prompt, Image, and Guidance Enhancement","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T12:42:39.584121Z"},"links":{"cited_paper":"/paper/2405.04233","citing_paper":"/paper/2509.01362"},"observation_digest":"sha256:f0092815bf2450da0bddf7d9439607788e2b571f0b40e6472886b80213029596","observation_id":"a7ef3343-70ed-4b77-9ca3-e3a861e050d7","resolution":{"observed_at":"2026-08-05T12:42:39.584121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04233","last_updated":"2024-05-07T11:52:49Z","snapshot_observed_at":"2026-08-09T05:07:43.521969Z","submitted_at":"2024-05-07T11:52:49Z","title":"Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04233","snapshot_observed_at":"2026-08-04T20:08:55.396895Z","title":"Vidu: a highly consistent, dynamic and skilled text-to-video generator with diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08826","last_updated":"2025-09-10T17:59:31Z","snapshot_observed_at":"2026-08-08T13:17:31.643163Z","submitted_at":"2025-09-10T17:59:31Z","title":"RewardDance: Reward Scaling in Visual Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T20:08:55.396895Z"},"links":{"cited_paper":"/paper/2405.04233","citing_paper":"/paper/2509.08826"},"observation_digest":"sha256:951e86282ec5b379474dda8e0717d992a01ee343ea4369aa56e9501394fe7671","observation_id":"86905ea5-c022-43bb-8b50-c37819f87f6f","resolution":{"observed_at":"2026-08-04T20:08:55.396895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04233","last_updated":"2024-05-07T11:52:49Z","snapshot_observed_at":"2026-08-09T05:07:43.521969Z","submitted_at":"2024-05-07T11:52:49Z","title":"Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models","version":1},"cited_work":{"arxiv_id":"2405.04233","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.04233","snapshot_observed_at":"2026-07-04T19:50:11.362384Z","title":"Vidu: a highly consistent, dynamic and skilled text-to-video generator with diffusion models","venue":null,"work_id":"c2c10794-bc91-4c9f-9ed4-32fdb1cc4c19","year":2024},"citing_paper":{"arxiv_id":"2510.08431","last_updated":"2026-05-06T15:49:52Z","snapshot_observed_at":"2026-08-06T18:36:14.975364Z","submitted_at":"2025-10-09T16:45:30Z","title":"Large Scale Diffusion Distillation via Score-Regularized Continuous-Time Consistency","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-18T08:46:16.541104Z"},"links":{"cited_paper":"/paper/2405.04233","citing_paper":"/paper/2510.08431"},"observation_digest":"sha256:305ceff521aa0fcd8840fc2f749d38410f7b606527c01de9a622f1d9bdd29d55","observation_id":"98940530-59ab-4151-b584-309fb0b43ae5","resolution":{"observed_at":"2026-05-18T08:51:09.187561Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04233","last_updated":"2024-05-07T11:52:49Z","snapshot_observed_at":"2026-08-09T05:07:43.521969Z","submitted_at":"2024-05-07T11:52:49Z","title":"Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models","version":1},"cited_work":{"arxiv_id":"2405.04233","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.04233","snapshot_observed_at":"2026-07-04T19:50:11.362384Z","title":"Vidu: a highly consistent, dynamic and skilled text-to-video generator with diffusion models","venue":null,"work_id":"c2c10794-bc91-4c9f-9ed4-32fdb1cc4c19","year":2024},"citing_paper":{"arxiv_id":"2601.16163","last_updated":"2026-01-22T18:09:30Z","snapshot_observed_at":"2026-08-06T02:05:52.408905Z","submitted_at":"2026-01-22T18:09:30Z","title":"Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control and Planning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-12T14:50:12.804707Z"},"links":{"cited_paper":"/paper/2405.04233","citing_paper":"/paper/2601.16163"},"observation_digest":"sha256:8069cd202a934c04fc2606f9450876d99d96fc1ce7210cd4156e023aa0970f5d","observation_id":"5c7c8dea-5d39-4e18-bf50-10a8b8b27477","resolution":{"observed_at":"2026-05-12T14:50:13.046825Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04233","last_updated":"2024-05-07T11:52:49Z","snapshot_observed_at":"2026-08-09T05:07:43.521969Z","submitted_at":"2024-05-07T11:52:49Z","title":"Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04233","snapshot_observed_at":"2026-08-03T08:16:22.346891Z","title":"Vidu: a highly consistent, dynamic and skilled text-to- video generator with diffusion models.arXiv preprint arXiv:2405.04233,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.17737","last_updated":"2026-05-27T06:53:57Z","snapshot_observed_at":"2026-08-07T17:02:56.952261Z","submitted_at":"2026-01-25T08:10:28Z","title":"The Script is All You Need: An Agentic Framework for Long-Horizon Dialogue-to-Cinematic Video Generation","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T08:16:22.346891Z"},"links":{"cited_paper":"/paper/2405.04233","citing_paper":"/paper/2601.17737"},"observation_digest":"sha256:cd1a7c71619f868c4a1c22186a0bf34d1dd07e4f881d4f60b3a105820a4f557c","observation_id":"c91e4821-a5a2-4b44-be0c-2c2daf15a2e8","resolution":{"observed_at":"2026-08-03T08:16:22.346891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04233","last_updated":"2024-05-07T11:52:49Z","snapshot_observed_at":"2026-08-09T05:07:43.521969Z","submitted_at":"2024-05-07T11:52:49Z","title":"Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models","version":1},"cited_work":{"arxiv_id":"2405.04233","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.04233","snapshot_observed_at":"2026-07-04T19:50:11.362384Z","title":"Vidu: a highly consistent, dynamic and skilled text-to-video generator with diffusion models","venue":null,"work_id":"c2c10794-bc91-4c9f-9ed4-32fdb1cc4c19","year":2024},"citing_paper":{"arxiv_id":"2602.02214","last_updated":"2026-06-01T14:32:37Z","snapshot_observed_at":"2026-08-03T05:30:22.346810Z","submitted_at":"2026-02-02T15:19:22Z","title":"Causal Forcing: Autoregressive Diffusion Distillation Done Right for High-Quality Real-Time Interactive Video Generation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-21T17:32:01.642256Z"},"links":{"cited_paper":"/paper/2405.04233","citing_paper":"/paper/2602.02214"},"observation_digest":"sha256:b4250384205961c816f538011279d79e097fc4e8c23f94b369eff9f06b4ff517","observation_id":"96da0831-e0f1-4f25-ac88-8c26074f3cca","resolution":{"observed_at":"2026-05-21T17:32:01.738632Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04233","last_updated":"2024-05-07T11:52:49Z","snapshot_observed_at":"2026-08-09T05:07:43.521969Z","submitted_at":"2024-05-07T11:52:49Z","title":"Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models","version":1},"cited_work":{"arxiv_id":"2405.04233","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.04233","snapshot_observed_at":"2026-07-04T19:50:11.362384Z","title":"Vidu: a highly consistent, dynamic and skilled text-to-video generator with diffusion models","venue":null,"work_id":"c2c10794-bc91-4c9f-9ed4-32fdb1cc4c19","year":2024},"citing_paper":{"arxiv_id":"2602.02214","last_updated":"2026-06-01T14:32:37Z","snapshot_observed_at":"2026-08-03T05:30:22.346810Z","submitted_at":"2026-02-02T15:19:22Z","title":"Causal Forcing: Autoregressive Diffusion Distillation Done Right for High-Quality Real-Time Interactive Video Generation","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-22T11:48:00.633421Z"},"links":{"cited_paper":"/paper/2405.04233","citing_paper":"/paper/2602.02214"},"observation_digest":"sha256:66ab88c044cb65451d28e9c76bfba012451b43b4acda1ff51014a89cd17974d3","observation_id":"6b6b3205-e9d1-4614-aa4b-8fcb451277c5","resolution":{"observed_at":"2026-05-22T11:51:29.779880Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04233","last_updated":"2024-05-07T11:52:49Z","snapshot_observed_at":"2026-08-09T05:07:43.521969Z","submitted_at":"2024-05-07T11:52:49Z","title":"Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04233","snapshot_observed_at":"2026-08-03T05:30:23.868383Z","title":"Vidu: a highly consistent, dynamic and skilled text-to-video generator with diffusion models.arXiv preprint arXiv:2405.04233,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02214","last_updated":"2026-06-01T14:32:37Z","snapshot_observed_at":"2026-08-03T05:30:22.346810Z","submitted_at":"2026-02-02T15:19:22Z","title":"Causal Forcing: Autoregressive Diffusion Distillation Done Right for High-Quality Real-Time Interactive Video Generation","version":5},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-03T05:30:23.868383Z"},"links":{"cited_paper":"/paper/2405.04233","citing_paper":"/paper/2602.02214"},"observation_digest":"sha256:329c4f9b18d1846abeb240588d014d976241fcfee406b888c18957aeb311f730","observation_id":"dc357c4b-d5fa-4e89-a476-b8612bdc3696","resolution":{"observed_at":"2026-08-03T05:30:23.868383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04233","last_updated":"2024-05-07T11:52:49Z","snapshot_observed_at":"2026-08-09T05:07:43.521969Z","submitted_at":"2024-05-07T11:52:49Z","title":"Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04233","snapshot_observed_at":"2026-08-03T00:03:22.328973Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.11790","last_updated":"2026-05-31T04:10:48Z","snapshot_observed_at":"2026-08-07T18:20:37.730997Z","submitted_at":"2026-02-12T10:14:36Z","title":"Beyond End-to-End Video Models: An LLM-Based Multi-Agent System for Educational Video Generation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T00:03:22.328973Z"},"links":{"cited_paper":"/paper/2405.04233","citing_paper":"/paper/2602.11790"},"observation_digest":"sha256:4a089c73886ddfe721332fa91858e8d7b4ab82da5cc6ebea5e67d5c944b2deee","observation_id":"29457579-037c-4ef8-9875-4c6349a85fd6","resolution":{"observed_at":"2026-08-03T00:03:22.328973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04233","last_updated":"2024-05-07T11:52:49Z","snapshot_observed_at":"2026-08-09T05:07:43.521969Z","submitted_at":"2024-05-07T11:52:49Z","title":"Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models","version":1},"cited_work":{"arxiv_id":"2405.04233","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.04233","snapshot_observed_at":"2026-07-04T19:50:11.362384Z","title":"Vidu: a highly consistent, dynamic and skilled text-to-video generator with diffusion models","venue":null,"work_id":"c2c10794-bc91-4c9f-9ed4-32fdb1cc4c19","year":2024},"citing_paper":{"arxiv_id":"2602.13669","last_updated":"2026-04-22T07:41:44Z","snapshot_observed_at":"2026-07-06T22:45:53.926021Z","submitted_at":"2026-02-14T08:32:38Z","title":"EchoTorrent: Towards Swift, Sustained, and Streaming Multi-Modal Video Generation","version":5},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-15T22:20:16.320171Z"},"links":{"cited_paper":"/paper/2405.04233","citing_paper":"/paper/2602.13669"},"observation_digest":"sha256:c5fc3089b048ad52236d74a3296687ff7ed373065a2d3007b4b5a4c6bb0aa2c1","observation_id":"6dad6221-0e31-46cf-9a7e-fa9422ad42ad","resolution":{"observed_at":"2026-05-15T22:20:22.449120Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04233","last_updated":"2024-05-07T11:52:49Z","snapshot_observed_at":"2026-08-09T05:07:43.521969Z","submitted_at":"2024-05-07T11:52:49Z","title":"Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04233","snapshot_observed_at":"2026-07-13T18:01:19.034578Z","title":"Vidu: a highly consistent, dynamic and skilled text-to-video generator with diffusion models.arXiv preprint arXiv:2405.04233, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.25743","last_updated":"2026-06-29T08:23:47Z","snapshot_observed_at":"2026-08-08T15:15:46.111735Z","submitted_at":"2026-03-26T17:59:57Z","title":"RefAlign: Representation Alignment for Reference-to-Video Generation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-13T18:01:19.034578Z"},"links":{"cited_paper":"/paper/2405.04233","citing_paper":"/paper/2603.25743"},"observation_digest":"sha256:9856f885ee16454ac80784b40a5204b01885ad8d15b59df8e797dbab577adcb7","observation_id":"28a8d85c-9609-4c7b-9cc7-c36e8b190dbf","resolution":{"observed_at":"2026-07-13T18:01:19.034578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04233","last_updated":"2024-05-07T11:52:49Z","snapshot_observed_at":"2026-08-09T05:07:43.521969Z","submitted_at":"2024-05-07T11:52:49Z","title":"Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04233","snapshot_observed_at":"2026-07-13T12:23:05.876881Z","title":"Vidu: a highly consistent, dynamic and skilled text-to-video generator with diffusion models.arXiv preprint arXiv:2405.04233, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.03738","last_updated":"2026-04-04T13:50:38Z","snapshot_observed_at":"2026-08-06T04:04:52.686841Z","submitted_at":"2026-04-04T13:50:38Z","title":"Rethinking Position Embedding as a Context Controller for Multi-Reference and Multi-Shot Video Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-13T12:23:05.876881Z"},"links":{"cited_paper":"/paper/2405.04233","citing_paper":"/paper/2604.03738"},"observation_digest":"sha256:42817010ac8e9cf37b5b9e0b346cff17d9285282ce6c0c1414ae6013d9a857ed","observation_id":"edd8279e-e4f4-43cb-93fa-14dc68f654bd","resolution":{"observed_at":"2026-07-13T12:23:05.876881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04233","last_updated":"2024-05-07T11:52:49Z","snapshot_observed_at":"2026-08-09T05:07:43.521969Z","submitted_at":"2024-05-07T11:52:49Z","title":"Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models","version":1},"cited_work":{"arxiv_id":"2405.04233","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.04233","snapshot_observed_at":"2026-07-04T19:50:11.362384Z","title":"Vidu: a highly consistent, dynamic and skilled text-to-video generator with diffusion models","venue":null,"work_id":"c2c10794-bc91-4c9f-9ed4-32fdb1cc4c19","year":2024},"citing_paper":{"arxiv_id":"2604.03819","last_updated":"2026-04-04T18:00:05Z","snapshot_observed_at":"2026-07-06T22:52:57.182669Z","submitted_at":"2026-04-04T18:00:05Z","title":"ActivityForensics: A Comprehensive Benchmark for Localizing Manipulated Activity in Videos","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-13T17:06:28.335731Z"},"links":{"cited_paper":"/paper/2405.04233","citing_paper":"/paper/2604.03819"},"observation_digest":"sha256:c56b4c9b11f9be434ab1c45681b131564f3ab472fa07e1de933fa0a72bfc53d7","observation_id":"906edc20-62e6-4da1-ac04-1acada01650a","resolution":{"observed_at":"2026-05-13T17:08:00.846669Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04233","last_updated":"2024-05-07T11:52:49Z","snapshot_observed_at":"2026-08-09T05:07:43.521969Z","submitted_at":"2024-05-07T11:52:49Z","title":"Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models","version":1},"cited_work":{"arxiv_id":"2405.04233","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.04233","snapshot_observed_at":"2026-07-04T19:50:11.362384Z","title":"Vidu: a highly consistent, dynamic and skilled text-to-video generator with diffusion models","venue":null,"work_id":"c2c10794-bc91-4c9f-9ed4-32fdb1cc4c19","year":2024},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-02T05:26:21.584719Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":1},"reference_index":140,"source":"pdf_text","source_observed_at":"2026-05-10T16:36:33.264166Z"},"links":{"cited_paper":"/paper/2405.04233","citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:fe989f4111b53ce1e78fc83ab871c465ae025c459129e06f943cbef960f81d70","observation_id":"820dcff3-2566-44df-90ac-38a0a4466f14","resolution":{"observed_at":"2026-05-11T08:30:56.962535Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04233","last_updated":"2024-05-07T11:52:49Z","snapshot_observed_at":"2026-08-09T05:07:43.521969Z","submitted_at":"2024-05-07T11:52:49Z","title":"Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04233","snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Vidu: A highly consistent, dynamic and skilled text-to-video generator with diffusion models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-02T05:26:21.584719Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":123,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"cited_paper":"/paper/2405.04233","citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:eaffd87beac1a930d5986bc679abf9982d98a406b0dceb7895fca67c7137df33","observation_id":"99af4c32-bd3b-4f48-814e-e8f49e99c200","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04233","last_updated":"2024-05-07T11:52:49Z","snapshot_observed_at":"2026-08-09T05:07:43.521969Z","submitted_at":"2024-05-07T11:52:49Z","title":"Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models","version":1},"cited_work":{"arxiv_id":"2405.04233","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.04233","snapshot_observed_at":"2026-07-04T19:50:11.362384Z","title":"Vidu: a highly consistent, dynamic and skilled text-to-video generator with diffusion models","venue":null,"work_id":"c2c10794-bc91-4c9f-9ed4-32fdb1cc4c19","year":2024},"citing_paper":{"arxiv_id":"2604.12255","last_updated":"2026-08-02T07:16:12Z","snapshot_observed_at":"2026-08-09T10:55:18.183017Z","submitted_at":"2026-04-14T04:05:07Z","title":"ARGen: Affect-Reinforced Generative Augmentation towards Vision-based Dynamic Emotion Perception","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T14:56:00.679543Z"},"links":{"cited_paper":"/paper/2405.04233","citing_paper":"/paper/2604.12255"},"observation_digest":"sha256:f0f181b96e86e2872b3ecd0451492278065a271bcd761df0e4dd088c62b36dfd","observation_id":"a2680bb9-fda6-47c3-b0d7-9a66a13d4cd0","resolution":{"observed_at":"2026-05-11T11:26:02.297387Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04233","last_updated":"2024-05-07T11:52:49Z","snapshot_observed_at":"2026-08-09T05:07:43.521969Z","submitted_at":"2024-05-07T11:52:49Z","title":"Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04233","snapshot_observed_at":"2026-08-04T05:32:16.069091Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.12255","last_updated":"2026-08-02T07:16:12Z","snapshot_observed_at":"2026-08-09T10:55:18.183017Z","submitted_at":"2026-04-14T04:05:07Z","title":"ARGen: Affect-Reinforced Generative Augmentation towards Vision-based Dynamic Emotion Perception","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T05:32:16.069091Z"},"links":{"cited_paper":"/paper/2405.04233","citing_paper":"/paper/2604.12255"},"observation_digest":"sha256:7058d54751933b2adfdf2d65ed5a0b57cd5da4509e6fe649b5a79a8771097e54","observation_id":"366aa9e4-766e-44fe-b0c0-2613841ac62d","resolution":{"observed_at":"2026-08-04T05:32:16.069091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04233","last_updated":"2024-05-07T11:52:49Z","snapshot_observed_at":"2026-08-09T05:07:43.521969Z","submitted_at":"2024-05-07T11:52:49Z","title":"Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models","version":1},"cited_work":{"arxiv_id":"2405.04233","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.04233","snapshot_observed_at":"2026-07-04T19:50:11.362384Z","title":"Vidu: a highly consistent, dynamic and skilled text-to-video generator with diffusion models","venue":null,"work_id":"c2c10794-bc91-4c9f-9ed4-32fdb1cc4c19","year":2024},"citing_paper":{"arxiv_id":"2604.17887","last_updated":"2026-04-20T06:57:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T06:57:55Z","title":"StableIDM: Stabilizing Inverse Dynamics Model against Manipulator Truncation via Spatio-Temporal Refinement","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T04:41:45.903419Z"},"links":{"cited_paper":"/paper/2405.04233","citing_paper":"/paper/2604.17887"},"observation_digest":"sha256:11cf2388f1cf032d05a5db9d7dab915ff99b34a8f5306fcc9990180bbd16b574","observation_id":"73c73cbf-a0dc-43f8-92b5-adff13846f15","resolution":{"observed_at":"2026-05-10T12:05:22.877393Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04233","last_updated":"2024-05-07T11:52:49Z","snapshot_observed_at":"2026-08-09T05:07:43.521969Z","submitted_at":"2024-05-07T11:52:49Z","title":"Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models","version":1},"cited_work":{"arxiv_id":"2405.04233","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.04233","snapshot_observed_at":"2026-07-04T19:50:11.362384Z","title":"Vidu: a highly consistent, dynamic and skilled text-to-video generator with diffusion models","venue":null,"work_id":"c2c10794-bc91-4c9f-9ed4-32fdb1cc4c19","year":2024},"citing_paper":{"arxiv_id":"2604.27505","last_updated":"2026-05-20T07:08:10Z","snapshot_observed_at":"2026-07-06T23:12:57.730833Z","submitted_at":"2026-04-30T06:54:39Z","title":"Leveraging Verifier-Based Reinforcement Learning in Image Editing","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-07T08:00:33.307429Z"},"links":{"cited_paper":"/paper/2405.04233","citing_paper":"/paper/2604.27505"},"observation_digest":"sha256:bd8799796cbedf528c88a2568eccd560a72e5a05290d52657d996c9b1a7aa4ec","observation_id":"c9450f4f-9750-4f84-98a9-c895ccfc8914","resolution":{"observed_at":"2026-05-12T10:06:27.506068Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04233","last_updated":"2024-05-07T11:52:49Z","snapshot_observed_at":"2026-08-09T05:07:43.521969Z","submitted_at":"2024-05-07T11:52:49Z","title":"Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models","version":1},"cited_work":{"arxiv_id":"2405.04233","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.04233","snapshot_observed_at":"2026-07-04T19:50:11.362384Z","title":"Vidu: a highly consistent, dynamic and skilled text-to-video generator with diffusion models","venue":null,"work_id":"c2c10794-bc91-4c9f-9ed4-32fdb1cc4c19","year":2024},"citing_paper":{"arxiv_id":"2604.27505","last_updated":"2026-05-20T07:08:10Z","snapshot_observed_at":"2026-07-06T23:12:57.730833Z","submitted_at":"2026-04-30T06:54:39Z","title":"Leveraging Verifier-Based Reinforcement Learning in Image Editing","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-21T09:11:02.183133Z"},"links":{"cited_paper":"/paper/2405.04233","citing_paper":"/paper/2604.27505"},"observation_digest":"sha256:efe8ebbb921545c5761565002731b9091b97ab69f260efb1a9feb2a2aed130cf","observation_id":"1ac8e706-a259-490e-ac8c-eb808e75e14f","resolution":{"observed_at":"2026-05-21T09:14:05.854281Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04233","last_updated":"2024-05-07T11:52:49Z","snapshot_observed_at":"2026-08-09T05:07:43.521969Z","submitted_at":"2024-05-07T11:52:49Z","title":"Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models","version":1},"cited_work":{"arxiv_id":"2405.04233","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.04233","snapshot_observed_at":"2026-07-04T19:50:11.362384Z","title":"Vidu: a highly consistent, dynamic and skilled text-to-video generator with diffusion models","venue":null,"work_id":"c2c10794-bc91-4c9f-9ed4-32fdb1cc4c19","year":2024},"citing_paper":{"arxiv_id":"2605.02641","last_updated":"2026-05-04T14:26:33Z","snapshot_observed_at":"2026-07-06T23:15:41.793878Z","submitted_at":"2026-05-04T14:26:33Z","title":"Mamoda2.5: Enhancing Unified Multimodal Model with DiT-MoE","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-08T18:26:58.696936Z"},"links":{"cited_paper":"/paper/2405.04233","citing_paper":"/paper/2605.02641"},"observation_digest":"sha256:9e80fe3986ac4535ae2e5161e45839f35f0c218b69c09bd9304f095c19267a8f","observation_id":"315b9a4c-bc63-4560-9263-9f3aeb421230","resolution":{"observed_at":"2026-05-09T06:25:47.686249Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04233","last_updated":"2024-05-07T11:52:49Z","snapshot_observed_at":"2026-08-09T05:07:43.521969Z","submitted_at":"2024-05-07T11:52:49Z","title":"Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models","version":1},"cited_work":{"arxiv_id":"2405.04233","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.04233","snapshot_observed_at":"2026-07-04T19:50:11.362384Z","title":"Vidu: a highly consistent, dynamic and skilled text-to-video generator with diffusion models","venue":null,"work_id":"c2c10794-bc91-4c9f-9ed4-32fdb1cc4c19","year":2024},"citing_paper":{"arxiv_id":"2605.03652","last_updated":"2026-05-11T07:22:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-05T11:36:52Z","title":"AniMatrix: An Anime Video Generation Model that Thinks in Art, Not Physics","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-08T01:23:27.990472Z"},"links":{"cited_paper":"/paper/2405.04233","citing_paper":"/paper/2605.03652"},"observation_digest":"sha256:026f284aca751c1d168960f155dd2d2b9973d26aceceedd6e8be8a566517098d","observation_id":"e00cfbf3-fd1a-4057-9b84-cc756a447b16","resolution":{"observed_at":"2026-05-12T10:56:32.177838Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04233","last_updated":"2024-05-07T11:52:49Z","snapshot_observed_at":"2026-08-09T05:07:43.521969Z","submitted_at":"2024-05-07T11:52:49Z","title":"Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models","version":1},"cited_work":{"arxiv_id":"2405.04233","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.04233","snapshot_observed_at":"2026-07-04T19:50:11.362384Z","title":"Vidu: a highly consistent, dynamic and skilled text-to-video generator with diffusion models","venue":null,"work_id":"c2c10794-bc91-4c9f-9ed4-32fdb1cc4c19","year":2024},"citing_paper":{"arxiv_id":"2605.03652","last_updated":"2026-05-11T07:22:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-05T11:36:52Z","title":"AniMatrix: An Anime Video Generation Model that Thinks in Art, Not Physics","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-08T19:04:02.414172Z"},"links":{"cited_paper":"/paper/2405.04233","citing_paper":"/paper/2605.03652"},"observation_digest":"sha256:808742c2a3981b00054f427a772cdb569831dd4741c45c842f82838308951d2f","observation_id":"5fb29813-602e-4cc0-a541-577187e41b7f","resolution":{"observed_at":"2026-05-09T06:05:34.461197Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04233","last_updated":"2024-05-07T11:52:49Z","snapshot_observed_at":"2026-08-09T05:07:43.521969Z","submitted_at":"2024-05-07T11:52:49Z","title":"Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models","version":1},"cited_work":{"arxiv_id":"2405.04233","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.04233","snapshot_observed_at":"2026-07-04T19:50:11.362384Z","title":"Vidu: a highly consistent, dynamic and skilled text-to-video generator with diffusion models","venue":null,"work_id":"c2c10794-bc91-4c9f-9ed4-32fdb1cc4c19","year":2024},"citing_paper":{"arxiv_id":"2605.03652","last_updated":"2026-05-11T07:22:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-05T11:36:52Z","title":"AniMatrix: An Anime Video Generation Model that Thinks in Art, Not Physics","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-12T03:39:47.335022Z"},"links":{"cited_paper":"/paper/2405.04233","citing_paper":"/paper/2605.03652"},"observation_digest":"sha256:9c045b7600e36adf92f7106e1057e6bca18e40e97c71dccc989d5488ae79fdc3","observation_id":"bdf2acaf-39ee-4f07-a0e0-1d4eb3148872","resolution":{"observed_at":"2026-05-12T07:11:24.248845Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04233","last_updated":"2024-05-07T11:52:49Z","snapshot_observed_at":"2026-08-09T05:07:43.521969Z","submitted_at":"2024-05-07T11:52:49Z","title":"Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models","version":1},"cited_work":{"arxiv_id":"2405.04233","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.04233","snapshot_observed_at":"2026-07-04T19:50:11.362384Z","title":"Vidu: a highly consistent, dynamic and skilled text-to-video generator with diffusion models","venue":null,"work_id":"c2c10794-bc91-4c9f-9ed4-32fdb1cc4c19","year":2024},"citing_paper":{"arxiv_id":"2605.06509","last_updated":"2026-05-07T16:21:34Z","snapshot_observed_at":"2026-08-06T11:28:24.405584Z","submitted_at":"2026-05-07T16:21:34Z","title":"FreeSpec: Training-Free Long Video Generation via Singular-Spectrum Reconstruction","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-08T13:11:46.079614Z"},"links":{"cited_paper":"/paper/2405.04233","citing_paper":"/paper/2605.06509"},"observation_digest":"sha256:1143963cfbc4989c880ca88bbb996a8b30b5bb5a0f483e92a0a05426a6963de8","observation_id":"4b7632f0-21ad-41f7-a338-9b3ef276d05a","resolution":{"observed_at":"2026-05-11T18:56:07.733835Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04233","last_updated":"2024-05-07T11:52:49Z","snapshot_observed_at":"2026-08-09T05:07:43.521969Z","submitted_at":"2024-05-07T11:52:49Z","title":"Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models","version":1},"cited_work":{"arxiv_id":"2405.04233","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.04233","snapshot_observed_at":"2026-07-04T19:50:11.362384Z","title":"Vidu: a highly consistent, dynamic and skilled text-to-video generator with diffusion models","venue":null,"work_id":"c2c10794-bc91-4c9f-9ed4-32fdb1cc4c19","year":2024},"citing_paper":{"arxiv_id":"2605.06912","last_updated":"2026-05-07T20:22:32Z","snapshot_observed_at":"2026-07-06T23:19:20.674889Z","submitted_at":"2026-05-07T20:22:32Z","title":"Advancing Reliable Synthetic Video Detection: Insights from the SAFE Challenge","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-11T00:53:18.735506Z"},"links":{"cited_paper":"/paper/2405.04233","citing_paper":"/paper/2605.06912"},"observation_digest":"sha256:f7d71c53f3ee1d6494e78ec5585357601b675038b2ab5703083d0591d722a0dc","observation_id":"bacb9b99-890a-47b1-9cfa-119a0473e048","resolution":{"observed_at":"2026-05-11T05:00:57.484674Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04233","last_updated":"2024-05-07T11:52:49Z","snapshot_observed_at":"2026-08-09T05:07:43.521969Z","submitted_at":"2024-05-07T11:52:49Z","title":"Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models","version":1},"cited_work":{"arxiv_id":"2405.04233","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.04233","snapshot_observed_at":"2026-07-04T19:50:11.362384Z","title":"Vidu: a highly consistent, dynamic and skilled text-to-video generator with diffusion models","venue":null,"work_id":"c2c10794-bc91-4c9f-9ed4-32fdb1cc4c19","year":2024},"citing_paper":{"arxiv_id":"2605.07503","last_updated":"2026-05-08T09:37:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-08T09:37:46Z","title":"Diffusion-APO: Trajectory-Aware Direct Preference Alignment for Video Diffusion Transformers","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-11T01:58:25.291448Z"},"links":{"cited_paper":"/paper/2405.04233","citing_paper":"/paper/2605.07503"},"observation_digest":"sha256:42624dc29bbc3f61c629f31e318ee8aafd4ade9be38abcf22b1a792153c67757","observation_id":"1c0305ce-01e1-41d5-b4ce-9f1a3937770d","resolution":{"observed_at":"2026-05-11T04:05:56.284351Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04233","last_updated":"2024-05-07T11:52:49Z","snapshot_observed_at":"2026-08-09T05:07:43.521969Z","submitted_at":"2024-05-07T11:52:49Z","title":"Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models","version":1},"cited_work":{"arxiv_id":"2405.04233","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.04233","snapshot_observed_at":"2026-07-04T19:50:11.362384Z","title":"Vidu: a highly consistent, dynamic and skilled text-to-video generator with diffusion models","venue":null,"work_id":"c2c10794-bc91-4c9f-9ed4-32fdb1cc4c19","year":2024},"citing_paper":{"arxiv_id":"2605.14382","last_updated":"2026-06-29T03:46:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-14T05:06:57Z","title":"Delta Forcing: Trust Region Steering for Interactive Autoregressive Video Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-15T01:52:14.874049Z"},"links":{"cited_paper":"/paper/2405.04233","citing_paper":"/paper/2605.14382"},"observation_digest":"sha256:b9d5d7db287d774ca420e220fcf7bb3380a77c9dc695b80c06da4869db3830a2","observation_id":"6ece8cb1-63da-427f-bf15-1e745f273244","resolution":{"observed_at":"2026-05-15T01:53:28.797687Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04233","last_updated":"2024-05-07T11:52:49Z","snapshot_observed_at":"2026-08-09T05:07:43.521969Z","submitted_at":"2024-05-07T11:52:49Z","title":"Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models","version":1},"cited_work":{"arxiv_id":"2405.04233","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.04233","snapshot_observed_at":"2026-07-04T19:50:11.362384Z","title":"Vidu: a highly consistent, dynamic and skilled text-to-video generator with diffusion models","venue":null,"work_id":"c2c10794-bc91-4c9f-9ed4-32fdb1cc4c19","year":2024},"citing_paper":{"arxiv_id":"2605.14382","last_updated":"2026-06-29T03:46:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-14T05:06:57Z","title":"Delta Forcing: Trust Region Steering for Interactive Autoregressive Video Generation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-20T21:54:33.902256Z"},"links":{"cited_paper":"/paper/2405.04233","citing_paper":"/paper/2605.14382"},"observation_digest":"sha256:22e7244462716c933931e8becd36ec58bbce0ca73a01ca68af0affcdca036f12","observation_id":"e0883180-b879-40c3-a4f4-a89f27e48976","resolution":{"observed_at":"2026-05-20T21:59:06.448785Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04233","last_updated":"2024-05-07T11:52:49Z","snapshot_observed_at":"2026-08-09T05:07:43.521969Z","submitted_at":"2024-05-07T11:52:49Z","title":"Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models","version":1},"cited_work":{"arxiv_id":"2405.04233","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.04233","snapshot_observed_at":"2026-07-04T19:50:11.362384Z","title":"Vidu: a highly consistent, dynamic and skilled text-to-video generator with diffusion models","venue":null,"work_id":"c2c10794-bc91-4c9f-9ed4-32fdb1cc4c19","year":2024},"citing_paper":{"arxiv_id":"2605.14382","last_updated":"2026-06-29T03:46:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-14T05:06:57Z","title":"Delta Forcing: Trust Region Steering for Interactive Autoregressive Video Generation","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-21T09:12:35.777810Z"},"links":{"cited_paper":"/paper/2405.04233","citing_paper":"/paper/2605.14382"},"observation_digest":"sha256:72a7337fb59cf07ae19b529bde773106d36b8e88449857bbc80c3ab84b9fcdbb","observation_id":"d30ec527-f7ec-401b-a07e-30a280e6b492","resolution":{"observed_at":"2026-05-21T09:14:05.673014Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04233","last_updated":"2024-05-07T11:52:49Z","snapshot_observed_at":"2026-08-09T05:07:43.521969Z","submitted_at":"2024-05-07T11:52:49Z","title":"Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models","version":1},"cited_work":{"arxiv_id":"2405.04233","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.04233","snapshot_observed_at":"2026-07-04T19:50:11.362384Z","title":"Vidu: a highly consistent, dynamic and skilled text-to-video generator with diffusion models","venue":null,"work_id":"c2c10794-bc91-4c9f-9ed4-32fdb1cc4c19","year":2024},"citing_paper":{"arxiv_id":"2605.14382","last_updated":"2026-06-29T03:46:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-14T05:06:57Z","title":"Delta Forcing: Trust Region Steering for Interactive Autoregressive Video Generation","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-30T21:44:21.427570Z"},"links":{"cited_paper":"/paper/2405.04233","citing_paper":"/paper/2605.14382"},"observation_digest":"sha256:5c504dcdb8d57b1bb85acfbb221c1eb033d3406e5783fdea048d97ee65df06ca","observation_id":"276a741a-360a-44a7-a800-be7d3fe1e9f0","resolution":{"observed_at":"2026-06-30T21:45:05.499291Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04233","last_updated":"2024-05-07T11:52:49Z","snapshot_observed_at":"2026-08-09T05:07:43.521969Z","submitted_at":"2024-05-07T11:52:49Z","title":"Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models","version":1},"cited_work":{"arxiv_id":"2405.04233","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.04233","snapshot_observed_at":"2026-07-04T19:50:11.362384Z","title":"Vidu: a highly consistent, dynamic and skilled text-to-video generator with diffusion models","venue":null,"work_id":"c2c10794-bc91-4c9f-9ed4-32fdb1cc4c19","year":2024},"citing_paper":{"arxiv_id":"2605.15141","last_updated":"2026-06-01T14:27:49Z","snapshot_observed_at":"2026-07-06T23:26:28.006734Z","submitted_at":"2026-05-14T17:46:36Z","title":"Causal Forcing++: Scalable Few-Step Autoregressive Diffusion Distillation for Real-Time Interactive Video Generation","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-30T20:59:34.847496Z"},"links":{"cited_paper":"/paper/2405.04233","citing_paper":"/paper/2605.15141"},"observation_digest":"sha256:686fd0d343b72810a2b65c27939d8f47e08fb39023eb01c1ac010dc4c025d62d","observation_id":"5d5d664b-2c8d-4fa7-b654-8779667e78a5","resolution":{"observed_at":"2026-06-30T21:05:04.406243Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04233","last_updated":"2024-05-07T11:52:49Z","snapshot_observed_at":"2026-08-09T05:07:43.521969Z","submitted_at":"2024-05-07T11:52:49Z","title":"Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models","version":1},"cited_work":{"arxiv_id":"2405.04233","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.04233","snapshot_observed_at":"2026-07-04T19:50:11.362384Z","title":"Vidu: a highly consistent, dynamic and skilled text-to-video generator with diffusion models","venue":null,"work_id":"c2c10794-bc91-4c9f-9ed4-32fdb1cc4c19","year":2024},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":150,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"cited_paper":"/paper/2405.04233","citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:cb34d28fa51a033d1c9715da4b6fb35566460e4b366a4f398983f11c2817ae17","observation_id":"caa404be-6042-495a-af23-765adadb3387","resolution":{"observed_at":"2026-05-20T15:08:24.963760Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04233","last_updated":"2024-05-07T11:52:49Z","snapshot_observed_at":"2026-08-09T05:07:43.521969Z","submitted_at":"2024-05-07T11:52:49Z","title":"Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models","version":1},"cited_work":{"arxiv_id":"2405.04233","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.04233","snapshot_observed_at":"2026-07-04T19:50:11.362384Z","title":"Vidu: a highly consistent, dynamic and skilled text-to-video generator with diffusion models","venue":null,"work_id":"c2c10794-bc91-4c9f-9ed4-32fdb1cc4c19","year":2024},"citing_paper":{"arxiv_id":"2605.30263","last_updated":"2026-05-28T17:27:03Z","snapshot_observed_at":"2026-08-09T05:19:05.421119Z","submitted_at":"2026-05-28T17:27:03Z","title":"minWM: A Full-Stack Open-Source Framework for Real-Time Interactive Video World Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-29T08:22:48.074724Z"},"links":{"cited_paper":"/paper/2405.04233","citing_paper":"/paper/2605.30263"},"observation_digest":"sha256:d3f0cd787287359d0d9ddbf7eafb485a312499447da82af80a7869d2a2f21575","observation_id":"1d7cd6f7-7a09-469a-ae35-a5751b533910","resolution":{"observed_at":"2026-06-29T08:23:14.795387Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04233","last_updated":"2024-05-07T11:52:49Z","snapshot_observed_at":"2026-08-09T05:07:43.521969Z","submitted_at":"2024-05-07T11:52:49Z","title":"Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models","version":1},"cited_work":{"arxiv_id":"2405.04233","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.04233","snapshot_observed_at":"2026-07-04T19:50:11.362384Z","title":"Vidu: a highly consistent, dynamic and skilled text-to-video generator with diffusion models","venue":null,"work_id":"c2c10794-bc91-4c9f-9ed4-32fdb1cc4c19","year":2024},"citing_paper":{"arxiv_id":"2606.01481","last_updated":"2026-05-31T22:46:35Z","snapshot_observed_at":"2026-08-06T16:16:18.407347Z","submitted_at":"2026-05-31T22:46:35Z","title":"SafeGen-Bench: Benchmarking Safety in Image-Conditioned Text-to-Video Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-28T17:05:57.685728Z"},"links":{"cited_paper":"/paper/2405.04233","citing_paper":"/paper/2606.01481"},"observation_digest":"sha256:0c86d0bcf23ddac59ca7d83bea16d2dcd787f1cdc77437210bb96ec954dede94","observation_id":"56fda64e-c019-4d5e-b6af-9dc56e19871c","resolution":{"observed_at":"2026-06-28T17:12:25.196547Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04233","last_updated":"2024-05-07T11:52:49Z","snapshot_observed_at":"2026-08-09T05:07:43.521969Z","submitted_at":"2024-05-07T11:52:49Z","title":"Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models","version":1},"cited_work":{"arxiv_id":"2405.04233","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.04233","snapshot_observed_at":"2026-07-04T19:50:11.362384Z","title":"Vidu: a highly consistent, dynamic and skilled text-to-video generator with diffusion models","venue":null,"work_id":"c2c10794-bc91-4c9f-9ed4-32fdb1cc4c19","year":2024},"citing_paper":{"arxiv_id":"2606.02402","last_updated":"2026-06-01T15:48:38Z","snapshot_observed_at":"2026-08-09T16:06:55.909378Z","submitted_at":"2026-06-01T15:48:38Z","title":"Explainable Forensics of Manipulated Segments in Untrimmed Long Videos","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-28T14:49:11.015838Z"},"links":{"cited_paper":"/paper/2405.04233","citing_paper":"/paper/2606.02402"},"observation_digest":"sha256:1c70823a513d9c9795d042106fa9f774fff457e32c4386a4235beaeed432b7b3","observation_id":"46c5aad6-4827-4c51-9342-8c0eab89d6ad","resolution":{"observed_at":"2026-07-01T22:56:20.987409Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04233","last_updated":"2024-05-07T11:52:49Z","snapshot_observed_at":"2026-08-09T05:07:43.521969Z","submitted_at":"2024-05-07T11:52:49Z","title":"Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04233","snapshot_observed_at":"2026-08-02T11:59:12.867166Z","title":"Vidu: a highly consistent, dynamic and skilled text-to-video generator with diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.10135","last_updated":"2026-07-24T07:11:46Z","snapshot_observed_at":"2026-08-02T11:59:11.962721Z","submitted_at":"2026-06-08T20:08:41Z","title":"BiWM: Advancing Open-Source Interactive Video World Models with Bidirectional Autoregression","version":4},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-02T11:59:12.867166Z"},"links":{"cited_paper":"/paper/2405.04233","citing_paper":"/paper/2606.10135"},"observation_digest":"sha256:6e1a35361eec38a17525f8b0d6e2f9a6ce249530d6866a9afd14778318db52b2","observation_id":"b72fe840-58c4-4a2e-a7ce-0ada4fa6ed0b","resolution":{"observed_at":"2026-08-02T11:59:12.867166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04233","last_updated":"2024-05-07T11:52:49Z","snapshot_observed_at":"2026-08-09T05:07:43.521969Z","submitted_at":"2024-05-07T11:52:49Z","title":"Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models","version":1},"cited_work":{"arxiv_id":"2405.04233","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.04233","snapshot_observed_at":"2026-07-04T19:50:11.362384Z","title":"Vidu: a highly consistent, dynamic and skilled text-to-video generator with diffusion models","venue":null,"work_id":"c2c10794-bc91-4c9f-9ed4-32fdb1cc4c19","year":2024},"citing_paper":{"arxiv_id":"2606.11670","last_updated":"2026-06-10T05:29:09Z","snapshot_observed_at":"2026-08-09T12:29:17.060154Z","submitted_at":"2026-06-10T05:29:09Z","title":"ARGUS: Stacked Multi-View Identity Mosaic Injection for Subject-Preserving Video Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-27T10:46:56.871174Z"},"links":{"cited_paper":"/paper/2405.04233","citing_paper":"/paper/2606.11670"},"observation_digest":"sha256:331670907326fef152bcf12d7f076054ca8a31870ff0279a88a629c3cfe6628c","observation_id":"3f0cf397-87ba-478d-ad4a-7d92ecddd226","resolution":{"observed_at":"2026-07-03T08:17:45.973433Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04233","last_updated":"2024-05-07T11:52:49Z","snapshot_observed_at":"2026-08-09T05:07:43.521969Z","submitted_at":"2024-05-07T11:52:49Z","title":"Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models","version":1},"cited_work":{"arxiv_id":"2405.04233","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.04233","snapshot_observed_at":"2026-07-04T19:50:11.362384Z","title":"Vidu: a highly consistent, dynamic and skilled text-to-video generator with diffusion models","venue":null,"work_id":"c2c10794-bc91-4c9f-9ed4-32fdb1cc4c19","year":2024},"citing_paper":{"arxiv_id":"2606.19163","last_updated":"2026-06-17T15:06:56Z","snapshot_observed_at":"2026-08-08T09:14:57.923807Z","submitted_at":"2026-06-17T15:06:56Z","title":"Pulse: Training Acceleration for Large Diffusion Models with Automatic Pipeline Parallelism","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-26T19:36:14.248003Z"},"links":{"cited_paper":"/paper/2405.04233","citing_paper":"/paper/2606.19163"},"observation_digest":"sha256:3f23660af14cecbb2fdb4f0d75213e44c778ea7509f7c67ca81e39c2be9ba782","observation_id":"ca3c9ce2-55ce-4f24-8cad-efdb17ea1565","resolution":{"observed_at":"2026-07-04T02:39:24.664412Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04233","last_updated":"2024-05-07T11:52:49Z","snapshot_observed_at":"2026-08-09T05:07:43.521969Z","submitted_at":"2024-05-07T11:52:49Z","title":"Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models","version":1},"cited_work":{"arxiv_id":"2405.04233","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.04233","snapshot_observed_at":"2026-07-04T19:50:11.362384Z","title":"Vidu: a highly consistent, dynamic and skilled text-to-video generator with diffusion models","venue":null,"work_id":"c2c10794-bc91-4c9f-9ed4-32fdb1cc4c19","year":2024},"citing_paper":{"arxiv_id":"2606.20799","last_updated":"2026-07-15T15:45:17Z","snapshot_observed_at":"2026-08-02T10:48:03.144592Z","submitted_at":"2026-06-18T18:00:03Z","title":"GroundShot: Visually Consistent Multi-Shot Long Video Generation via Entity-Grounded Shot Scheduling","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-26T18:15:51.862192Z"},"links":{"cited_paper":"/paper/2405.04233","citing_paper":"/paper/2606.20799"},"observation_digest":"sha256:9935e72c0243b92b74d0caa41dd745cf2a7f9f9f2a8455942264b224f8ead3c6","observation_id":"8070024f-e6c1-40b7-a7e0-4f4c5f45b318","resolution":{"observed_at":"2026-07-04T03:19:30.253059Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04233","last_updated":"2024-05-07T11:52:49Z","snapshot_observed_at":"2026-08-09T05:07:43.521969Z","submitted_at":"2024-05-07T11:52:49Z","title":"Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04233","snapshot_observed_at":"2026-08-02T10:48:04.099603Z","title":"Vidu: a highly consistent, dynamic and skilled text-to-video generator with diffusion models.arXiv preprint arXiv:2405.04233, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.20799","last_updated":"2026-07-15T15:45:17Z","snapshot_observed_at":"2026-08-02T10:48:03.144592Z","submitted_at":"2026-06-18T18:00:03Z","title":"GroundShot: Visually Consistent Multi-Shot Long Video Generation via Entity-Grounded Shot Scheduling","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T10:48:04.099603Z"},"links":{"cited_paper":"/paper/2405.04233","citing_paper":"/paper/2606.20799"},"observation_digest":"sha256:441d2eede87b1af87017e91c97ef638e76e97ef0f309bc515fb79e05e71d4486","observation_id":"63236064-2202-4cfd-b6a6-927e9602c6e8","resolution":{"observed_at":"2026-08-02T10:48:04.099603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04233","last_updated":"2024-05-07T11:52:49Z","snapshot_observed_at":"2026-08-09T05:07:43.521969Z","submitted_at":"2024-05-07T11:52:49Z","title":"Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models","version":1},"cited_work":{"arxiv_id":"2405.04233","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.04233","snapshot_observed_at":"2026-07-04T19:50:11.362384Z","title":"Vidu: a highly consistent, dynamic and skilled text-to-video generator with diffusion models","venue":null,"work_id":"c2c10794-bc91-4c9f-9ed4-32fdb1cc4c19","year":2024},"citing_paper":{"arxiv_id":"2606.25306","last_updated":"2026-06-24T02:12:54Z","snapshot_observed_at":"2026-07-06T23:59:47.542695Z","submitted_at":"2026-06-24T02:12:54Z","title":"Physics Question Scene Graph: Fine-grained Evaluation of Physical Plausibility in Text-to-Video Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-25T21:33:38.643889Z"},"links":{"cited_paper":"/paper/2405.04233","citing_paper":"/paper/2606.25306"},"observation_digest":"sha256:11734469947728b5c11ebe22e10623785d4d0fc0967fd5f0989e75bfe5577278","observation_id":"f1e06150-11b4-4595-9c6d-9954ef5f4660","resolution":{"observed_at":"2026-07-04T19:20:05.888697Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04233","last_updated":"2024-05-07T11:52:49Z","snapshot_observed_at":"2026-08-09T05:07:43.521969Z","submitted_at":"2024-05-07T11:52:49Z","title":"Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models","version":1},"cited_work":{"arxiv_id":"2405.04233","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.04233","snapshot_observed_at":"2026-07-04T19:50:11.362384Z","title":"Vidu: a highly consistent, dynamic and skilled text-to-video generator with diffusion models","venue":null,"work_id":"c2c10794-bc91-4c9f-9ed4-32fdb1cc4c19","year":2024},"citing_paper":{"arxiv_id":"2606.25473","last_updated":"2026-06-24T06:58:02Z","snapshot_observed_at":"2026-08-05T22:45:50.916812Z","submitted_at":"2026-06-24T06:58:02Z","title":"Causal-rCM: A Unified Teacher-Forcing and Self-Forcing Open Recipe for Autoregressive Diffusion Distillation in Streaming Video Generation and Interactive World Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-25T20:57:30.765802Z"},"links":{"cited_paper":"/paper/2405.04233","citing_paper":"/paper/2606.25473"},"observation_digest":"sha256:cc293e0c761a91fc4538e267dff15807c76311f97b07e92ec8ddee15d2d54d2b","observation_id":"bfb82141-da1c-4737-86d2-ac420b481bab","resolution":{"observed_at":"2026-07-04T19:50:11.364149Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04233","last_updated":"2024-05-07T11:52:49Z","snapshot_observed_at":"2026-08-09T05:07:43.521969Z","submitted_at":"2024-05-07T11:52:49Z","title":"Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models","version":1},"cited_work":{"arxiv_id":"2405.04233","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.04233","snapshot_observed_at":"2026-07-04T19:50:11.362384Z","title":"Vidu: a highly consistent, dynamic and skilled text-to-video generator with diffusion models","venue":null,"work_id":"c2c10794-bc91-4c9f-9ed4-32fdb1cc4c19","year":2024},"citing_paper":{"arxiv_id":"2606.31734","last_updated":"2026-06-30T14:31:32Z","snapshot_observed_at":"2026-08-07T09:44:34.339704Z","submitted_at":"2026-06-30T14:31:32Z","title":"MemLearner: Learning to Query Context memory for Video World Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-01T05:30:56.140465Z"},"links":{"cited_paper":"/paper/2405.04233","citing_paper":"/paper/2606.31734"},"observation_digest":"sha256:07d2e1954adf003c7f93b7296cc773ae47d8becc3061067bf1bf7b881c52248b","observation_id":"23814f50-bb84-46bd-bfab-beb691e994f2","resolution":{"observed_at":"2026-07-01T10:25:41.915950Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04233","last_updated":"2024-05-07T11:52:49Z","snapshot_observed_at":"2026-08-09T05:07:43.521969Z","submitted_at":"2024-05-07T11:52:49Z","title":"Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04233","snapshot_observed_at":"2026-08-02T03:12:33.331799Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14189","last_updated":"2026-07-15T16:02:45Z","snapshot_observed_at":"2026-08-08T02:21:53.851123Z","submitted_at":"2026-07-15T16:02:45Z","title":"MultiRef-Compass: Towards Comprehensive Evaluation of Multi-Reference-to-Audio-Video Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T03:12:33.331799Z"},"links":{"cited_paper":"/paper/2405.04233","citing_paper":"/paper/2607.14189"},"observation_digest":"sha256:cd6a5c13c15ac48aad24eb78de9fa0ddca615f5837579f6ab40f8befe0e04ad3","observation_id":"f9db2bae-7545-4317-a7c5-37aff2e01a3e","resolution":{"observed_at":"2026-08-02T03:12:33.331799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04233","last_updated":"2024-05-07T11:52:49Z","snapshot_observed_at":"2026-08-09T05:07:43.521969Z","submitted_at":"2024-05-07T11:52:49Z","title":"Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04233","snapshot_observed_at":"2026-07-31T20:13:31.342466Z","title":"Vidu: a highly consistent, dynamic and skilled text-to-video generator with diffusion models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24241","last_updated":"2026-07-29T07:34:35Z","snapshot_observed_at":"2026-08-09T05:07:55.612195Z","submitted_at":"2026-07-27T10:20:31Z","title":"FilmBench: A Film-Grade Benchmark for Cinematic Video Generation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-31T20:13:31.342466Z"},"links":{"cited_paper":"/paper/2405.04233","citing_paper":"/paper/2607.24241"},"observation_digest":"sha256:de27761b4b31886a29dfdfe0d273d48fe750d63bf8f08d708ad4e2d63573ad37","observation_id":"fec10dbc-a174-4198-95bb-6b713a840974","resolution":{"observed_at":"2026-07-31T20:13:31.342466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04233","last_updated":"2024-05-07T11:52:49Z","snapshot_observed_at":"2026-08-09T05:07:43.521969Z","submitted_at":"2024-05-07T11:52:49Z","title":"Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04233","snapshot_observed_at":"2026-08-04T03:23:53.366492Z","title":"Vidu: a highly consistent, dynamic and skilled text-to-video generator with diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02603","last_updated":"2026-08-03T17:59:54Z","snapshot_observed_at":"2026-08-06T23:39:14.390821Z","submitted_at":"2026-08-03T17:59:54Z","title":"WorldExam: Benchmarking World Models from Apparent Appearance to Inherent Reactivity","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T03:23:53.366492Z"},"links":{"cited_paper":"/paper/2405.04233","citing_paper":"/paper/2608.02603"},"observation_digest":"sha256:a33b53b2717ed6ef08e91f181a27354fba0227abc654b894622b1f4d271d7d3d","observation_id":"8c14f1c3-cab0-45e0-b77e-7aa0ca7795d9","resolution":{"observed_at":"2026-08-04T03:23:53.366492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2405.04233/citation-record","integrity":"/paper/2405.04233/integrity","json":"/paper/2405.04233/citation-record.json","paper":"/paper/2405.04233"},"outbound":[],"paper":{"arxiv_id":"2405.04233","last_updated":"2024-05-07T11:52:49Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T05:07:43.521969Z","submitted_at":"2024-05-07T11:52:49Z","title":"Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 69 inbound Pith citation observations for arXiv:2405.04233."}