{"as_of":"2026-08-18T18:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0cc02cec3f5dbe0ae3f91968ad01218f673415bd5845d5effad78ed33439a19a","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T12:00:07.626602Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T22:44:24.796514Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.16612","last_updated":"2025-01-28T01:14:24Z","snapshot_observed_at":"2026-08-12T21:39:57.859742Z","submitted_at":"2025-01-28T01:14:24Z","title":"CascadeV: An Implementation of Wurstchen Architecture for Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.16612","snapshot_observed_at":"2026-07-11T22:44:24.796514Z","title":"arXiv preprint arXiv:2501.16612 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03960","last_updated":"2026-07-04T17:32:35Z","snapshot_observed_at":"2026-08-14T03:05:11.365617Z","submitted_at":"2026-07-04T17:32:35Z","title":"Reward Lightning: Fast Video Generation via Homologous Preference Distillation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-11T22:44:24.796514Z"},"links":{"cited_paper":"/paper/2501.16612","citing_paper":"/paper/2607.03960"},"observation_digest":"sha256:0bb3374b4033743374a33c1416e308db69670bf719583d977d58e1aa20459e28","observation_id":"dc524441-eec2-4aca-8b7e-b5e96603d8c1","resolution":{"observed_at":"2026-07-11T22:44:24.796514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2501.16612/citation-record","integrity":"/paper/2501.16612/integrity","json":"/paper/2501.16612/citation-record.json","paper":"/paper/2501.16612"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T12:00:07.497033Z","title":"Open-sora-plan, April 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.16612","last_updated":"2025-01-28T01:14:24Z","snapshot_observed_at":"2026-08-12T21:39:57.859742Z","submitted_at":"2025-01-28T01:14:24Z","title":"CascadeV: An Implementation of Wurstchen Architecture for Video Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T12:00:07.497033Z"},"links":{"citing_paper":"/paper/2501.16612"},"observation_digest":"sha256:3347009e1cd4eb26b0fac12ed6a19c5b02017bcb58daad3d00a141fafbfd01ba","observation_id":"86129864-852a-47c4-8a27-00586b02bf5f","resolution":{"observed_at":"2026-08-10T12:00:07.497033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-10T12:00:07.500887Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.16612","last_updated":"2025-01-28T01:14:24Z","snapshot_observed_at":"2026-08-12T21:39:57.859742Z","submitted_at":"2025-01-28T01:14:24Z","title":"CascadeV: An Implementation of Wurstchen Architecture for Video Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T12:00:07.500887Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2501.16612"},"observation_digest":"sha256:a5a313bbb58d36df1d38f5c266fdb9797386208d71b4efbb475526ecd0d0e9e1","observation_id":"02305103-aa1f-4f0b-b21b-ac47b2d80fb0","resolution":{"observed_at":"2026-08-10T12:00:07.500887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T12:00:07.504902Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.16612","last_updated":"2025-01-28T01:14:24Z","snapshot_observed_at":"2026-08-12T21:39:57.859742Z","submitted_at":"2025-01-28T01:14:24Z","title":"CascadeV: An Implementation of Wurstchen Architecture for Video Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T12:00:07.504902Z"},"links":{"citing_paper":"/paper/2501.16612"},"observation_digest":"sha256:936b02e639e8e8cdc805f8854a071f9ed27ed5c135f0b94617f659976b33508b","observation_id":"1dd6d20c-9940-4495-b36a-c219381fc82e","resolution":{"observed_at":"2026-08-10T12:00:07.504902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.13456","last_updated":"2021-02-10T18:17:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-11-26T19:39:10Z","title":"Score-Based Generative Modeling through Stochastic Differential Equations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.13456","snapshot_observed_at":"2026-08-10T12:00:07.508458Z","title":"Score-based generative modeling through stochastic differential equations","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2501.16612","last_updated":"2025-01-28T01:14:24Z","snapshot_observed_at":"2026-08-12T21:39:57.859742Z","submitted_at":"2025-01-28T01:14:24Z","title":"CascadeV: An Implementation of Wurstchen Architecture for Video Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T12:00:07.508458Z"},"links":{"cited_paper":"/paper/2011.13456","citing_paper":"/paper/2501.16612"},"observation_digest":"sha256:0ad57b6bfbe836bc1f705d5e096817b284ba726165fe9ab1a8a1c56a0df9f8e0","observation_id":"e1221e63-ae9c-4af6-a362-b8b36a6fc452","resolution":{"observed_at":"2026-08-10T12:00:07.508458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T12:00:07.988252Z","title":"Diffsound: Discrete diffusion model for text-to-sound generation","venue":null,"work_id":"2e0c65b3-cad1-4541-8168-953e31cdb08e","year":2023},"citing_paper":{"arxiv_id":"2501.16612","last_updated":"2025-01-28T01:14:24Z","snapshot_observed_at":"2026-08-12T21:39:57.859742Z","submitted_at":"2025-01-28T01:14:24Z","title":"CascadeV: An Implementation of Wurstchen Architecture for Video Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T12:00:07.512700Z"},"links":{"citing_paper":"/paper/2501.16612"},"observation_digest":"sha256:bcf4300815558b87f16f37853ac591dd70dcfdacbafd242ab3cebab0568dc257","observation_id":"e7df6a60-36b3-47f1-bf0c-ae30ecdc92d3","resolution":{"observed_at":"2026-08-10T12:00:07.991589Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T12:00:07.979123Z","title":"Make-an-audio: Text-to-audio generation with prompt-enhanced diffusion models","venue":null,"work_id":"3f616571-ac3e-4bc6-abda-09e16ddfe62c","year":2023},"citing_paper":{"arxiv_id":"2501.16612","last_updated":"2025-01-28T01:14:24Z","snapshot_observed_at":"2026-08-12T21:39:57.859742Z","submitted_at":"2025-01-28T01:14:24Z","title":"CascadeV: An Implementation of Wurstchen Architecture for Video Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T12:00:07.516248Z"},"links":{"citing_paper":"/paper/2501.16612"},"observation_digest":"sha256:601c041ec9bf005ea845f64f41ffb4fa6452d488ba748e838e8d861dcdecf888","observation_id":"d3e2a364-25cb-46d7-943c-498510e950ea","resolution":{"observed_at":"2026-08-10T12:00:07.982288Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T12:00:07.969886Z","title":"simple diffusion: End-to-end diffusion for high resolution images","venue":null,"work_id":"ec1ad40d-ca14-4a57-a6a4-6e54b89e16bd","year":2023},"citing_paper":{"arxiv_id":"2501.16612","last_updated":"2025-01-28T01:14:24Z","snapshot_observed_at":"2026-08-12T21:39:57.859742Z","submitted_at":"2025-01-28T01:14:24Z","title":"CascadeV: An Implementation of Wurstchen Architecture for Video Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T12:00:07.519882Z"},"links":{"citing_paper":"/paper/2501.16612"},"observation_digest":"sha256:5304ded6b024ee1f65298235cb027adb87ff68745f88235e9407e53de1183926","observation_id":"27f8a8d2-703e-494a-9135-dacbc2201ebd","resolution":{"observed_at":"2026-08-10T12:00:07.973030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04312","last_updated":"2024-05-08T07:17:12Z","snapshot_observed_at":"2026-08-16T13:54:41.966029Z","submitted_at":"2024-05-07T13:35:58Z","title":"Inf-DiT: Upsampling Any-Resolution Image with Memory-Efficient Diffusion Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04312","snapshot_observed_at":"2026-08-10T12:00:07.523244Z","title":"Inf-dit: Upsampling any-resolution image with memory-efficient diffusion transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.16612","last_updated":"2025-01-28T01:14:24Z","snapshot_observed_at":"2026-08-12T21:39:57.859742Z","submitted_at":"2025-01-28T01:14:24Z","title":"CascadeV: An Implementation of Wurstchen Architecture for Video Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T12:00:07.523244Z"},"links":{"cited_paper":"/paper/2405.04312","citing_paper":"/paper/2501.16612"},"observation_digest":"sha256:1cc623aa14040d4df633af429c89188811d667513574e6e1f0278abea2364446","observation_id":"519533fe-3a73-43c9-b760-e696b23a498a","resolution":{"observed_at":"2026-08-10T12:00:07.523244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T12:00:07.526327Z","title":"Scaling rectified flow transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.16612","last_updated":"2025-01-28T01:14:24Z","snapshot_observed_at":"2026-08-12T21:39:57.859742Z","submitted_at":"2025-01-28T01:14:24Z","title":"CascadeV: An Implementation of Wurstchen Architecture for Video Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T12:00:07.526327Z"},"links":{"citing_paper":"/paper/2501.16612"},"observation_digest":"sha256:a016c97288c256ce4f7109b9d7d891bc8da0d936dd105a4d5c709aac3b169922","observation_id":"c2092018-6cc2-43c6-a6f6-1232c2899c20","resolution":{"observed_at":"2026-08-10T12:00:07.526327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T12:00:07.529148Z","title":"Improving image generation with better captions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.16612","last_updated":"2025-01-28T01:14:24Z","snapshot_observed_at":"2026-08-12T21:39:57.859742Z","submitted_at":"2025-01-28T01:14:24Z","title":"CascadeV: An Implementation of Wurstchen Architecture for Video Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T12:00:07.529148Z"},"links":{"citing_paper":"/paper/2501.16612"},"observation_digest":"sha256:b234dd3982045b5ff3bed26778acd26c04f1edadcde50a61289088f612e9a8f6","observation_id":"2f075212-8d78-4f38-b38f-5f5938d8ec28","resolution":{"observed_at":"2026-08-10T12:00:07.529148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06662","last_updated":"2023-12-11T18:59:57Z","snapshot_observed_at":"2026-08-16T14:35:45.631393Z","submitted_at":"2023-12-11T18:59:57Z","title":"Photorealistic Video Generation with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06662","snapshot_observed_at":"2026-08-10T12:00:07.531922Z","title":"Photorealistic video generation with diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.16612","last_updated":"2025-01-28T01:14:24Z","snapshot_observed_at":"2026-08-12T21:39:57.859742Z","submitted_at":"2025-01-28T01:14:24Z","title":"CascadeV: An Implementation of Wurstchen Architecture for Video Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T12:00:07.531922Z"},"links":{"cited_paper":"/paper/2312.06662","citing_paper":"/paper/2501.16612"},"observation_digest":"sha256:5240f59cc59c6fc4ef3d2cfa6e4a5fbff8848d79074b61c25ab4ac5b926cdea2","observation_id":"024ecec7-7c5b-4682-a07f-d037cc366ca0","resolution":{"observed_at":"2026-08-10T12:00:07.531922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T12:00:07.535217Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.16612","last_updated":"2025-01-28T01:14:24Z","snapshot_observed_at":"2026-08-12T21:39:57.859742Z","submitted_at":"2025-01-28T01:14:24Z","title":"CascadeV: An Implementation of Wurstchen Architecture for Video Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T12:00:07.535217Z"},"links":{"citing_paper":"/paper/2501.16612"},"observation_digest":"sha256:9a4bde56014e95baee31e6bda0a8918add932b9a7214367224edfa8d3b63f2d5","observation_id":"647a10a9-f63d-4077-b73f-a58cd3fffc8e","resolution":{"observed_at":"2026-08-10T12:00:07.535217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T12:00:07.938121Z","title":"Würstchen: An efficient architecture for large-scale text-to-image diffusion models","venue":null,"work_id":"63910429-6c94-4198-95e7-4cd1d631e16a","year":2023},"citing_paper":{"arxiv_id":"2501.16612","last_updated":"2025-01-28T01:14:24Z","snapshot_observed_at":"2026-08-12T21:39:57.859742Z","submitted_at":"2025-01-28T01:14:24Z","title":"CascadeV: An Implementation of Wurstchen Architecture for Video Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T12:00:07.538347Z"},"links":{"citing_paper":"/paper/2501.16612"},"observation_digest":"sha256:6d2ea5547c4658d70061f34d7d51cf16cf965ba1e438a5853277954c3e28f1ca","observation_id":"bdf6f80a-8e68-484b-8c44-659bb0d48098","resolution":{"observed_at":"2026-08-10T12:00:07.941527Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T12:00:07.541076Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.16612","last_updated":"2025-01-28T01:14:24Z","snapshot_observed_at":"2026-08-12T21:39:57.859742Z","submitted_at":"2025-01-28T01:14:24Z","title":"CascadeV: An Implementation of Wurstchen Architecture for Video Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T12:00:07.541076Z"},"links":{"citing_paper":"/paper/2501.16612"},"observation_digest":"sha256:b3c01b31f13daa0658b74db9b8816a40c83b86611a24a67d7e0c4afe1be28edd","observation_id":"3b91f235-b030-4832-a77e-4639d2478ec7","resolution":{"observed_at":"2026-08-10T12:00:07.541076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-08-11T15:38:14.931716Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-10T12:00:07.543873Z","title":"Denoising diffusion implicit models","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2501.16612","last_updated":"2025-01-28T01:14:24Z","snapshot_observed_at":"2026-08-12T21:39:57.859742Z","submitted_at":"2025-01-28T01:14:24Z","title":"CascadeV: An Implementation of Wurstchen Architecture for Video Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T12:00:07.543873Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2501.16612"},"observation_digest":"sha256:c03ea60cefa8c3cbc35ce149cec9686a3fe3049e3fe93d63f3ede3b8c25d17c4","observation_id":"defd70b8-cf25-44a2-a580-c0e14e3e07fc","resolution":{"observed_at":"2026-08-10T12:00:07.543873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T12:00:07.918841Z","title":"Fast sampling of diffusion models with exponential integrator","venue":null,"work_id":"4c17b1c7-0a4e-490b-855c-3971d5b24aa9","year":2022},"citing_paper":{"arxiv_id":"2501.16612","last_updated":"2025-01-28T01:14:24Z","snapshot_observed_at":"2026-08-12T21:39:57.859742Z","submitted_at":"2025-01-28T01:14:24Z","title":"CascadeV: An Implementation of Wurstchen Architecture for Video Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T12:00:07.546927Z"},"links":{"citing_paper":"/paper/2501.16612"},"observation_digest":"sha256:f1f3473945da937eac0feaa9575b15d2111bd4d0610aa749de732d2a3dea26dd","observation_id":"ba8baa46-7b33-4af4-8cdc-c25bdf5f59ad","resolution":{"observed_at":"2026-08-10T12:00:07.922856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T12:00:07.549638Z","title":"Dpm-solver: A fast ode solver for diffusion probabilistic model sampling in around 10 steps","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.16612","last_updated":"2025-01-28T01:14:24Z","snapshot_observed_at":"2026-08-12T21:39:57.859742Z","submitted_at":"2025-01-28T01:14:24Z","title":"CascadeV: An Implementation of Wurstchen Architecture for Video Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T12:00:07.549638Z"},"links":{"citing_paper":"/paper/2501.16612"},"observation_digest":"sha256:1474adb540d44dbf29205737a9dc7639fb8be620188534959b9917574d474086","observation_id":"ab5e6958-ecdf-4405-b29a-efcfec371f79","resolution":{"observed_at":"2026-08-10T12:00:07.549638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T12:00:07.552437Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.16612","last_updated":"2025-01-28T01:14:24Z","snapshot_observed_at":"2026-08-12T21:39:57.859742Z","submitted_at":"2025-01-28T01:14:24Z","title":"CascadeV: An Implementation of Wurstchen Architecture for Video Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T12:00:07.552437Z"},"links":{"citing_paper":"/paper/2501.16612"},"observation_digest":"sha256:d8548f5310c8f490a9267eaa051500f80f894e92061acf5899e7582d49e30ba1","observation_id":"278faf0a-3cac-43c0-9e13-41d2360a10b4","resolution":{"observed_at":"2026-08-10T12:00:07.552437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T12:00:07.555276Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.16612","last_updated":"2025-01-28T01:14:24Z","snapshot_observed_at":"2026-08-12T21:39:57.859742Z","submitted_at":"2025-01-28T01:14:24Z","title":"CascadeV: An Implementation of Wurstchen Architecture for Video Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T12:00:07.555276Z"},"links":{"citing_paper":"/paper/2501.16612"},"observation_digest":"sha256:f68c45113161eb257c2b3d500ab63fa356e496c866d410c97705c0310010d26b","observation_id":"d9a6e499-59d0-4367-8040-73e6214f5f1a","resolution":{"observed_at":"2026-08-10T12:00:07.555276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T12:00:07.558082Z","title":"Cascaded diffusion models for high fidelity image generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.16612","last_updated":"2025-01-28T01:14:24Z","snapshot_observed_at":"2026-08-12T21:39:57.859742Z","submitted_at":"2025-01-28T01:14:24Z","title":"CascadeV: An Implementation of Wurstchen Architecture for Video Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T12:00:07.558082Z"},"links":{"citing_paper":"/paper/2501.16612"},"observation_digest":"sha256:6e814c7a9fc77aafd971d52062cea3134cd52ca0f293507b4a060415dab299c6","observation_id":"697a4bc4-a9d5-4b9b-80cc-c10db627c8a8","resolution":{"observed_at":"2026-08-10T12:00:07.558082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-08-14T22:54:08.184266Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-10T12:00:07.561135Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.16612","last_updated":"2025-01-28T01:14:24Z","snapshot_observed_at":"2026-08-12T21:39:57.859742Z","submitted_at":"2025-01-28T01:14:24Z","title":"CascadeV: An Implementation of Wurstchen Architecture for Video Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T12:00:07.561135Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2501.16612"},"observation_digest":"sha256:c2ebe0a5f40e6c156cae8d621c8525f965347e549e9c490c9a60835df2c97706","observation_id":"040fc9b1-b585-4dcf-92c1-e29fdfb19886","resolution":{"observed_at":"2026-08-10T12:00:07.561135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T12:00:07.564106Z","title":"U-net: Convolutional networks for biomedical image segmentation","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.16612","last_updated":"2025-01-28T01:14:24Z","snapshot_observed_at":"2026-08-12T21:39:57.859742Z","submitted_at":"2025-01-28T01:14:24Z","title":"CascadeV: An Implementation of Wurstchen Architecture for Video Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T12:00:07.564106Z"},"links":{"citing_paper":"/paper/2501.16612"},"observation_digest":"sha256:8463deff92440be48d1b71b8e9257ec2baf40e613044c03cea983b2603c4ed26","observation_id":"a7e2dfdc-6996-4479-bfd5-6d511849782d","resolution":{"observed_at":"2026-08-10T12:00:07.564106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.10157","last_updated":"2021-09-14T21:20:06Z","snapshot_observed_at":"2026-08-17T06:54:13.493934Z","submitted_at":"2021-04-20T17:58:03Z","title":"VideoGPT: Video Generation using VQ-VAE and Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.10157","snapshot_observed_at":"2026-08-10T12:00:07.566890Z","title":"Videogpt: Video generation using vq-vae and transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.16612","last_updated":"2025-01-28T01:14:24Z","snapshot_observed_at":"2026-08-12T21:39:57.859742Z","submitted_at":"2025-01-28T01:14:24Z","title":"CascadeV: An Implementation of Wurstchen Architecture for Video Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T12:00:07.566890Z"},"links":{"cited_paper":"/paper/2104.10157","citing_paper":"/paper/2501.16612"},"observation_digest":"sha256:1e3bec562de9c4551eb1139d040b5b17a81467645b92ad28153cf8d701e9398b","observation_id":"f411d5ae-db90-45e7-8995-21c69f7e07a6","resolution":{"observed_at":"2026-08-10T12:00:07.566890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T12:00:07.879441Z","title":"Nüwa: Visual synthesis pre-training for neural visual world creation","venue":null,"work_id":"3c279a4a-b233-46ff-9b68-056f69c06736","year":2022},"citing_paper":{"arxiv_id":"2501.16612","last_updated":"2025-01-28T01:14:24Z","snapshot_observed_at":"2026-08-12T21:39:57.859742Z","submitted_at":"2025-01-28T01:14:24Z","title":"CascadeV: An Implementation of Wurstchen Architecture for Video Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T12:00:07.569746Z"},"links":{"citing_paper":"/paper/2501.16612"},"observation_digest":"sha256:fe006437931933956a2f5404378d8ce356cf551de20c3ce4899e698a7c6d665c","observation_id":"28b14e66-0f13-462f-8c7c-056a29bac35f","resolution":{"observed_at":"2026-08-10T12:00:07.882863Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T12:00:07.572850Z","title":"Scaling autoregressive video models","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.16612","last_updated":"2025-01-28T01:14:24Z","snapshot_observed_at":"2026-08-12T21:39:57.859742Z","submitted_at":"2025-01-28T01:14:24Z","title":"CascadeV: An Implementation of Wurstchen Architecture for Video Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T12:00:07.572850Z"},"links":{"citing_paper":"/paper/2501.16612"},"observation_digest":"sha256:05cbddcc8c22233d46755528d35838161a42c830db0d6024be49ce3e3165770b","observation_id":"fb9ffba7-55bb-4ef4-b0c6-8be68f42956c","resolution":{"observed_at":"2026-08-10T12:00:07.572850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T12:00:07.862843Z","title":"Generating videos with dynamics-aware implicit generative adversarial networks","venue":null,"work_id":"93e2a6c7-b9c1-44c3-b7a5-7414a6b6c41f","year":2022},"citing_paper":{"arxiv_id":"2501.16612","last_updated":"2025-01-28T01:14:24Z","snapshot_observed_at":"2026-08-12T21:39:57.859742Z","submitted_at":"2025-01-28T01:14:24Z","title":"CascadeV: An Implementation of Wurstchen Architecture for Video Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T12:00:07.575709Z"},"links":{"citing_paper":"/paper/2501.16612"},"observation_digest":"sha256:118f4f70b784acd17d8aa460d6ee9e9f5e325291a1af254c287f55ac898a3f3a","observation_id":"02e42b0f-4c6e-475c-92fd-77a2c422722f","resolution":{"observed_at":"2026-08-10T12:00:07.866494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T12:00:07.852982Z","title":"G3an: Disentangling appearance and motion for video generation","venue":null,"work_id":"962e82c9-9932-4303-81e1-610763e7565e","year":2020},"citing_paper":{"arxiv_id":"2501.16612","last_updated":"2025-01-28T01:14:24Z","snapshot_observed_at":"2026-08-12T21:39:57.859742Z","submitted_at":"2025-01-28T01:14:24Z","title":"CascadeV: An Implementation of Wurstchen Architecture for Video Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T12:00:07.578264Z"},"links":{"citing_paper":"/paper/2501.16612"},"observation_digest":"sha256:5101b5970e6b1da5cd005016f44e0805f9908971a1bd792e39233449607c577c","observation_id":"4838953e-8c76-4e7f-9f49-1a7f8f1f2cf0","resolution":{"observed_at":"2026-08-10T12:00:07.856682Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T12:00:07.842526Z","title":"A good image generator is what you need for high-resolution video synthesis","venue":null,"work_id":"b375da48-97f8-4a4a-9c51-bff84caf60e2","year":2020},"citing_paper":{"arxiv_id":"2501.16612","last_updated":"2025-01-28T01:14:24Z","snapshot_observed_at":"2026-08-12T21:39:57.859742Z","submitted_at":"2025-01-28T01:14:24Z","title":"CascadeV: An Implementation of Wurstchen Architecture for Video Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T12:00:07.580868Z"},"links":{"citing_paper":"/paper/2501.16612"},"observation_digest":"sha256:f1bd2e2e50db1413378d9b58c0274432c76883cefbe742fe61174671cfb742ad","observation_id":"fe0eef62-994a-4c15-b0a5-e8f405f10c5e","resolution":{"observed_at":"2026-08-10T12:00:07.846578Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T12:00:07.833647Z","title":"Long video generation with time-agnostic vqgan and time-sensitive transformer","venue":null,"work_id":"813c252d-a67a-4e53-9a85-078d1648ce97","year":2022},"citing_paper":{"arxiv_id":"2501.16612","last_updated":"2025-01-28T01:14:24Z","snapshot_observed_at":"2026-08-12T21:39:57.859742Z","submitted_at":"2025-01-28T01:14:24Z","title":"CascadeV: An Implementation of Wurstchen Architecture for Video Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T12:00:07.584225Z"},"links":{"citing_paper":"/paper/2501.16612"},"observation_digest":"sha256:f79612673bc69d867389363e96b05ed13c6672079e517c7e94ad616aea55ee1f","observation_id":"14ce93e9-fa66-41e0-a838-95c6ea1c4890","resolution":{"observed_at":"2026-08-10T12:00:07.836717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T12:00:07.824273Z","title":"Cogvideo: Large-scale pretraining for text-to-video generation via transformers","venue":null,"work_id":"d17e0c5a-91cc-4308-80ac-53fd5c83c91c","year":2022},"citing_paper":{"arxiv_id":"2501.16612","last_updated":"2025-01-28T01:14:24Z","snapshot_observed_at":"2026-08-12T21:39:57.859742Z","submitted_at":"2025-01-28T01:14:24Z","title":"CascadeV: An Implementation of Wurstchen Architecture for Video Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T12:00:07.587063Z"},"links":{"citing_paper":"/paper/2501.16612"},"observation_digest":"sha256:3cdbea339d2286f42322b01a002d4e6792f507a8514cfe025e83c7ac685a5e3a","observation_id":"03f80efb-9001-479f-905e-57ad06d156e7","resolution":{"observed_at":"2026-08-10T12:00:07.827507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14125","last_updated":"2024-06-04T17:25:20Z","snapshot_observed_at":"2026-08-14T12:12:01.418974Z","submitted_at":"2023-12-21T18:46:41Z","title":"VideoPoet: A Large Language Model for Zero-Shot Video Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14125","snapshot_observed_at":"2026-08-10T12:00:07.589676Z","title":"Videopoet: A large language model for zero-shot video generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.16612","last_updated":"2025-01-28T01:14:24Z","snapshot_observed_at":"2026-08-12T21:39:57.859742Z","submitted_at":"2025-01-28T01:14:24Z","title":"CascadeV: An Implementation of Wurstchen Architecture for Video Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T12:00:07.589676Z"},"links":{"cited_paper":"/paper/2312.14125","citing_paper":"/paper/2501.16612"},"observation_digest":"sha256:5bd5b1944b36b16e1f599c5757422c3f66aab4e8ec700f95a0b2cb8e300800fb","observation_id":"05b43a01-c016-4d16-a4b8-71aa2171a99a","resolution":{"observed_at":"2026-08-10T12:00:07.589676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02303","last_updated":"2022-10-05T14:41:38Z","snapshot_observed_at":"2026-08-18T00:41:06.039123Z","submitted_at":"2022-10-05T14:41:38Z","title":"Imagen Video: High Definition Video Generation with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02303","snapshot_observed_at":"2026-08-10T12:00:07.592366Z","title":"Imagen video: High definition video generation with diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16612","last_updated":"2025-01-28T01:14:24Z","snapshot_observed_at":"2026-08-12T21:39:57.859742Z","submitted_at":"2025-01-28T01:14:24Z","title":"CascadeV: An Implementation of Wurstchen Architecture for Video Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T12:00:07.592366Z"},"links":{"cited_paper":"/paper/2210.02303","citing_paper":"/paper/2501.16612"},"observation_digest":"sha256:a8cf436fb04367566d802574b566c22ac68fa105786dba438a83a9069c35f0c6","observation_id":"56864b0b-2d04-4296-9626-974e79d1c78f","resolution":{"observed_at":"2026-08-10T12:00:07.592366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14792","last_updated":"2022-09-29T13:59:46Z","snapshot_observed_at":"2026-07-06T13:57:47.051387Z","submitted_at":"2022-09-29T13:59:46Z","title":"Make-A-Video: Text-to-Video Generation without Text-Video Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14792","snapshot_observed_at":"2026-08-10T12:00:07.596012Z","title":"Make-a-video: Text-to-video generation without text-video data","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.16612","last_updated":"2025-01-28T01:14:24Z","snapshot_observed_at":"2026-08-12T21:39:57.859742Z","submitted_at":"2025-01-28T01:14:24Z","title":"CascadeV: An Implementation of Wurstchen Architecture for Video Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T12:00:07.596012Z"},"links":{"cited_paper":"/paper/2209.14792","citing_paper":"/paper/2501.16612"},"observation_digest":"sha256:8e1e2318b7deb5e47b6fef86652dd7c08056e430f754b20a38c28c656d1a4a6d","observation_id":"66fef037-fd61-4d08-8d73-8aababdcc9ab","resolution":{"observed_at":"2026-08-10T12:00:07.596012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T12:00:07.599393Z","title":"Align your latents: High-resolution video synthesis with latent diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.16612","last_updated":"2025-01-28T01:14:24Z","snapshot_observed_at":"2026-08-12T21:39:57.859742Z","submitted_at":"2025-01-28T01:14:24Z","title":"CascadeV: An Implementation of Wurstchen Architecture for Video Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T12:00:07.599393Z"},"links":{"citing_paper":"/paper/2501.16612"},"observation_digest":"sha256:b9e746e3a06aeace1e4792db8f67023946e6f18af6f84c5180aa9bd07b0e9d70","observation_id":"0674cb40-8e99-49fb-b37e-6ced78f7f731","resolution":{"observed_at":"2026-08-10T12:00:07.599393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T12:00:07.809105Z","title":"Preserve your own correlation: A noise prior for video diffusion models","venue":null,"work_id":"5e0f5492-71b2-4d32-9271-535b0fbc45ca","year":2023},"citing_paper":{"arxiv_id":"2501.16612","last_updated":"2025-01-28T01:14:24Z","snapshot_observed_at":"2026-08-12T21:39:57.859742Z","submitted_at":"2025-01-28T01:14:24Z","title":"CascadeV: An Implementation of Wurstchen Architecture for Video Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T12:00:07.602477Z"},"links":{"citing_paper":"/paper/2501.16612"},"observation_digest":"sha256:537f29801521964d8c4a0fb44efefdbdd41b18088500efd7d7ca98220d82174d","observation_id":"eda86ece-9270-4a45-8e0d-da057172be1c","resolution":{"observed_at":"2026-08-10T12:00:07.812344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-08-17T16:16:01.560363Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-08-10T12:00:07.605544Z","title":"Latent video diffusion models for high-fidelity long video generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.16612","last_updated":"2025-01-28T01:14:24Z","snapshot_observed_at":"2026-08-12T21:39:57.859742Z","submitted_at":"2025-01-28T01:14:24Z","title":"CascadeV: An Implementation of Wurstchen Architecture for Video Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T12:00:07.605544Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2501.16612"},"observation_digest":"sha256:151ad8732e8453980fb74e9a9b01c57f701537fe90e2446984ca7a6427f70d80","observation_id":"257aaeca-67d1-44f8-9f5d-fb344834766f","resolution":{"observed_at":"2026-08-10T12:00:07.605544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T12:00:07.799241Z","title":"Video probabilistic diffusion models in projected latent space","venue":null,"work_id":"18eacfd2-78de-4096-9b10-21195d942bdd","year":2023},"citing_paper":{"arxiv_id":"2501.16612","last_updated":"2025-01-28T01:14:24Z","snapshot_observed_at":"2026-08-12T21:39:57.859742Z","submitted_at":"2025-01-28T01:14:24Z","title":"CascadeV: An Implementation of Wurstchen Architecture for Video Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T12:00:07.609106Z"},"links":{"citing_paper":"/paper/2501.16612"},"observation_digest":"sha256:266465e5849df7fb588d9009f09016c5c818915ea842f1b2b7bcfd9b4e6c69c7","observation_id":"09d9de7f-6820-4423-bf82-8bbe34fd42a6","resolution":{"observed_at":"2026-08-10T12:00:07.803031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T12:00:07.612105Z","title":"Video diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.16612","last_updated":"2025-01-28T01:14:24Z","snapshot_observed_at":"2026-08-12T21:39:57.859742Z","submitted_at":"2025-01-28T01:14:24Z","title":"CascadeV: An Implementation of Wurstchen Architecture for Video Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T12:00:07.612105Z"},"links":{"citing_paper":"/paper/2501.16612"},"observation_digest":"sha256:d98a993e61466709be916b2680419f61335050abdd5e1dabd1800a84f2020c6b","observation_id":"75f12e4e-6ec3-45d0-ab63-696dc9e010d7","resolution":{"observed_at":"2026-08-10T12:00:07.612105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04145","last_updated":"2023-11-07T17:16:06Z","snapshot_observed_at":"2026-08-02T12:25:34.488259Z","submitted_at":"2023-11-07T17:16:06Z","title":"I2VGen-XL: High-Quality Image-to-Video Synthesis via Cascaded Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04145","snapshot_observed_at":"2026-08-10T12:00:07.615235Z","title":"I2vgen-xl: High-quality image-to-video synthesis via cascaded diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.16612","last_updated":"2025-01-28T01:14:24Z","snapshot_observed_at":"2026-08-12T21:39:57.859742Z","submitted_at":"2025-01-28T01:14:24Z","title":"CascadeV: An Implementation of Wurstchen Architecture for Video Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T12:00:07.615235Z"},"links":{"cited_paper":"/paper/2311.04145","citing_paper":"/paper/2501.16612"},"observation_digest":"sha256:d33a1153708b4f986401a8c0e3041fccc203b5996758f3f71b3239666cf91e52","observation_id":"a5b52d57-cecf-4a78-b8ef-f6fc858df4f1","resolution":{"observed_at":"2026-08-10T12:00:07.615235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04692","last_updated":"2024-03-17T16:59:25Z","snapshot_observed_at":"2026-08-16T14:11:52.899972Z","submitted_at":"2024-03-07T17:41:37Z","title":"PixArt-\\Sigma: Weak-to-Strong Training of Diffusion Transformer for 4K Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04692","snapshot_observed_at":"2026-08-10T12:00:07.618533Z","title":"Pixart- \\sigma: Weak-to-strong training of diffusion transformer for 4k text-to-image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.16612","last_updated":"2025-01-28T01:14:24Z","snapshot_observed_at":"2026-08-12T21:39:57.859742Z","submitted_at":"2025-01-28T01:14:24Z","title":"CascadeV: An Implementation of Wurstchen Architecture for Video Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T12:00:07.618533Z"},"links":{"cited_paper":"/paper/2403.04692","citing_paper":"/paper/2501.16612"},"observation_digest":"sha256:0848fcac6dfc03eb98bbc8e06330a0c59056ac29759257c00a4945068259aee6","observation_id":"49dfba87-cf53-465a-97d9-1e611b1def88","resolution":{"observed_at":"2026-08-10T12:00:07.618533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T12:00:07.784829Z","title":"Adapool: Exponential adaptive pooling for information-retaining downsampling","venue":null,"work_id":"a6f91e55-8bc8-489e-8e9c-e3fca5f74e86","year":2022},"citing_paper":{"arxiv_id":"2501.16612","last_updated":"2025-01-28T01:14:24Z","snapshot_observed_at":"2026-08-12T21:39:57.859742Z","submitted_at":"2025-01-28T01:14:24Z","title":"CascadeV: An Implementation of Wurstchen Architecture for Video Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T12:00:07.621442Z"},"links":{"citing_paper":"/paper/2501.16612"},"observation_digest":"sha256:eeb677d0e5537f60715898419b5e46b72864f6dac9bccc91f662d01b25f3310e","observation_id":"1ebee318-0d55-4d3e-96cb-d9a58333f425","resolution":{"observed_at":"2026-08-10T12:00:07.787823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T12:00:07.776214Z","title":"Easyani- mate: A high-performance long video generation method based on transformer architecture, 2024","venue":null,"work_id":"fff94ebf-99f7-4746-ab6f-2431e742fa8f","year":2024},"citing_paper":{"arxiv_id":"2501.16612","last_updated":"2025-01-28T01:14:24Z","snapshot_observed_at":"2026-08-12T21:39:57.859742Z","submitted_at":"2025-01-28T01:14:24Z","title":"CascadeV: An Implementation of Wurstchen Architecture for Video Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T12:00:07.623976Z"},"links":{"citing_paper":"/paper/2501.16612"},"observation_digest":"sha256:911b9045349908bc283d05b59873fa6d4ce2185edc8cc941b21871d948afdc43","observation_id":"35906e2c-0d5d-4015-b234-42cb2520cbc9","resolution":{"observed_at":"2026-08-10T12:00:07.779389Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T12:00:07.765810Z","title":"VBench: Comprehensive benchmark suite for video generative models","venue":null,"work_id":"ad50fd28-0a1e-432b-a91f-bb7932251f3f","year":2024},"citing_paper":{"arxiv_id":"2501.16612","last_updated":"2025-01-28T01:14:24Z","snapshot_observed_at":"2026-08-12T21:39:57.859742Z","submitted_at":"2025-01-28T01:14:24Z","title":"CascadeV: An Implementation of Wurstchen Architecture for Video Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T12:00:07.626602Z"},"links":{"citing_paper":"/paper/2501.16612"},"observation_digest":"sha256:056d93344b5c1ce533595ac2ea8595f507431e1274dfc881a4833cb3145ce1d5","observation_id":"9a9eb359-25bf-4fdc-b341-0f29f44487b0","resolution":{"observed_at":"2026-08-10T12:00:07.770304Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.16612","last_updated":"2025-01-28T01:14:24Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T21:39:57.859742Z","submitted_at":"2025-01-28T01:14:24Z","title":"CascadeV: An Implementation of Wurstchen Architecture for Video Generation"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":27,"verified_exact":0,"verified_fuzzy":16},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 1 inbound Pith citation observation for arXiv:2501.16612."}