{"as_of":"2026-08-14T12:19:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:da7ab9f03101a9353c9321f01aa9176f5a207ab8751acd86c8f87fad0fdcf9c1","coverage":[{"denominator":110,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:51:31.757497Z","state":"measured"},{"denominator":101,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":101,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T13:41:42.111186Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-09T23:14:03.004938Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.07202","snapshot_observed_at":"2026-08-01T13:41:42.111186Z","title":"A survey on long-video storytelling generation: Architectures, consistency, and cinematic quality.arXiv preprint arXiv:2507.07202, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19038","last_updated":"2026-07-21T12:28:58Z","snapshot_observed_at":"2026-08-14T00:03:52.782480Z","submitted_at":"2026-07-21T12:28:58Z","title":"FilmWorld: Agentic Novel-to-Film Generation through Dynamic Cinematic World Modeling","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T13:41:42.111186Z"},"links":{"cited_paper":"/paper/2507.07202","citing_paper":"/paper/2607.19038"},"observation_digest":"sha256:64d0c55a1fdc0b9d53e890ef72a159cef96b581b5b01330f5b1608c805ae1a17","observation_id":"01be779b-48f3-4e5c-be87-d677397da751","resolution":{"observed_at":"2026-08-01T13:41:42.111186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.07202/citation-record","integrity":"/paper/2507.07202/integrity","json":"/paper/2507.07202/citation-record.json","paper":"/paper/2507.07202"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:24.002704Z","title":"Frozen in time: A joint video and image encoder for end-to-end retrieval","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-09T23:14:03.004938Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:24.002704Z"},"links":{"citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:05ed725433dd65cf2da8c6b299a43f251c3ceea381308feed0f5318983a084a0","observation_id":"b94a691a-eb77-415d-84b9-0688d3d65428","resolution":{"observed_at":"2026-08-06T18:51:24.002704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12945","last_updated":"2024-02-05T16:36:30Z","snapshot_observed_at":"2026-08-13T04:36:44.594755Z","submitted_at":"2024-01-23T18:05:25Z","title":"Lumiere: A Space-Time Diffusion Model for Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12945","snapshot_observed_at":"2026-08-06T18:51:24.068306Z","title":"Lumiere: A space-time diffusion model for video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-09T23:14:03.004938Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:24.068306Z"},"links":{"cited_paper":"/paper/2401.12945","citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:94de007d3dd2997be76bfa088bf5666932cd98b4e06b4078d0be4e2168f7d527","observation_id":"e31a678e-b35e-4cab-af6a-b1a2482c01da","resolution":{"observed_at":"2026-08-06T18:51:24.068306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:24.169776Z","title":"Is space-time attention all you need for video understanding? In Proceedings of the 38th International Conference on Ma- chine Learning (ICML), pages 813–824","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-09T23:14:03.004938Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:24.169776Z"},"links":{"citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:6ef54a245847f2c51e9c1d26306c160619339ca27369decc1816fb235fead07e","observation_id":"a3e5038a-6c1b-4730-8a7d-dee5bdec4704","resolution":{"observed_at":"2026-08-06T18:51:24.169776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.03429","last_updated":"2022-06-09T06:24:12Z","snapshot_observed_at":"2026-08-13T15:28:33.705697Z","submitted_at":"2022-06-07T16:29:51Z","title":"Generating Long Videos of Dynamic Scenes","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.03429","snapshot_observed_at":"2026-08-06T18:51:24.241885Z","title":"Efros, and Tero Karras","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-09T23:14:03.004938Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:24.241885Z"},"links":{"cited_paper":"/paper/2206.03429","citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:b84247bb1fad94ee4d9b55f932e441dff02f4614c1f86db65ebb1b4cb46797a5","observation_id":"e8e5648f-1b7b-4433-85bb-64a28f7f72c9","resolution":{"observed_at":"2026-08-06T18:51:24.241885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:24.367980Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-09T23:14:03.004938Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:24.367980Z"},"links":{"citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:a66300e69f84ceaf01082d71e651474dfd9e508c188c5f2d3e3642d08839616d","observation_id":"157891b2-3d5e-4a19-b32e-a82f76fdbc3b","resolution":{"observed_at":"2026-08-06T18:51:24.367980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13074","last_updated":"2025-04-21T10:34:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-17T16:37:27Z","title":"SkyReels-V2: Infinite-length Film Generative Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13074","snapshot_observed_at":"2026-08-06T18:51:24.412898Z","title":"Skyreels-v2: Infinite-length film generative model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-09T23:14:03.004938Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:24.412898Z"},"links":{"cited_paper":"/paper/2504.13074","citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:87abe47b76ae2f89c34742fb6ecc8eb68714f4dfc74d12db413bfe8381b42938","observation_id":"a939f0a1-a0a5-4ace-ab90-69434ac45f4b","resolution":{"observed_at":"2026-08-06T18:51:24.412898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:24.497048Z","title":"Pixart- α: Fast train- ing of diffusion transformer for photorealistic text-to-image synthesis, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-09T23:14:03.004938Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:24.497048Z"},"links":{"citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:0eedc67a5110535cd039502edcf3f76486ddb448cbf0a022ca1f4a6477bd461c","observation_id":"5b10905a-0c5e-4e86-8436-51d7b60dede4","resolution":{"observed_at":"2026-08-06T18:51:24.497048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:24.568977Z","title":"Panda-70m: Captioning 70m videos with multiple cross-modality teachers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-09T23:14:03.004938Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:24.568977Z"},"links":{"citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:fe9165ed567d15c74ae528aa82f64764b076caf6ec9099ecd57d422ad4e2d5ce","observation_id":"9b81b3cc-7a17-45a0-be57-63b4dca53bfd","resolution":{"observed_at":"2026-08-06T18:51:24.568977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19479","last_updated":"2024-02-29T18:59:50Z","snapshot_observed_at":"2026-08-14T07:36:16.844137Z","submitted_at":"2024-02-29T18:59:50Z","title":"Panda-70M: Captioning 70M Videos with Multiple Cross-Modality Teachers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19479","snapshot_observed_at":"2026-08-06T18:51:24.668995Z","title":"Panda-70m: Captioning 70m videos with multiple cross-modality teachers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-09T23:14:03.004938Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:24.668995Z"},"links":{"cited_paper":"/paper/2402.19479","citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:54b14479319581456f65a5790bd9c807645a696f92a4a7944822cadfa43379d3","observation_id":"4ae97d87-06df-42d8-83df-1ca90836f6c6","resolution":{"observed_at":"2026-08-06T18:51:24.668995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:24.735298Z","title":"Multi-subject open-set personalization in video generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-09T23:14:03.004938Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:24.735298Z"},"links":{"citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:df4b7aeea20ed73eba46a971d1ab0c7111260ed56e093e09de3642438d7f3c29","observation_id":"da6cfe17-97e9-49b9-9301-a12ff7e27cb2","resolution":{"observed_at":"2026-08-06T18:51:24.735298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:24.807647Z","title":"Seine: Short-to-long video diffusion model for generative transition and prediction","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-09T23:14:03.004938Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:24.807647Z"},"links":{"citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:ffb496bdc8501b2473ca70d561b6571b5b383e5b12170f5d448d646d6e048e29","observation_id":"1b6bbcf0-5e04-4977-adf3-2be0877510d1","resolution":{"observed_at":"2026-08-06T18:51:24.807647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20156","last_updated":"2025-06-03T15:15:31Z","snapshot_observed_at":"2026-08-07T13:55:40.621856Z","submitted_at":"2025-05-26T15:57:27Z","title":"HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20156","snapshot_observed_at":"2026-08-06T18:51:24.893203Z","title":"Hunyuanvideo-avatar: High-fidelity audio-driven hu- man animation for multiple characters","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-09T23:14:03.004938Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:24.893203Z"},"links":{"cited_paper":"/paper/2505.20156","citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:56ff69226037566b79972a1e5bdc89d2bf7367a62914a58a02910e80b3ca2e45","observation_id":"79609944-7dee-4bd5-aeee-e6dcfefb663d","resolution":{"observed_at":"2026-08-06T18:51:24.893203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:24.996882Z","title":"Unimax: Fairer and more effective language sampling for large-scale multilingual pretraining","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-09T23:14:03.004938Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:24.996882Z"},"links":{"citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:93fcff3c719b25977eb146f5eccc9c8031683c040d6cf32335d636ea99226018","observation_id":"97c88819-f091-44d0-80e6-7f03cec56924","resolution":{"observed_at":"2026-08-06T18:51:24.996882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:25.096771Z","title":"Zhao, Yanping Huang, An- drew M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-09T23:14:03.004938Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:25.096771Z"},"links":{"citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:749640bc026fb1521cc073ee973b33005d97d4607ff702f166e3166c049b21d3","observation_id":"dec23150-c339-4940-89cf-4e4bcef08eec","resolution":{"observed_at":"2026-08-06T18:51:25.096771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:25.165135Z","title":"Efficient video prediction via sparsely conditioned flow matching","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-09T23:14:03.004938Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:25.165135Z"},"links":{"citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:7b1ff52be942ee7c45776c55f75dcddb4171006999fc3371e8d97ba3d0417bbd","observation_id":"8c3ace60-0f84-4185-97fc-77933b4cf28c","resolution":{"observed_at":"2026-08-06T18:51:25.165135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:25.262633Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-09T23:14:03.004938Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:25.262633Z"},"links":{"citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:5e6a6b53b958be97b56a9c1d23410eb8e53551694859b7829f8990cc3511b819","observation_id":"09d01f88-6286-4db2-a306-09979a1da62b","resolution":{"observed_at":"2026-08-06T18:51:25.262633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:25.343816Z","title":"Scaling rectified flow transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-09T23:14:03.004938Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:25.343816Z"},"links":{"citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:648e9e90f175a005166d409aed3a582e8d82666b203bf1ecc3d37fe18c0f67c8","observation_id":"467800da-d809-462b-929f-532a496a77f5","resolution":{"observed_at":"2026-08-06T18:51:25.343816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:25.427361Z","title":"Ca2-vdm: Efficient autoregres- sive video diffusion model with causal generation and cache sharing","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-09T23:14:03.004938Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:25.427361Z"},"links":{"citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:d301bed43d33a8f1d02dcd4dea2ac9b6ec9d29697593fbf6fbe23a6a98e9ae8a","observation_id":"01543e06-f156-483f-9450-0f16dc4bce26","resolution":{"observed_at":"2026-08-06T18:51:25.427361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:25.487912Z","title":"Berg, Arash Vah- dat, Alexei A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-09T23:14:03.004938Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:25.487912Z"},"links":{"citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:c13860c0aff277357b40ffa13e9cad803629c4772b13ecc456038fb902ea4ee6","observation_id":"8c26b3bf-c206-4a97-b9b7-d19f0d5f3a80","resolution":{"observed_at":"2026-08-06T18:51:25.487912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09113","last_updated":"2025-06-28T11:58:23Z","snapshot_observed_at":"2026-08-09T02:36:54.979612Z","submitted_at":"2025-06-10T17:56:11Z","title":"Seedance 1.0: Exploring the Boundaries of Video Generation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09113","snapshot_observed_at":"2026-08-06T18:51:25.538623Z","title":"Seedance 1.0: Exploring the boundaries of video generation models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-09T23:14:03.004938Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:25.538623Z"},"links":{"cited_paper":"/paper/2506.09113","citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:812859fd48cb5082443b6351453751d66638952faa20cfcf70e11a18a92c2887","observation_id":"12a2a0a7-d6a8-42dc-9b9e-ce9c5b091005","resolution":{"observed_at":"2026-08-06T18:51:25.538623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:25.587961Z","title":"Zico Kolter, and Kaiming He","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-09T23:14:03.004938Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:25.587961Z"},"links":{"citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:a80e204db1d72dffa27b77bf78bbc936718f2697d59328455942f3fe15f846a8","observation_id":"0f4120ff-7f4d-4994-96ff-2b597a561a2c","resolution":{"observed_at":"2026-08-06T18:51:25.587961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:25.668222Z","title":"Veo 3: Neural video generation with native audio","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-09T23:14:03.004938Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:25.668222Z"},"links":{"citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:696109231e18c184f495c5e4cf20b72f916474596435f8c31bda99b2189327e3","observation_id":"bd2b6afa-ceff-42da-9e82-3472f370d1d2","resolution":{"observed_at":"2026-08-06T18:51:25.668222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:25.762753Z","title":"Animatediff: Animate your personalized text-to-image models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-09T23:14:03.004938Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:25.762753Z"},"links":{"citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:4c4eee37db582018d667838e234508396b94231d78cf972ac8a4d818ac0ddd4b","observation_id":"d5f63aa6-20b5-4b09-9f41-02afe4000d2e","resolution":{"observed_at":"2026-08-06T18:51:25.762753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00103","last_updated":"2024-12-30T19:00:25Z","snapshot_observed_at":"2026-07-06T20:14:54.297131Z","submitted_at":"2024-12-30T19:00:25Z","title":"LTX-Video: Realtime Video Latent Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00103","snapshot_observed_at":"2026-08-06T18:51:25.825780Z","title":"Ltx-video: Realtime video latent diffusion","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-09T23:14:03.004938Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:25.825780Z"},"links":{"cited_paper":"/paper/2501.00103","citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:03d1c6567e8e6c2cbb7e694d37d8bdb491e74ebb0b34a69e09118e5e89825fd1","observation_id":"17d3516f-6d2e-4467-877e-ccfcaba77b2a","resolution":{"observed_at":"2026-08-06T18:51:25.825780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:25.897788Z","title":"Clipscore: A reference-free eval- uation metric for image captioning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-09T23:14:03.004938Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:25.897788Z"},"links":{"citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:0fb051d4ba5a4b9695a7e09c25054dca50f777378901fd50f9433c47985b0bb7","observation_id":"ab2eda46-0dcb-4226-a0ed-2acf84203285","resolution":{"observed_at":"2026-08-06T18:51:25.897788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:25.982396Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilib- rium","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-09T23:14:03.004938Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:25.982396Z"},"links":{"citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:36ded723e3253e265ac4755feba0ee91c6ae245700135cb4d66a56fd626819ba","observation_id":"a8ecd40b-fb18-4ba6-89da-10c64e9d3d41","resolution":{"observed_at":"2026-08-06T18:51:25.982396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:26.076771Z","title":"Denoising dif- fusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-09T23:14:03.004938Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:26.076771Z"},"links":{"citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:9b24ca694e2b029f5e4ec263337d0907bf1ea8e13a76608e9aac8914c68eefad","observation_id":"0d792ce2-6701-4d6a-885e-5cace2211c75","resolution":{"observed_at":"2026-08-06T18:51:26.076771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:26.143548Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-09T23:14:03.004938Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:26.143548Z"},"links":{"citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:a80cfc628c9a202917414a5f57930b36a6b0ea5cca4863b6eb81aeb4bd744ea0","observation_id":"724d2876-d37d-46f0-b8d8-783c86ffe333","resolution":{"observed_at":"2026-08-06T18:51:26.143548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-06T18:51:26.211695Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-09T23:14:03.004938Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:26.211695Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:0d07ba3420fe66e3af19c4209fd03bae76acf67a32d5d865118ef786ac5a304d","observation_id":"a2cc2f49-fcca-40a1-acd1-754b6f86eb82","resolution":{"observed_at":"2026-08-06T18:51:26.211695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-06T18:51:26.294142Z","title":"Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen- Zhu, Yuanzhi Li, Shean Wang, Lu Wang, and Weizhu Chen","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-09T23:14:03.004938Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:26.294142Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:3cd98eab8790457ca8d0010e8aaaf8ba0fc8dfe67feb808b39a8cc62662dcc5a","observation_id":"b0fe2f5a-e804-4281-9262-52d1888ca8e0","resolution":{"observed_at":"2026-08-06T18:51:26.294142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04512","last_updated":"2025-05-08T08:29:00Z","snapshot_observed_at":"2026-08-08T15:15:48.227139Z","submitted_at":"2025-05-07T15:33:18Z","title":"HunyuanCustom: A Multimodal-Driven Architecture for Customized Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.04512","snapshot_observed_at":"2026-08-06T18:51:26.356204Z","title":"Hunyuancustom: A multimodal-driven architecture for customized video gen- eration","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-09T23:14:03.004938Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:26.356204Z"},"links":{"cited_paper":"/paper/2505.04512","citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:e41b68c3e57e55679fb3ac104bafd7d2af09305aa5cd6d8346f9b08cd06e8099","observation_id":"b641c452-348b-4b38-88ec-e82f018c0546","resolution":{"observed_at":"2026-08-06T18:51:26.356204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11251","last_updated":"2025-03-14T10:01:55Z","snapshot_observed_at":"2026-08-09T05:35:15.000362Z","submitted_at":"2025-03-14T10:01:55Z","title":"Step-Video-TI2V Technical Report: A State-of-the-Art Text-Driven Image-to-Video Generation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.11251","snapshot_observed_at":"2026-08-06T18:51:26.438943Z","title":"Step-video-ti2v: A state-of-the- art text-driven image-to-video generation model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-09T23:14:03.004938Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:26.438943Z"},"links":{"cited_paper":"/paper/2503.11251","citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:ad4befab000c2b46849a2127ce7104b6937ae6741b0bdd3064c4bb56790d2351","observation_id":"ba01330a-351c-4cf4-8100-3014152fd200","resolution":{"observed_at":"2026-08-06T18:51:26.438943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04698","last_updated":"2025-05-13T06:42:52Z","snapshot_observed_at":"2026-08-10T21:24:08.597398Z","submitted_at":"2025-01-08T18:59:01Z","title":"ConceptMaster: Multi-Concept Video Customization on Diffusion Transformer Models Without Test-Time Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04698","snapshot_observed_at":"2026-08-06T18:51:26.486990Z","title":"Conceptmaster: Multi-concept video customiza- tion on diffusion transformer models without test-time tun- ing","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-09T23:14:03.004938Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:26.486990Z"},"links":{"cited_paper":"/paper/2501.04698","citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:299c477a6e4876991c136fc5fba450ce7ee05850a29ae385309eea535fffef00","observation_id":"5b2e4943-7699-4f24-afe0-f875b9a9d6f2","resolution":{"observed_at":"2026-08-06T18:51:26.486990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:26.585805Z","title":"Vbench: Comprehensive benchmark suite for video generative mod- els","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-09T23:14:03.004938Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:26.585805Z"},"links":{"citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:4e9b36f4264a85a8dd882c7640231e2ae6865e3bffe6f39737c2d753316b31aa","observation_id":"c90a055f-9636-4d81-99f3-beee7dc447ae","resolution":{"observed_at":"2026-08-06T18:51:26.585805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:26.659409Z","title":"Pika 1.5: Realistic scene and motion synthesis,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-09T23:14:03.004938Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:26.659409Z"},"links":{"citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:28e9184e725c78b2d5945b0259528d761f7a81d4b19bf05728d453da0b590bf3","observation_id":"003ec7ca-ed6a-4fdf-8a0c-61d3aa62ac68","resolution":{"observed_at":"2026-08-06T18:51:26.659409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:26.858784Z","title":"Sim2real: Synthetic video data for vision-based robotic manipulation learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-09T23:14:03.004938Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:26.858784Z"},"links":{"citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:c59b85dc948b5b5a6dea580c0ec94c7d0eeb63f49205610ec30f63754654c618","observation_id":"fc8dc39c-f6fd-4297-bc0a-4401d128302d","resolution":{"observed_at":"2026-08-06T18:51:26.858784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07598","last_updated":"2025-03-11T06:44:25Z","snapshot_observed_at":"2026-07-06T20:50:05.070886Z","submitted_at":"2025-03-10T17:57:04Z","title":"VACE: All-in-One Video Creation and Editing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07598","snapshot_observed_at":"2026-08-06T18:51:26.935841Z","title":"Vace: All-in-one video creation and editing","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-09T23:14:03.004938Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:26.935841Z"},"links":{"cited_paper":"/paper/2503.07598","citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:8b8ab372543fa5508a48545035b51c550d0f87c4fb5e7a1e9464d0a161fa6df6","observation_id":"d0724895-c789-4cf7-9ec5-6f9c48184a28","resolution":{"observed_at":"2026-08-06T18:51:26.935841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:26.973195Z","title":"Pyramidal flow matching for efficient video generative modeling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-09T23:14:03.004938Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:26.973195Z"},"links":{"citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:c59c0a8890f04a08a6e1adf794e3f2464c1cb028a3fd772f3af01df81ca086ce","observation_id":"a8063218-9d9c-4d40-adb9-5d7ac640a87a","resolution":{"observed_at":"2026-08-06T18:51:26.973195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:27.028318Z","title":"Miradata: A large-scale video dataset with long du- rations and structured captions, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-09T23:14:03.004938Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:27.028318Z"},"links":{"citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:36fd148399b6a361e1ee5070f76a9530c7e6d29545184c38a8f6cdc3953069ae","observation_id":"332aff63-e3e3-4168-9dfb-fdc6d5a7d6c2","resolution":{"observed_at":"2026-08-06T18:51:27.028318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:27.111928Z","title":"Miradata: A large-scale video dataset with long 10 durations and structured captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-09T23:14:03.004938Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:27.111928Z"},"links":{"citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:d7650622f0047688f4b851ec8db79dd4b2fc7088503510d9df9339f77eebedba","observation_id":"f890aa14-7922-4460-ab83-fc509f308c55","resolution":{"observed_at":"2026-08-06T18:51:27.111928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:27.149466Z","title":"Cinediff: Diffusion models for cinematic video synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-09T23:14:03.004938Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:27.149466Z"},"links":{"citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:731a3a52a327d81cd2298793b16cd1723aa1ba5facd0504d67bf52b90d03e6bd","observation_id":"c7f7f318-975b-44cb-8d4a-372deeb3bf44","resolution":{"observed_at":"2026-08-06T18:51:27.149466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-13T14:41:45.809481Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-06T18:51:27.228352Z","title":"Hunyuanvideo: A systematic framework for large video generative models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-09T23:14:03.004938Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:27.228352Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:42917a9345fc0e1d131d0329e7e35136425940d302cbce496c14e752366adcf0","observation_id":"c7410d0e-6651-492e-90a3-7e67b9c510fe","resolution":{"observed_at":"2026-08-06T18:51:27.228352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:27.336902Z","title":"Minimax hailuo: Scalable multi- subject video generation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-09T23:14:03.004938Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:27.336902Z"},"links":{"citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:a3f92f2919f5b9f390a04eb391adcd31d8db72cc4c39ed5e44135b43f629d1d3","observation_id":"99aad170-c98e-46ec-af89-91034147206d","resolution":{"observed_at":"2026-08-06T18:51:27.336902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:33.603443Z","title":"Openhumanvid: A large-scale high- quality dataset for enhancing human-centric video genera- tion","venue":null,"work_id":"dece2057-dcc5-4b6e-bb7f-5b02eedd6851","year":2025},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-09T23:14:03.004938Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:27.417606Z"},"links":{"citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:626ea3188bfbc5da94d249f6a4198fc6ff6102a7cad9f75a66c590649fbbdac8","observation_id":"017b6017-8503-4488-b8fb-9c2f7364b022","resolution":{"observed_at":"2026-08-06T18:51:33.606674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00131","last_updated":"2024-11-28T14:07:45Z","snapshot_observed_at":"2026-08-13T21:19:07.777045Z","submitted_at":"2024-11-28T14:07:45Z","title":"Open-Sora Plan: Open-Source Large Video Generation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00131","snapshot_observed_at":"2026-08-06T18:51:27.464912Z","title":"Open-sora plan: Open-source large video generation model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-09T23:14:03.004938Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:27.464912Z"},"links":{"cited_paper":"/paper/2412.00131","citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:ba66d90eab9fd040aae9411ca9af1e3ccba5d4b4739498d864d4414fac0e01aa","observation_id":"57e461e5-e01b-4fa5-b908-3544ad5da534","resolution":{"observed_at":"2026-08-06T18:51:27.464912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15091","last_updated":"2024-07-12T18:03:29Z","snapshot_observed_at":"2026-08-13T10:04:31.458943Z","submitted_at":"2023-09-26T17:36:26Z","title":"VideoDirectorGPT: Consistent Multi-scene Video Generation via LLM-Guided Planning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15091","snapshot_observed_at":"2026-08-06T18:51:27.528264Z","title":"Videodirectorgpt: Consistent multi-scene video generation via llm-guided planning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-09T23:14:03.004938Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:27.528264Z"},"links":{"cited_paper":"/paper/2309.15091","citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:374e020eed15ef1262163d4390f7f0d59be2f2caab4497750080915f2348c1b0","observation_id":"75a20dc8-5800-4d8b-9cbc-dcbd3b4c8144","resolution":{"observed_at":"2026-08-06T18:51:27.528264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:33.594021Z","title":null,"venue":null,"work_id":"0b386a2c-98fa-43e1-a82a-ed1c978ffb33","year":2023},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-09T23:14:03.004938Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:27.591944Z"},"links":{"citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:6e7adb600fb3d8e4eca5161d8a57645323286a26b97dce4aeb2096a09bb36969","observation_id":"1be0cb62-7ebe-440e-91cb-cf0afe8f4a05","resolution":{"observed_at":"2026-08-06T18:51:33.597009Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11079","last_updated":"2025-04-10T10:24:37Z","snapshot_observed_at":"2026-08-08T15:16:17.586525Z","submitted_at":"2025-02-16T11:02:50Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11079","snapshot_observed_at":"2026-08-06T18:51:27.649430Z","title":"Phantom: Subject- consistent video generation via cross-modal alignment","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-09T23:14:03.004938Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:27.649430Z"},"links":{"cited_paper":"/paper/2502.11079","citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:d18d143c36f33b39a4b92587ad4a13d7d9cb87ead15c21428459c14f705b96c1","observation_id":"78f0d332-7e44-4678-bd3e-d7f2777dd5a5","resolution":{"observed_at":"2026-08-06T18:51:27.649430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.11243","last_updated":"2023-11-19T06:07:37Z","snapshot_observed_at":"2026-08-13T05:22:30.574677Z","submitted_at":"2023-11-19T06:07:37Z","title":"AutoStory: Generating Diverse Storytelling Images with Minimal Human Effort","version":1},"cited_work":{"arxiv_id":"2311.11243","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.11243","snapshot_observed_at":"2026-08-06T18:51:33.042924Z","title":"AutoStory: Generating Diverse Storytelling Images with Minimal Human Effort","venue":"cs.CV","work_id":"93e0c2c3-5145-4aa0-9fd8-52370825de42","year":2023},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-09T23:14:03.004938Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:27.714173Z"},"links":{"cited_paper":"/paper/2311.11243","citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:818a1fbebeb6af3f93f6c874b3de2a9034ee0b750c5bef06c26e779fa0aad4f8","observation_id":"a395f1b4-e549-42f3-a11f-044a5ac1f887","resolution":{"observed_at":"2026-08-06T18:51:33.048674Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:33.584898Z","title":"Latte: Latent diffusion transformer for video generation","venue":null,"work_id":"64137094-ca9b-475d-8ae8-babb79596792","year":2025},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-09T23:14:03.004938Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:27.753527Z"},"links":{"citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:8987c932c59b9bc5b9fd1add44b31b58b009b862356c7db4f9442dab88710bb3","observation_id":"14c0c2e1-baad-4300-a957-4c7151215b45","resolution":{"observed_at":"2026-08-06T18:51:33.588141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:33.575427Z","title":"Gamegan: Video generation for atari games","venue":null,"work_id":"f52d96c7-6e2e-4af5-a9f7-c89ec60652ac","year":null},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-09T23:14:03.004938Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:27.811437Z"},"links":{"citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:08e83dcdeb3735763eddffff72001fa654bba6439306de6d069a5e0e23ec93e3","observation_id":"424ebe18-0559-4982-bacb-f234c5cf7497","resolution":{"observed_at":"2026-08-06T18:51:33.578596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:33.565117Z","title":"Sora: Openai’s text-to-video generator, 2024","venue":null,"work_id":"2c9b9841-1f7e-4fd1-b5c8-0f059c54ee7c","year":2024},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-09T23:14:03.004938Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:27.857440Z"},"links":{"citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:7016f8d6a9b302a88bfd2956265ca53b093075d78220c3a11511825a6df5e0f2","observation_id":"780a0571-1608-4adf-a561-3341a31ab6e5","resolution":{"observed_at":"2026-08-06T18:51:33.568719Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:33.554949Z","title":"Scalable diffusion mod- els with transformers","venue":null,"work_id":"2b6a72b3-6c68-4e94-b1bb-adf77aa647dc","year":2023},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-09T23:14:03.004938Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:27.901975Z"},"links":{"citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:86b8184975709ed51ca664f384b3160af573a35ddb98f50d093157ada41582e7","observation_id":"a03c9693-0c04-4c64-af21-97ddf8c8aa87","resolution":{"observed_at":"2026-08-06T18:51:33.558545Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09642","last_updated":"2026-03-02T11:31:23Z","snapshot_observed_at":"2026-08-11T23:38:12.766811Z","submitted_at":"2025-03-12T05:00:07Z","title":"Open-Sora 2.0: Training a Commercial-Level Video Generation Model in $200k","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09642","snapshot_observed_at":"2026-08-06T18:51:27.953286Z","title":"Open- sora 2.0: Training a commercial-level video generation model in $200k","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-09T23:14:03.004938Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:27.953286Z"},"links":{"cited_paper":"/paper/2503.09642","citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:273fa4748217e80e4481ff7af7d0d0d7155c8ba9b673eeab925a6ce7e3a1cc0a","observation_id":"d0a17abb-1372-4d11-91c2-955192748180","resolution":{"observed_at":"2026-08-06T18:51:27.953286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-14T11:08:32.950294Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-06T18:51:27.992227Z","title":"Sampson, Shikai Li, Si- mone Parmeggiani, Steve Fine, Tara Fowler, Vladan Petro- vic, and Yuming Du","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-09T23:14:03.004938Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:27.992227Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:46358066fab31a77376739ca19be0d21a1ec917b52d88ff1a58e64e5e77a830a","observation_id":"4c1f6efc-ac82-4ad9-b8ea-a7da7c53f5e8","resolution":{"observed_at":"2026-08-06T18:51:27.992227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:33.545229Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"207620f2-9ff6-4ffe-b529-b0e093f477dd","year":2021},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-09T23:14:03.004938Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:28.043194Z"},"links":{"citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:cfd576a05493cbbfa8d2f35ee070095d0610c7a409e0fd84ee75be393351e3fd","observation_id":"c73196b0-e227-4152-aff1-2f0008a20497","resolution":{"observed_at":"2026-08-06T18:51:33.548601Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:33.535799Z","title":null,"venue":null,"work_id":"09e10b24-7e14-4127-9641-2a74d55a2473","year":2020},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-09T23:14:03.004938Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:28.093926Z"},"links":{"citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:33cffd6bf3d05c20aac7dd38451365ba596d0d1ea6cba90cdb812b34ead2df3b","observation_id":"43dd8388-8eef-4038-bb7c-43218e56275e","resolution":{"observed_at":"2026-08-06T18:51:33.538990Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:33.526281Z","title":"Gener- ating diverse high-fidelity images with vq-vae-2","venue":null,"work_id":"85ce453a-9965-442c-8acc-13c4d81ed351","year":2019},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-09T23:14:03.004938Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:28.127742Z"},"links":{"citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:5745d011a6636ac4d2856041ba91df061bcec2734cf62f215fa71ddd33a90cab","observation_id":"193a288d-a51e-48db-9925-16bcbf086d0b","resolution":{"observed_at":"2026-08-06T18:51:33.529569Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:33.517118Z","title":"Runway gen-3: Advanced video syn- thesis platform, 2024","venue":null,"work_id":"cdb16ad6-fd90-4aa4-bb05-9d6ddb0f56bb","year":2024},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-09T23:14:03.004938Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:28.154624Z"},"links":{"citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:b68936e2846e4eefc711aa32f74dffbdb5732e0abdba3ddfd56f4cd357d5c936","observation_id":"1923a6b5-f8d4-4bd4-b227-1f59a54c8e57","resolution":{"observed_at":"2026-08-06T18:51:33.520108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:28.210651Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-09T23:14:03.004938Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:28.210651Z"},"links":{"citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:37129ba6ae498670dbaf3e0e3efa966b0e862c663c2c83cc6059c38a609697f2","observation_id":"629336ec-88d4-4118-bcce-b4a194e5ae67","resolution":{"observed_at":"2026-08-06T18:51:28.210651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:33.502539Z","title":"U- net: Convolutional networks for biomedical image segmen- tation","venue":null,"work_id":"12a819d7-850c-4ae3-8ec7-0e4ab8824dc2","year":2015},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-09T23:14:03.004938Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:28.272230Z"},"links":{"citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:dd34ac95b27ff7224c74ddea56bb041cad49bc900b1c8d8f66a17d3988329d14","observation_id":"2bdb081f-9b27-4e7c-a486-11961415d555","resolution":{"observed_at":"2026-08-06T18:51:33.505284Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:33.493175Z","title":"Goodfellow, Wojciech Zaremba, Vicki Cheung, Alec Radford, and Xi Chen","venue":null,"work_id":"5a067207-d07d-4aaa-b52f-c7adbe0ca561","year":2016},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-09T23:14:03.004938Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:28.359682Z"},"links":{"citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:fdacc09df09bdb567260548dce00b7249e15668b11e20a6f7cfced476a5ab92b","observation_id":"2986ff15-fdb4-4378-a3d2-44752c23a84b","resolution":{"observed_at":"2026-08-06T18:51:33.496424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:33.484565Z","title":"Flashattention-3: Fast and accurate attention with asynchrony and low-precision,","venue":null,"work_id":"3c958172-4fd9-4994-959e-281a7913846d","year":null},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-09T23:14:03.004938Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:28.399654Z"},"links":{"citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:a7fdf43acabd4ffdc777b1812b3a36e112e50a86a16e367620f55847c7aecfe8","observation_id":"25d87521-01e9-43a9-b2c0-2a304a3eb5db","resolution":{"observed_at":"2026-08-06T18:51:33.487809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:33.475689Z","title":"Videopoet: Large language models are zero-shot video generators","venue":null,"work_id":"ed9b32cf-c50e-4932-b4c2-d4b405a21a3c","year":2024},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-09T23:14:03.004938Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:28.461098Z"},"links":{"citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:677618b3869cb4992471d182083407c2e39151b68090772ab632e038f35a9333","observation_id":"837e33c7-e193-4212-9f6d-db048e6219c0","resolution":{"observed_at":"2026-08-06T18:51:33.478980Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:33.466317Z","title":"Denois- ing diffusion implicit models","venue":null,"work_id":"e13b6001-8134-489a-b52c-78d82c195e65","year":2021},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-09T23:14:03.004938Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:28.496431Z"},"links":{"citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:eed2f164e02f731cf0928fac11cf99512ba350d4220aeb4f03ccfff541165ca0","observation_id":"fc06091d-be55-4325-92c2-5669ad12e32c","resolution":{"observed_at":"2026-08-06T18:51:33.469672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:33.457554Z","title":"Kling2.0: Proprietary high-fidelity video generation, 2024","venue":null,"work_id":"360af113-3c65-4259-b170-a45db54c0815","year":2024},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-09T23:14:03.004938Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:28.532366Z"},"links":{"citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:d1720d7e07b2bf404dd6ab159a1d25a99b4fc255314cefd7227114a021bf845c","observation_id":"594bba73-2e54-457b-8ad6-55eca9fd08dd","resolution":{"observed_at":"2026-08-06T18:51:33.460582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13211","last_updated":"2025-05-19T14:58:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-19T14:58:50Z","title":"MAGI-1: Autoregressive Video Generation at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13211","snapshot_observed_at":"2026-08-06T18:51:28.578351Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-09T23:14:03.004938Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:28.578351Z"},"links":{"cited_paper":"/paper/2505.13211","citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:3f9e6aaf9da96a68ab7867e456e5539de09a604586db4d4085f168b302d8a40e","observation_id":"27325cd4-c1a1-4879-9699-5c1953e11ec8","resolution":{"observed_at":"2026-08-06T18:51:28.578351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:33.447942Z","title":"Mocogan: Decomposing motion and content for video generation","venue":null,"work_id":"e04f65ea-0df1-4097-ac07-2c9f3b521416","year":2018},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-09T23:14:03.004938Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:28.649535Z"},"links":{"citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:0063927852438244f478f8e093ce2c252f5c6f21a5cdbaba58563e0b146f82f7","observation_id":"afbce4be-0622-49fc-88fa-eb122facfc40","resolution":{"observed_at":"2026-08-06T18:51:33.451254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.01717","last_updated":"2019-03-27T16:43:17Z","snapshot_observed_at":"2026-08-11T02:30:38.877941Z","submitted_at":"2018-12-03T03:57:42Z","title":"Towards Accurate Generative Models of Video: A New Metric & Challenges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.01717","snapshot_observed_at":"2026-08-06T18:51:28.755370Z","title":"Towards accurate generative models of video: A new met- ric & challenges","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-09T23:14:03.004938Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:28.755370Z"},"links":{"cited_paper":"/paper/1812.01717","citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:99e6f5c0fcbc45d3a586abd48460b9ca862061343597055254387ac14a3f58e4","observation_id":"df8baf8e-f220-41ab-ab0f-bb296487f7a1","resolution":{"observed_at":"2026-08-06T18:51:28.755370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:33.439083Z","title":"Neural discrete representation learn- ing","venue":null,"work_id":"a9cd2cb8-fbd1-432a-9c4c-c92391c86730","year":2017},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-09T23:14:03.004938Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:28.845014Z"},"links":{"citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:4c63f636cdbff97f7c15b4dca3ab00c6004fa0c65034d5a38b955ddcc412bcdc","observation_id":"345d4139-8d48-45b2-8d12-b8ff27894019","resolution":{"observed_at":"2026-08-06T18:51:33.441921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-08-12T22:34:51.361078Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-06T18:51:28.893268Z","title":"Wan: Open and ad- vanced large-scale video generative models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-09T23:14:03.004938Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:28.893268Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:887c54a736193c83931a28c27c9c1148e1302a5a18df71f7e06f9ba0db375054","observation_id":"37e02c48-704a-483f-ab1a-ed5581b25862","resolution":{"observed_at":"2026-08-06T18:51:28.893268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06571","last_updated":"2023-08-12T13:53:10Z","snapshot_observed_at":"2026-08-10T01:52:30.999213Z","submitted_at":"2023-08-12T13:53:10Z","title":"ModelScope Text-to-Video Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06571","snapshot_observed_at":"2026-08-06T18:51:28.967399Z","title":"Modelscope text-to-video technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-09T23:14:03.004938Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:28.967399Z"},"links":{"cited_paper":"/paper/2308.06571","citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:87efe2723489098276ee081748e966d09fd9478a9248e42016540ce00ffe775c","observation_id":"c9402324-cd38-4aab-8a99-fb2ca61e9150","resolution":{"observed_at":"2026-08-06T18:51:28.967399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:33.429965Z","title":"Text2video: Gener- ating educational videos from text","venue":null,"work_id":"5097d615-a888-4ba3-8e71-c48f0ded639e","year":2023},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-09T23:14:03.004938Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:29.028121Z"},"links":{"citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:bda53346c4a99a32540de9d2ae9c89f81d993312057674e48a205a37ea490991","observation_id":"55664aa2-5f58-4555-9c35-0de6339c5977","resolution":{"observed_at":"2026-08-06T18:51:33.433200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:33.421351Z","title":"Koala- 36m: A large-scale video dataset improving consistency between fine-grained conditions and video content, 2024","venue":null,"work_id":"59c42797-eede-42c8-bd05-f51f752f4781","year":2024},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-09T23:14:03.004938Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:29.134036Z"},"links":{"citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:43dd8f73118b30367daa3af7e7c9aed99f97405943950a530c022c6984f33c50","observation_id":"079cc167-5b3a-4d9f-89ed-0c0b57dbb5ff","resolution":{"observed_at":"2026-08-06T18:51:33.424383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08260","last_updated":"2025-04-26T17:58:24Z","snapshot_observed_at":"2026-08-12T22:26:02.939381Z","submitted_at":"2024-10-10T17:57:49Z","title":"Koala-36M: A Large-scale Video Dataset Improving Consistency between Fine-grained Conditions and Video Content","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08260","snapshot_observed_at":"2026-08-06T18:51:29.180801Z","title":"Koala- 36m: A large-scale video dataset improving consistency between fine-grained conditions and video content","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-09T23:14:03.004938Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:29.180801Z"},"links":{"cited_paper":"/paper/2410.08260","citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:58509bd24622efc168dbed4c3ca4db89f356d8d48196ca3ddd700ab3c18fcca8","observation_id":"3db225ab-3e21-479c-999b-2be81a2f815a","resolution":{"observed_at":"2026-08-06T18:51:29.180801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09027","last_updated":"2025-07-24T15:55:00Z","snapshot_observed_at":"2026-08-08T15:14:26.502885Z","submitted_at":"2025-06-10T17:53:29Z","title":"Diffuse and Disperse: Image Generation with Representation Regularization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09027","snapshot_observed_at":"2026-08-06T18:51:29.240432Z","title":"Diffuse and disperse: Im- age generation with representation regularization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-09T23:14:03.004938Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:29.240432Z"},"links":{"cited_paper":"/paper/2506.09027","citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:9e650ed0071b503f6db14269b7c457ccd634982d027b880f0da9a7fd0a67016b","observation_id":"2c21f850-8a82-478d-9044-85fec28bfd67","resolution":{"observed_at":"2026-08-06T18:51:29.240432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10874","last_updated":"2024-04-24T11:22:00Z","snapshot_observed_at":"2026-08-13T11:39:34.773518Z","submitted_at":"2023-05-18T11:06:15Z","title":"Swap Attention in Spatiotemporal Diffusions for Text-to-Video Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10874","snapshot_observed_at":"2026-08-06T18:51:29.322880Z","title":"Videofactory: Swap attention in spatiotemporal diffusions for text-to-video gen- eration","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-09T23:14:03.004938Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:29.322880Z"},"links":{"cited_paper":"/paper/2305.10874","citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:3abeb881e8821eba8de6f12759369211ae5725667c210f426efefebcc1616ff9","observation_id":"cfc808d4-8e26-44b4-83a7-5c2aba9e5c35","resolution":{"observed_at":"2026-08-06T18:51:29.322880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:33.412558Z","title":"Videofactory: Swap attention in spatiotemporal diffusions for text-to-video gen- eration","venue":null,"work_id":"b4751578-be95-4145-81bc-9fe8df2e3e88","year":2024},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-09T23:14:03.004938Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:29.387266Z"},"links":{"citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:97ece18439b7bca33a0456cea006af6cc5fd6a5660047c637a60ac48acd3a88d","observation_id":"8196cb90-41fc-4e2d-af9f-03ceb81ba722","resolution":{"observed_at":"2026-08-06T18:51:33.415822Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:33.403236Z","title":"Non-local neural networks","venue":null,"work_id":"cf5bab29-5050-498b-88a5-eddc5ea93d9d","year":2018},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-09T23:14:03.004938Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:29.473010Z"},"links":{"citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:fe713e998759c04228485835bfd1850a197dad89ea64c1a642a9abd7c573afab","observation_id":"f6648244-5260-4af2-b69d-1baa0b764ec2","resolution":{"observed_at":"2026-08-06T18:51:33.406460Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:29.564360Z","title":"Yuille, Zicheng Liu, and Emad Barsoum","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-09T23:14:03.004938Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:29.564360Z"},"links":{"citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:42a29bc90f5cb19ea23b6e701cd2304ce0ae6a942ed093e24b913c4aac1e57a0","observation_id":"b1bca7bc-db88-4221-8c66-7be59d4e6f92","resolution":{"observed_at":"2026-08-06T18:51:29.564360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02757","last_updated":"2025-04-02T07:57:32Z","snapshot_observed_at":"2026-08-12T22:31:22.501227Z","submitted_at":"2024-10-03T17:59:02Z","title":"Loong: Generating Minute-level Long Videos with Autoregressive Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02757","snapshot_observed_at":"2026-08-06T18:51:29.715057Z","title":"Loong: Generating minute-level long videos with autoregressive language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-09T23:14:03.004938Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:29.715057Z"},"links":{"cited_paper":"/paper/2410.02757","citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:7d03385a779c2907f6f216344b1198c7ba3960f61ecb8249c455e6a586102fb8","observation_id":"08562ac5-5180-4707-9435-0fbf8578180c","resolution":{"observed_at":"2026-08-06T18:51:29.715057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:33.393787Z","title":"Bovik, Hamid R","venue":null,"work_id":"399e31f7-412a-49aa-8179-dcc28152ceb7","year":2004},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-09T23:14:03.004938Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:29.761047Z"},"links":{"citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:aae9bf5089a6352b2914fa92c373b1989ae1489472fa79bb389bb0b381c090fe","observation_id":"ec0cb88a-42e8-4d6a-bc3e-c70189248a6a","resolution":{"observed_at":"2026-08-06T18:51:33.396397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:33.385345Z","title":"Humanvid: Demystifying train- ing data for camera-controllable human image animation","venue":null,"work_id":"b0067782-25c2-41f8-b7af-27777fc468fa","year":2024},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-09T23:14:03.004938Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:29.921360Z"},"links":{"citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:83d7b8807f9ac65dd5c1414a0747de1ed293a16e683754bfa93e16ee55f9f386","observation_id":"39361e02-e3e2-40d7-a1ca-bb2daa1e6d9a","resolution":{"observed_at":"2026-08-06T18:51:33.388182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.16153","last_updated":"2025-03-20T13:55:12Z","snapshot_observed_at":"2026-08-13T04:11:27.987214Z","submitted_at":"2025-03-20T13:55:12Z","title":"FreeFlux: Understanding and Exploiting Layer-Specific Roles in RoPE-Based MMDiT for Versatile Image Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.16153","snapshot_observed_at":"2026-08-06T18:51:29.977844Z","title":"Freeflux: Understanding and exploiting layer-specific roles in rope-based mmdit for versatile image editing.arXiv preprint arXiv:2503.16153, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-09T23:14:03.004938Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:29.977844Z"},"links":{"cited_paper":"/paper/2503.16153","citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:562e2bfd20e7f1224aae4a1414c243dc449f570bf5f6d3ce13766199b2c3af9d","observation_id":"9d980628-5c98-412d-a19f-c778cdc8fdca","resolution":{"observed_at":"2026-08-06T18:51:29.977844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:33.376762Z","title":"Panacea: Panoramic and controllable video generation for au- tonomous driving","venue":null,"work_id":"4123b27e-6696-48e2-8b30-71f320dac553","year":2024},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-09T23:14:03.004938Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:30.077913Z"},"links":{"citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:473d7d62961388ba727b6d467fcaa71b1a2ba3b02b87b89bfc13850b2fd5c374","observation_id":"d7efc319-0dfa-4f4a-b26b-a9d530746040","resolution":{"observed_at":"2026-08-06T18:51:33.379861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15262","last_updated":"2025-03-31T02:52:56Z","snapshot_observed_at":"2026-08-13T06:03:12.914685Z","submitted_at":"2024-11-22T10:25:08Z","title":"MovieBench: A Hierarchical Movie Level Dataset for Long Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15262","snapshot_observed_at":"2026-08-06T18:51:30.200027Z","title":"Moviebench: A hierarchical movie- level dataset for long video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-09T23:14:03.004938Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:30.200027Z"},"links":{"cited_paper":"/paper/2411.15262","citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:058c028d7d5bb87d604788f96ca0e0e7a23bf6c1c41494b4ff077a82fb873160","observation_id":"e1a52704-b453-4aa2-b5c1-63e31b1b411d","resolution":{"observed_at":"2026-08-06T18:51:30.200027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07314","last_updated":"2025-03-10T13:33:27Z","snapshot_observed_at":"2026-08-07T17:16:48.946119Z","submitted_at":"2025-03-10T13:33:27Z","title":"Automated Movie Generation via Multi-Agent CoT Planning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07314","snapshot_observed_at":"2026-08-06T18:51:30.310486Z","title":"Auto- mated movie generation via multi-agent cot planning.arXiv preprint arXiv:2503.07314, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-09T23:14:03.004938Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:30.310486Z"},"links":{"cited_paper":"/paper/2503.07314","citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:a00302d4d72490ba6e105e4f398006aa13b5271c3f26b890acb11cd5ea3c1c14","observation_id":"9cf082b0-8e2d-4d20-b1e9-8b58e686189b","resolution":{"observed_at":"2026-08-06T18:51:30.310486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:33.367778Z","title":"Mind the time: Temporally- controlled multi-event video generation","venue":null,"work_id":"bb6844bb-1568-4445-aac0-a6b65b3d77bf","year":2025},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-09T23:14:03.004938Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:30.361446Z"},"links":{"citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:e75acf2412d4165070b9989b1666442ce6e9a92b16fe2e370e93ec5f79347323","observation_id":"282a7c20-516f-4f2c-9ae3-0d1d9d22b5a3","resolution":{"observed_at":"2026-08-06T18:51:33.371071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:33.358907Z","title":"A survey on video diffusion models","venue":null,"work_id":"6807f4fe-ad14-48dd-9111-a6b330b3babd","year":2023},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-09T23:14:03.004938Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:30.462880Z"},"links":{"citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:7745af765905f2d38d5cdf0169027c1a503b450936659cf71c64af61fe519bc8","observation_id":"bce22bbb-dd8e-43bd-b66a-05e822aad854","resolution":{"observed_at":"2026-08-06T18:51:33.362057Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:33.350137Z","title":"Surgi- cal video synthesis using generative models for procedure training","venue":null,"work_id":"f3e05aa1-ede1-47b1-bc66-d8b709a780f3","year":2020},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-09T23:14:03.004938Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:30.537696Z"},"links":{"citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:259ba38317a9170e974757013aea31036b5d95ba37f2873c9c0887aed13d9347","observation_id":"285c0893-c957-41e1-822a-9b8cbd99868b","resolution":{"observed_at":"2026-08-06T18:51:33.353216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:33.341560Z","title":"Advancing high-resolution video-language representation with large-scale video transcriptions","venue":null,"work_id":"ffe28d75-22d7-4f37-97c5-40e24b86e7d0","year":2022},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-09T23:14:03.004938Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:30.659490Z"},"links":{"citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:4a572b91df581728df9cddfc978a7a5c68a19c863fc0a9fa36e9487017e744a7","observation_id":"fd631bcc-e4b8-4e1e-98e4-b71d250ac301","resolution":{"observed_at":"2026-08-06T18:51:33.344569Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02396","last_updated":"2023-05-31T20:19:01Z","snapshot_observed_at":"2026-08-13T14:12:30.358466Z","submitted_at":"2022-10-05T17:15:10Z","title":"Temporally Consistent Transformers for Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02396","snapshot_observed_at":"2026-08-06T18:51:30.809287Z","title":"Temporally consistent transformers for video gen- eration","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-09T23:14:03.004938Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:30.809287Z"},"links":{"cited_paper":"/paper/2210.02396","citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:af11087db9cc27e005602615ab39d93a7bf7e21d3b039b28b1496701c2e509e1","observation_id":"d67194a9-c23e-4ad0-b33f-b54bc01b11b7","resolution":{"observed_at":"2026-08-06T18:51:30.809287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:33.332337Z","title":"Vript: A video is worth thousands of words","venue":null,"work_id":"3be14285-7a94-480a-acbc-2a444da44509","year":2024},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-09T23:14:03.004938Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:30.935301Z"},"links":{"citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:c764c226ba170f49f7de0e8f38ba7cd000b71be6f035ee009723d282786b27f9","observation_id":"899138b4-ed67-4150-a186-aab007597afb","resolution":{"observed_at":"2026-08-06T18:51:33.336035Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:33.322678Z","title":"360° vr video genera- tion with generative adversarial networks","venue":null,"work_id":"20cf54d0-26b7-4a31-9614-44bdd645e4db","year":2021},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-09T23:14:03.004938Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:31.112264Z"},"links":{"citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:7ec31e13478c8a724effe79e87c96253d6c694c7b85805397a833736e29a8a59","observation_id":"c90b442e-095d-4bab-a9e6-47c48015729f","resolution":{"observed_at":"2026-08-06T18:51:33.326333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23368","last_updated":"2025-04-04T07:23:21Z","snapshot_observed_at":"2026-08-09T07:20:20.923255Z","submitted_at":"2025-03-30T09:03:09Z","title":"VLIPP: Towards Physically Plausible Video Generation with Vision and Language Informed Physical Prior","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23368","snapshot_observed_at":"2026-08-06T18:51:31.233075Z","title":"Towards physically plau- sible video generation via vlm planning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-09T23:14:03.004938Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:31.233075Z"},"links":{"cited_paper":"/paper/2503.23368","citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:5df425df59cbb49c847fc63728756062c9de34be43912a247b55f1f34d22e8a8","observation_id":"2a742e0c-8837-4f4f-8bb2-41edbf20e9c1","resolution":{"observed_at":"2026-08-06T18:51:31.233075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:33.312425Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer","venue":null,"work_id":"cb2d9d00-a136-4828-9c27-c457bd68542f","year":2025},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-09T23:14:03.004938Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:31.377341Z"},"links":{"citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:0dbd3a726aa27fada9002ebdda4602bd38196459042df85eb8cbe9bb45e9a033","observation_id":"fcde2073-940e-4af3-ac8b-5c23df6659fc","resolution":{"observed_at":"2026-08-06T18:51:33.315924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-06T18:51:31.488724Z","title":"Magvit-v2: Language model beats diffusion — tokenizer is key to visual generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-09T23:14:03.004938Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:31.488724Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:1c2132121918c171f5e43fd597c4f68d643628ba9eabd24e42f167777e1bc0c7","observation_id":"83421e8d-4098-4575-b067-bba14b442e4a","resolution":{"observed_at":"2026-08-06T18:51:31.488724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:31.599998Z","title":"Framepack: Pack- ing input frame context for next-frame prediction models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-09T23:14:03.004938Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:31.599998Z"},"links":{"citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:a869e44b32ec418a199dde3b6c66bbb40b057334cf0fa341946642732bdf9721","observation_id":"0f6cd5e5-47de-4748-bb35-16492f705483","resolution":{"observed_at":"2026-08-06T18:51:31.599998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:33.302001Z","title":"Efros, Eli Shecht- man, and Oliver Wang","venue":null,"work_id":"7017c875-03f4-4abf-9df7-3d94f52d7214","year":2018},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-09T23:14:03.004938Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:31.661328Z"},"links":{"citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:97cc2bf96c01371f1de749a5972a4d48947d3df3db96767b83b04174db33c62b","observation_id":"36715bad-77f5-4ede-bd11-a840d56fa124","resolution":{"observed_at":"2026-08-06T18:51:33.305757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04145","last_updated":"2023-11-07T17:16:06Z","snapshot_observed_at":"2026-08-02T12:25:34.488259Z","submitted_at":"2023-11-07T17:16:06Z","title":"I2VGen-XL: High-Quality Image-to-Video Synthesis via Cascaded Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04145","snapshot_observed_at":"2026-08-06T18:51:31.757497Z","title":"I2vgen-xl: High-quality image-to-video synthesis via cascaded diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-09T23:14:03.004938Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:31.757497Z"},"links":{"cited_paper":"/paper/2311.04145","citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:9535ca9abe06b294380a25b192aab7ad4a7f37d406ec1b6dc4d77146f6bd2b5e","observation_id":"e1cda6db-b13e-47c4-b547-d3ec492efd5e","resolution":{"observed_at":"2026-08-06T18:51:31.757497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T23:14:03.004938Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":68,"verified_exact":1,"verified_fuzzy":31},"total_outbound_references":110},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 100 of 110 outbound references and 1 inbound Pith citation observation for arXiv:2507.07202."}