{"as_of":"2026-08-10T19:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1afc991fbcb4dfc8680b0c39b71cb2bb536a3892dc082510681344dcc66808c7","coverage":[{"denominator":48,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":48,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T16:24:07.779000Z","state":"measured"},{"denominator":48,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":48,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.13753/citation-record","integrity":"/paper/2507.13753/integrity","json":"/paper/2507.13753/citation-record.json","paper":"/paper/2507.13753"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:24:11.320630Z","title":"Emerg- ing properties in self-supervised vision transformers","venue":null,"work_id":"83999c33-d588-46e2-b4ec-98f396c3b678","year":2021},"citing_paper":{"arxiv_id":"2507.13753","last_updated":"2025-07-18T08:59:02Z","snapshot_observed_at":"2026-08-09T23:30:14.905124Z","submitted_at":"2025-07-18T08:59:02Z","title":"Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T16:24:03.661367Z"},"links":{"citing_paper":"/paper/2507.13753"},"observation_digest":"sha256:40728edb476e5e3b569579afcc6636bcd91f1731ebec05407c8ee15becbdce1f","observation_id":"d0aa1032-d329-4d63-8247-9bb45a30bd19","resolution":{"observed_at":"2026-08-06T16:24:11.327857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:24:11.304308Z","title":"Huang, and Niloy J","venue":null,"work_id":"b4fd2914-fc67-42ca-aec8-15fce4b51b5b","year":2023},"citing_paper":{"arxiv_id":"2507.13753","last_updated":"2025-07-18T08:59:02Z","snapshot_observed_at":"2026-08-09T23:30:14.905124Z","submitted_at":"2025-07-18T08:59:02Z","title":"Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T16:24:03.740191Z"},"links":{"citing_paper":"/paper/2507.13753"},"observation_digest":"sha256:05f204e9adea8a5f9ccad8d0cef3576fcf0c31e33ad39e49e24bd620901bf971","observation_id":"fea59f5e-5851-4875-abd1-90ec627f9a3e","resolution":{"observed_at":"2026-08-06T16:24:11.308915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:24:11.287919Z","title":"Videocrafter2: Overcoming data limitations for high-quality video diffusion models","venue":null,"work_id":"d021ceb4-4a6e-4d63-8507-e0f22eada42b","year":null},"citing_paper":{"arxiv_id":"2507.13753","last_updated":"2025-07-18T08:59:02Z","snapshot_observed_at":"2026-08-09T23:30:14.905124Z","submitted_at":"2025-07-18T08:59:02Z","title":"Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T16:24:03.826011Z"},"links":{"citing_paper":"/paper/2507.13753"},"observation_digest":"sha256:3da8b1d6f4f2ef5319d4dafd5d54222d2006b5a657c88ff0a157f061f1845c51","observation_id":"3dfc697b-0294-40d4-abc9-6684c7e55d45","resolution":{"observed_at":"2026-08-06T16:24:11.293233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:24:11.272115Z","title":"Style in- jection in diffusion: A training-free approach for adapting large-scale diffusion models for style transfer","venue":null,"work_id":"4ef6fe0e-b1fd-4708-b6db-65b7e8179194","year":2024},"citing_paper":{"arxiv_id":"2507.13753","last_updated":"2025-07-18T08:59:02Z","snapshot_observed_at":"2026-08-09T23:30:14.905124Z","submitted_at":"2025-07-18T08:59:02Z","title":"Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T16:24:03.932309Z"},"links":{"citing_paper":"/paper/2507.13753"},"observation_digest":"sha256:4c80e57cd5391b6ab1e04ac34cb7b150ec2eafcf53e96f51720eb469422e65c1","observation_id":"0e1bcdd9-2d98-40f4-874d-dbd2d406b9e6","resolution":{"observed_at":"2026-08-06T16:24:11.276753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:24:11.256085Z","title":"Diffsynth: La- tent in-iteration deflickering for realistic video synthesis","venue":null,"work_id":"0fbec89c-50cd-4b99-a3bd-5a4c19936d18","year":2024},"citing_paper":{"arxiv_id":"2507.13753","last_updated":"2025-07-18T08:59:02Z","snapshot_observed_at":"2026-08-09T23:30:14.905124Z","submitted_at":"2025-07-18T08:59:02Z","title":"Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T16:24:04.026929Z"},"links":{"citing_paper":"/paper/2507.13753"},"observation_digest":"sha256:7c1e7b00cefa5e81c5f84faeeb0c5d1a0f535609ee43ea07503109ce66c67f6f","observation_id":"a87cc984-5599-44c9-9934-d66f5bb13213","resolution":{"observed_at":"2026-08-06T16:24:11.261382Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08453","last_updated":"2025-01-14T21:53:11Z","snapshot_observed_at":"2026-08-10T06:40:00.807777Z","submitted_at":"2025-01-14T21:53:11Z","title":"Vchitect-2.0: Parallel Transformer for Scaling Up Video Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.08453","snapshot_observed_at":"2026-08-06T16:24:04.099250Z","title":"Vchitect-2.0: Parallel trans- former for scaling up video diffusion models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.13753","last_updated":"2025-07-18T08:59:02Z","snapshot_observed_at":"2026-08-09T23:30:14.905124Z","submitted_at":"2025-07-18T08:59:02Z","title":"Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T16:24:04.099250Z"},"links":{"cited_paper":"/paper/2501.08453","citing_paper":"/paper/2507.13753"},"observation_digest":"sha256:8cde5a000a0411da0811a04468a806daf56a73ba098e1f3f34fd9f175443d19b","observation_id":"5741b480-aabe-4f75-800f-eb9fc30f5b5d","resolution":{"observed_at":"2026-08-06T16:24:04.099250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.10373","last_updated":"2023-11-20T10:54:09Z","snapshot_observed_at":"2026-08-06T08:12:35.134201Z","submitted_at":"2023-07-19T18:00:03Z","title":"TokenFlow: Consistent Diffusion Features for Consistent Video Editing","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.10373","snapshot_observed_at":"2026-08-06T16:24:04.195327Z","title":"Tokenflow: Consistent diffusion features for consistent video editing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13753","last_updated":"2025-07-18T08:59:02Z","snapshot_observed_at":"2026-08-09T23:30:14.905124Z","submitted_at":"2025-07-18T08:59:02Z","title":"Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T16:24:04.195327Z"},"links":{"cited_paper":"/paper/2307.10373","citing_paper":"/paper/2507.13753"},"observation_digest":"sha256:fe339a3cd2579f245d4710281a82225aba73b8a51e53fe5e09aaa5ac9c9f073e","observation_id":"9072bd9c-9ee6-4a21-9ce7-a2fabb2afd5d","resolution":{"observed_at":"2026-08-06T16:24:04.195327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04725","last_updated":"2024-02-08T18:08:57Z","snapshot_observed_at":"2026-07-06T15:52:13.602170Z","submitted_at":"2023-07-10T17:34:16Z","title":"AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04725","snapshot_observed_at":"2026-08-06T16:24:04.284760Z","title":"Animatediff: Animate your personalized text- to-image diffusion models without specific tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13753","last_updated":"2025-07-18T08:59:02Z","snapshot_observed_at":"2026-08-09T23:30:14.905124Z","submitted_at":"2025-07-18T08:59:02Z","title":"Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T16:24:04.284760Z"},"links":{"cited_paper":"/paper/2307.04725","citing_paper":"/paper/2507.13753"},"observation_digest":"sha256:7004a487f5b9bfc975d3867112568ae9d573c77a5b9e4a320f10ada301a7c5e6","observation_id":"198ec7a1-a731-4f2f-b311-514e79b0cb7a","resolution":{"observed_at":"2026-08-06T16:24:04.284760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01626","last_updated":"2022-08-02T17:55:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-08-02T17:55:41Z","title":"Prompt-to-Prompt Image Editing with Cross Attention Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.01626","snapshot_observed_at":"2026-08-06T16:24:04.387504Z","title":"Prompt-to-prompt im- age editing with cross attention control","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.13753","last_updated":"2025-07-18T08:59:02Z","snapshot_observed_at":"2026-08-09T23:30:14.905124Z","submitted_at":"2025-07-18T08:59:02Z","title":"Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T16:24:04.387504Z"},"links":{"cited_paper":"/paper/2208.01626","citing_paper":"/paper/2507.13753"},"observation_digest":"sha256:1819c23c195c7ebae96a2b5ded577994ad8bc7a55dca009b19f3cf058e6db465","observation_id":"e8be94f5-25dc-4c24-b133-79ac6cb494f2","resolution":{"observed_at":"2026-08-06T16:24:04.387504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:24:04.473396Z","title":"Video dif- fusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.13753","last_updated":"2025-07-18T08:59:02Z","snapshot_observed_at":"2026-08-09T23:30:14.905124Z","submitted_at":"2025-07-18T08:59:02Z","title":"Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T16:24:04.473396Z"},"links":{"citing_paper":"/paper/2507.13753"},"observation_digest":"sha256:6b29e78f2bfe6ade15f6ab89db4c94cc58bb6eaf4c18098c34734f8280411b3e","observation_id":"4c6848b5-8a91-4dd0-b625-b2ed812a968b","resolution":{"observed_at":"2026-08-06T16:24:04.473396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.14073","last_updated":"2023-08-03T09:34:24Z","snapshot_observed_at":"2026-08-10T13:39:21.406443Z","submitted_at":"2023-07-26T09:50:44Z","title":"VideoControlNet: A Motion-Guided Video-to-Video Translation Framework by Using Diffusion Model with ControlNet","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.14073","snapshot_observed_at":"2026-08-06T16:24:04.571398Z","title":"Videocontrolnet: A motion-guided video-to-video translation framework by using diffusion model with controlnet","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13753","last_updated":"2025-07-18T08:59:02Z","snapshot_observed_at":"2026-08-09T23:30:14.905124Z","submitted_at":"2025-07-18T08:59:02Z","title":"Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T16:24:04.571398Z"},"links":{"cited_paper":"/paper/2307.14073","citing_paper":"/paper/2507.13753"},"observation_digest":"sha256:90d4c51b5b9b8e9f355b224390256d9e0425ac46c7ae6b63c656241e91aae013","observation_id":"392234db-f6f1-463e-9773-724403ced627","resolution":{"observed_at":"2026-08-06T16:24:04.571398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:24:11.066846Z","title":"Vbench: Comprehensive benchmark suite for video generative models","venue":null,"work_id":"22e65fb7-d5d2-4e50-9e73-bbf72f3e027a","year":2024},"citing_paper":{"arxiv_id":"2507.13753","last_updated":"2025-07-18T08:59:02Z","snapshot_observed_at":"2026-08-09T23:30:14.905124Z","submitted_at":"2025-07-18T08:59:02Z","title":"Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T16:24:04.658315Z"},"links":{"citing_paper":"/paper/2507.13753"},"observation_digest":"sha256:2e464184e26014a4359387ff7c12693a2f549c74bb905d0a18bfc3b4ce9b2bbf","observation_id":"2dc5c1f7-20e0-4835-b18d-5dbda1226131","resolution":{"observed_at":"2026-08-06T16:24:11.073040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:24:11.050229Z","title":"Text2video-zero: Text- to-image diffusion models are zero-shot video generators","venue":null,"work_id":"eab1a5fe-243f-44bd-addb-db9fab6b57d4","year":2023},"citing_paper":{"arxiv_id":"2507.13753","last_updated":"2025-07-18T08:59:02Z","snapshot_observed_at":"2026-08-09T23:30:14.905124Z","submitted_at":"2025-07-18T08:59:02Z","title":"Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T16:24:04.779140Z"},"links":{"citing_paper":"/paper/2507.13753"},"observation_digest":"sha256:e737e00a825d49187afaddbe6ceae3c13e2bd276524d413f7172ecf1d12776b6","observation_id":"9bd42f93-9578-4d15-8139-3352f5e9e531","resolution":{"observed_at":"2026-08-06T16:24:11.055169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-06T16:24:04.867561Z","title":"Hunyuanvideo: A systematic framework for large video generative models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13753","last_updated":"2025-07-18T08:59:02Z","snapshot_observed_at":"2026-08-09T23:30:14.905124Z","submitted_at":"2025-07-18T08:59:02Z","title":"Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T16:24:04.867561Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2507.13753"},"observation_digest":"sha256:65c66654c58c70cc2187406b50031df79aaba79509a106074be48e35af88c649","observation_id":"df7d391b-9067-43e4-85d2-c0e13ece3784","resolution":{"observed_at":"2026-08-06T16:24:04.867561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14468","last_updated":"2024-11-03T21:16:54Z","snapshot_observed_at":"2026-07-06T17:48:24.076444Z","submitted_at":"2024-03-21T15:15:00Z","title":"AnyV2V: A Tuning-Free Framework For Any Video-to-Video Editing Tasks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14468","snapshot_observed_at":"2026-08-06T16:24:04.956206Z","title":"Anyv2v: A plug-and-play framework for any video- to-video editing tasks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13753","last_updated":"2025-07-18T08:59:02Z","snapshot_observed_at":"2026-08-09T23:30:14.905124Z","submitted_at":"2025-07-18T08:59:02Z","title":"Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T16:24:04.956206Z"},"links":{"cited_paper":"/paper/2403.14468","citing_paper":"/paper/2507.13753"},"observation_digest":"sha256:d634c2bcab9a5a88af151c345756f00b570cca0bbfbd48115e7d804cdcbfff55","observation_id":"a9ef22ac-c314-4987-9511-ed90bea7f57e","resolution":{"observed_at":"2026-08-06T16:24:04.956206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:24:11.019992Z","title":"Amt: All-pairs multi-field transforms for efficient frame interpolation","venue":null,"work_id":"51502c35-dcdb-4e4c-9358-fd17375c8eb3","year":2023},"citing_paper":{"arxiv_id":"2507.13753","last_updated":"2025-07-18T08:59:02Z","snapshot_observed_at":"2026-08-09T23:30:14.905124Z","submitted_at":"2025-07-18T08:59:02Z","title":"Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T16:24:05.075194Z"},"links":{"citing_paper":"/paper/2507.13753"},"observation_digest":"sha256:bdb9fbfceec5cc27490bda4614c19a4fcf1e08ce751070f88012cfa90fb64139","observation_id":"29fcdf9c-5ae6-4433-913d-484fa50812f1","resolution":{"observed_at":"2026-08-06T16:24:11.030716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:24:10.997093Z","title":"Flowvid: Taming imperfect op- tical flows for consistent video-to-video synthesis","venue":null,"work_id":"17e02374-c91d-401a-9833-2b1ad6fcafb2","year":2024},"citing_paper":{"arxiv_id":"2507.13753","last_updated":"2025-07-18T08:59:02Z","snapshot_observed_at":"2026-08-09T23:30:14.905124Z","submitted_at":"2025-07-18T08:59:02Z","title":"Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T16:24:05.139965Z"},"links":{"citing_paper":"/paper/2507.13753"},"observation_digest":"sha256:3fa745992fab39fbefb2c4c0ec30a4ebf984daeeb208803eb9f15423442ecf28","observation_id":"6ba76e2c-012c-4315-96b6-8d829a3a266e","resolution":{"observed_at":"2026-08-06T16:24:11.001903Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00131","last_updated":"2024-11-28T14:07:45Z","snapshot_observed_at":"2026-08-09T23:28:59.299375Z","submitted_at":"2024-11-28T14:07:45Z","title":"Open-Sora Plan: Open-Source Large Video Generation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00131","snapshot_observed_at":"2026-08-06T16:24:05.217568Z","title":"Open-sora plan: Open-source large video generation model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13753","last_updated":"2025-07-18T08:59:02Z","snapshot_observed_at":"2026-08-09T23:30:14.905124Z","submitted_at":"2025-07-18T08:59:02Z","title":"Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T16:24:05.217568Z"},"links":{"cited_paper":"/paper/2412.00131","citing_paper":"/paper/2507.13753"},"observation_digest":"sha256:0b15aa49b4ca8225b576a8b1854874fe5b5213af2484b408aa26feb0966d013c","observation_id":"36f84924-0470-431f-8eb2-8773afda9bb5","resolution":{"observed_at":"2026-08-06T16:24:05.217568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12706","last_updated":"2024-03-19T13:08:54Z","snapshot_observed_at":"2026-07-06T17:46:58.758589Z","submitted_at":"2024-03-19T13:08:54Z","title":"AnimateDiff-Lightning: Cross-Model Diffusion Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12706","snapshot_observed_at":"2026-08-06T16:24:05.312282Z","title":"Animatediff-lightning: Cross-model diffusion distillation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13753","last_updated":"2025-07-18T08:59:02Z","snapshot_observed_at":"2026-08-09T23:30:14.905124Z","submitted_at":"2025-07-18T08:59:02Z","title":"Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T16:24:05.312282Z"},"links":{"cited_paper":"/paper/2403.12706","citing_paper":"/paper/2507.13753"},"observation_digest":"sha256:775e59348c6bd3b1c2c3b8fd44690778afa005798a0511701e1fca2c20d1afba","observation_id":"8fa1c850-ab78-40ae-a79a-833be2520ff8","resolution":{"observed_at":"2026-08-06T16:24:05.312282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:24:10.976366Z","title":"Towards understanding cross and self-attention in stable diffusion for text-guided image editing","venue":null,"work_id":"700c3d31-2941-482e-998d-6f686d6f60e7","year":2024},"citing_paper":{"arxiv_id":"2507.13753","last_updated":"2025-07-18T08:59:02Z","snapshot_observed_at":"2026-08-09T23:30:14.905124Z","submitted_at":"2025-07-18T08:59:02Z","title":"Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T16:24:05.379869Z"},"links":{"citing_paper":"/paper/2507.13753"},"observation_digest":"sha256:0cffc0903ba6cc63e16aedab47620c8bc7b365a8fb8fe03e6c2e62301ef5e940","observation_id":"c554a101-d293-4e2f-bd43-d2de26e0588c","resolution":{"observed_at":"2026-08-06T16:24:10.982327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:24:10.951832Z","title":"At- tentive linguistic tracking in diffusion models for training- free text-guided image editing","venue":null,"work_id":"63f7f57d-aedf-463f-8ab0-275f4181d15b","year":2024},"citing_paper":{"arxiv_id":"2507.13753","last_updated":"2025-07-18T08:59:02Z","snapshot_observed_at":"2026-08-09T23:30:14.905124Z","submitted_at":"2025-07-18T08:59:02Z","title":"Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T16:24:05.466037Z"},"links":{"citing_paper":"/paper/2507.13753"},"observation_digest":"sha256:3633b7b2b75757ea68c7c0e6fefd828f944c027fe854a3e74e1995e12e65f686","observation_id":"f9958775-c95f-4fb9-9431-f61f11ac0c70","resolution":{"observed_at":"2026-08-06T16:24:10.956632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:24:10.933469Z","title":"Video-p2p: Video editing with cross-attention control","venue":null,"work_id":"1d892a0d-87bf-41e4-8716-d4157c6c0049","year":2024},"citing_paper":{"arxiv_id":"2507.13753","last_updated":"2025-07-18T08:59:02Z","snapshot_observed_at":"2026-08-09T23:30:14.905124Z","submitted_at":"2025-07-18T08:59:02Z","title":"Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T16:24:05.555043Z"},"links":{"citing_paper":"/paper/2507.13753"},"observation_digest":"sha256:0fa7b2fad3cf4511a8ab53c46431c49371bcdef0235add191334a61358ef421c","observation_id":"e0d2149e-da78-48e9-9e14-de0bfcdc9884","resolution":{"observed_at":"2026-08-06T16:24:10.939679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:24:10.914971Z","title":"Evalcrafter: Benchmarking and evaluating large video generation models","venue":null,"work_id":"873237b5-1469-4c04-bc92-eff62dcd3a31","year":2024},"citing_paper":{"arxiv_id":"2507.13753","last_updated":"2025-07-18T08:59:02Z","snapshot_observed_at":"2026-08-09T23:30:14.905124Z","submitted_at":"2025-07-18T08:59:02Z","title":"Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T16:24:05.625822Z"},"links":{"citing_paper":"/paper/2507.13753"},"observation_digest":"sha256:86060ae2683401ba7fedafe67fe6f77e0c4dea51ef3755569a605f1f15e8eba9","observation_id":"918aafef-6849-436e-92b0-5db97238a645","resolution":{"observed_at":"2026-08-06T16:24:10.920453Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.01073","last_updated":"2022-01-05T00:07:35Z","snapshot_observed_at":"2026-08-08T06:35:17.078531Z","submitted_at":"2021-08-02T17:59:47Z","title":"SDEdit: Guided Image Synthesis and Editing with Stochastic Differential Equations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.01073","snapshot_observed_at":"2026-08-06T16:24:05.715742Z","title":"Sdedit: Guided image synthesis and editing with stochastic differential equa- tions","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.13753","last_updated":"2025-07-18T08:59:02Z","snapshot_observed_at":"2026-08-09T23:30:14.905124Z","submitted_at":"2025-07-18T08:59:02Z","title":"Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T16:24:05.715742Z"},"links":{"cited_paper":"/paper/2108.01073","citing_paper":"/paper/2507.13753"},"observation_digest":"sha256:7c2709afcb4e647495d6e56f11757a081994f165665bb18540ee49a600163d16","observation_id":"a4c8f94e-c403-4eb8-8480-bbe6e462190b","resolution":{"observed_at":"2026-08-06T16:24:05.715742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:24:10.768006Z","title":"Null-text inversion for editing real images using guided diffusion models","venue":null,"work_id":"e4e0dde0-c771-4fc6-af99-b52df9724395","year":2023},"citing_paper":{"arxiv_id":"2507.13753","last_updated":"2025-07-18T08:59:02Z","snapshot_observed_at":"2026-08-09T23:30:14.905124Z","submitted_at":"2025-07-18T08:59:02Z","title":"Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T16:24:05.801114Z"},"links":{"citing_paper":"/paper/2507.13753"},"observation_digest":"sha256:4c437db8ddda7db01352bd1b592186f718df906c907f63b281d900d21d3019f4","observation_id":"d72f10aa-8b15-455e-8fe0-e02e0c29693b","resolution":{"observed_at":"2026-08-06T16:24:10.897595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.07460","last_updated":"2022-05-16T06:03:00Z","snapshot_observed_at":"2026-08-04T18:06:26.992880Z","submitted_at":"2022-05-16T06:03:00Z","title":"Diffusion Models for Adversarial Purification","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.07460","snapshot_observed_at":"2026-08-06T16:24:05.886229Z","title":"Diffusion models for adversarial purification","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13753","last_updated":"2025-07-18T08:59:02Z","snapshot_observed_at":"2026-08-09T23:30:14.905124Z","submitted_at":"2025-07-18T08:59:02Z","title":"Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T16:24:05.886229Z"},"links":{"cited_paper":"/paper/2205.07460","citing_paper":"/paper/2507.13753"},"observation_digest":"sha256:ef93f558f30d0752d19cc7052cd84aab3084d6fb63da6616d49a1596355220bc","observation_id":"6d940d20-b81a-42e8-97de-901cd1f70086","resolution":{"observed_at":"2026-08-06T16:24:05.886229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:24:10.535203Z","title":null,"venue":null,"work_id":"64437164-2c0a-45a6-b99b-1ef5d374fcb5","year":2024},"citing_paper":{"arxiv_id":"2507.13753","last_updated":"2025-07-18T08:59:02Z","snapshot_observed_at":"2026-08-09T23:30:14.905124Z","submitted_at":"2025-07-18T08:59:02Z","title":"Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T16:24:05.967881Z"},"links":{"citing_paper":"/paper/2507.13753"},"observation_digest":"sha256:80e541dd368d2528c108cd3355971ac24b40ddbb553168efcbea49662075cd16","observation_id":"6473f36f-99c7-45fe-bfb0-107d9b29ee7f","resolution":{"observed_at":"2026-08-06T16:24:10.647955Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:24:10.328810Z","title":"Pika 1.0","venue":null,"work_id":"cfb118ea-069e-4889-a44c-122155988cd5","year":2023},"citing_paper":{"arxiv_id":"2507.13753","last_updated":"2025-07-18T08:59:02Z","snapshot_observed_at":"2026-08-09T23:30:14.905124Z","submitted_at":"2025-07-18T08:59:02Z","title":"Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T16:24:06.036782Z"},"links":{"citing_paper":"/paper/2507.13753"},"observation_digest":"sha256:e99fe5e91abca72d5ca9849468e3481c58f4191805800cae52cac89759ce5aa4","observation_id":"15b108a6-e171-4e04-8766-8e853205d8b4","resolution":{"observed_at":"2026-08-06T16:24:10.396746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-06T16:24:06.099876Z","title":"Sdxl: Improving latent diffusion mod- els for high-resolution image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13753","last_updated":"2025-07-18T08:59:02Z","snapshot_observed_at":"2026-08-09T23:30:14.905124Z","submitted_at":"2025-07-18T08:59:02Z","title":"Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T16:24:06.099876Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2507.13753"},"observation_digest":"sha256:02f3242e2c9e29aa03ea335a452358bab77c8bbf298ef95aed253f5619121566","observation_id":"f3e0ee66-6b11-45e7-99fe-3ba01e1f947e","resolution":{"observed_at":"2026-08-06T16:24:06.099876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:24:10.216647Z","title":"Fatezero: Fus- ing attentions for zero-shot text-based video editing","venue":null,"work_id":"e47404c1-d049-4078-90c5-8dc79434fa4f","year":2023},"citing_paper":{"arxiv_id":"2507.13753","last_updated":"2025-07-18T08:59:02Z","snapshot_observed_at":"2026-08-09T23:30:14.905124Z","submitted_at":"2025-07-18T08:59:02Z","title":"Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T16:24:06.189085Z"},"links":{"citing_paper":"/paper/2507.13753"},"observation_digest":"sha256:4c78375e0800809ae3ee9aaf079894a6947ae1d1c8f041ab9b7dfcb39112989a","observation_id":"375ff990-6126-4afb-a6eb-1ae9bb0c884b","resolution":{"observed_at":"2026-08-06T16:24:10.276468Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:24:09.983621Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":"97fda0f7-d1ad-4f12-b805-aedabb76e80d","year":2022},"citing_paper":{"arxiv_id":"2507.13753","last_updated":"2025-07-18T08:59:02Z","snapshot_observed_at":"2026-08-09T23:30:14.905124Z","submitted_at":"2025-07-18T08:59:02Z","title":"Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T16:24:06.293597Z"},"links":{"citing_paper":"/paper/2507.13753"},"observation_digest":"sha256:beb78b02dc9f2b559d3ac75c9e177238cf27686d614394362d405160df71f6ed","observation_id":"76492959-6da0-4ef4-9a55-911f3565b125","resolution":{"observed_at":"2026-08-06T16:24:10.087093Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:24:09.729811Z","title":null,"venue":null,"work_id":"69011e47-4728-4e69-aea5-747b4e8853e5","year":2023},"citing_paper":{"arxiv_id":"2507.13753","last_updated":"2025-07-18T08:59:02Z","snapshot_observed_at":"2026-08-09T23:30:14.905124Z","submitted_at":"2025-07-18T08:59:02Z","title":"Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T16:24:06.383786Z"},"links":{"citing_paper":"/paper/2507.13753"},"observation_digest":"sha256:f3e12fb8ff83476086184679c7642b381fd952732fcd06e1fb45cda463674f4d","observation_id":"907c4bd1-90d0-4049-b627-4946d099121e","resolution":{"observed_at":"2026-08-06T16:24:09.833297Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:24:09.696661Z","title":null,"venue":null,"work_id":"11b26e8c-0e02-4788-99b6-503762e25156","year":2024},"citing_paper":{"arxiv_id":"2507.13753","last_updated":"2025-07-18T08:59:02Z","snapshot_observed_at":"2026-08-09T23:30:14.905124Z","submitted_at":"2025-07-18T08:59:02Z","title":"Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T16:24:06.484434Z"},"links":{"citing_paper":"/paper/2507.13753"},"observation_digest":"sha256:68667a33a5365f42a9ca529dea23bcba51d9d493e8a218f74f1c28a69e4e1d37","observation_id":"a3af56a6-1e74-46b2-95c1-85849e106bab","resolution":{"observed_at":"2026-08-06T16:24:09.717542Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:24:09.516635Z","title":"Bivdiff: A training-free framework for general-purpose video synthesis via bridging image and video diffusion models","venue":null,"work_id":"66f90529-2b95-4c27-bca7-3554af7161ae","year":2024},"citing_paper":{"arxiv_id":"2507.13753","last_updated":"2025-07-18T08:59:02Z","snapshot_observed_at":"2026-08-09T23:30:14.905124Z","submitted_at":"2025-07-18T08:59:02Z","title":"Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T16:24:06.570787Z"},"links":{"citing_paper":"/paper/2507.13753"},"observation_digest":"sha256:28d5fc27b01867338772556d68297be53b944fd12fe7549349d666956e8d2302","observation_id":"320ef7f0-0c21-4df9-940f-9781f83cfd51","resolution":{"observed_at":"2026-08-06T16:24:09.612955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:24:09.344703Z","title":"Edit-a-video: Single video editing with object-aware consistency","venue":null,"work_id":"acc3560b-52fa-48a0-b8c2-94abb58469c4","year":2024},"citing_paper":{"arxiv_id":"2507.13753","last_updated":"2025-07-18T08:59:02Z","snapshot_observed_at":"2026-08-09T23:30:14.905124Z","submitted_at":"2025-07-18T08:59:02Z","title":"Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T16:24:06.666069Z"},"links":{"citing_paper":"/paper/2507.13753"},"observation_digest":"sha256:e004f721b17717a47077a067bdf5396e15e0b021fe6184cc50ee29e9622b7578","observation_id":"aab08ec3-8f12-4e8a-9e98-8016e78cb9fa","resolution":{"observed_at":"2026-08-06T16:24:09.422686Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14792","last_updated":"2022-09-29T13:59:46Z","snapshot_observed_at":"2026-07-06T13:57:47.051387Z","submitted_at":"2022-09-29T13:59:46Z","title":"Make-A-Video: Text-to-Video Generation without Text-Video Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14792","snapshot_observed_at":"2026-08-06T16:24:06.746047Z","title":"Make-a-video: Text-to-video generation without text-video data","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13753","last_updated":"2025-07-18T08:59:02Z","snapshot_observed_at":"2026-08-09T23:30:14.905124Z","submitted_at":"2025-07-18T08:59:02Z","title":"Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T16:24:06.746047Z"},"links":{"cited_paper":"/paper/2209.14792","citing_paper":"/paper/2507.13753"},"observation_digest":"sha256:ed424e2787122a9a5472dc28d75e4780723ee8dbbab7b9790a162d609aed281f","observation_id":"b4988830-1ec9-464e-b471-d6a70db25a75","resolution":{"observed_at":"2026-08-06T16:24:06.746047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-07-06T10:01:50.133383Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-06T16:24:06.829645Z","title":"Denoising diffusion implicit models","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.13753","last_updated":"2025-07-18T08:59:02Z","snapshot_observed_at":"2026-08-09T23:30:14.905124Z","submitted_at":"2025-07-18T08:59:02Z","title":"Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T16:24:06.829645Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2507.13753"},"observation_digest":"sha256:4258884fe1b79b9e47a8c215519eaa34a0ae22d46acbbf50f35f34ea603a18fd","observation_id":"328a147e-05c2-41d5-81eb-ab35e98dfc4f","resolution":{"observed_at":"2026-08-06T16:24:06.829645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:24:09.133507Z","title":"Plug-and-play diffusion features for text-driven image-to-image translation","venue":null,"work_id":"42cf5193-f9c7-4c92-88bc-368846f8df19","year":1921},"citing_paper":{"arxiv_id":"2507.13753","last_updated":"2025-07-18T08:59:02Z","snapshot_observed_at":"2026-08-09T23:30:14.905124Z","submitted_at":"2025-07-18T08:59:02Z","title":"Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T16:24:06.915722Z"},"links":{"citing_paper":"/paper/2507.13753"},"observation_digest":"sha256:17510014946e20c47c290d250009ec588c7e3a0d02782105c8bf99967bb23dee","observation_id":"8657e463-d5c8-4a85-913c-bcf6d3112a97","resolution":{"observed_at":"2026-08-06T16:24:09.249295Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06571","last_updated":"2023-08-12T13:53:10Z","snapshot_observed_at":"2026-08-10T01:52:30.999213Z","submitted_at":"2023-08-12T13:53:10Z","title":"ModelScope Text-to-Video Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06571","snapshot_observed_at":"2026-08-06T16:24:06.980555Z","title":"Modelscope text-to-video technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13753","last_updated":"2025-07-18T08:59:02Z","snapshot_observed_at":"2026-08-09T23:30:14.905124Z","submitted_at":"2025-07-18T08:59:02Z","title":"Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T16:24:06.980555Z"},"links":{"cited_paper":"/paper/2308.06571","citing_paper":"/paper/2507.13753"},"observation_digest":"sha256:1687a04afdee15ccd6db81ffa64b0804baad6d46f5d6c9a1ec403194befd1cb2","observation_id":"845dbd66-6d58-4869-8af5-3aa2b0ed9879","resolution":{"observed_at":"2026-08-06T16:24:06.980555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15103","last_updated":"2023-09-27T03:51:52Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:52:03Z","title":"LAVIE: High-Quality Video Generation with Cascaded Latent Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15103","snapshot_observed_at":"2026-08-06T16:24:07.087178Z","title":"Lavie: High-quality video gener- ation with cascaded latent diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13753","last_updated":"2025-07-18T08:59:02Z","snapshot_observed_at":"2026-08-09T23:30:14.905124Z","submitted_at":"2025-07-18T08:59:02Z","title":"Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T16:24:07.087178Z"},"links":{"cited_paper":"/paper/2309.15103","citing_paper":"/paper/2507.13753"},"observation_digest":"sha256:af7b33e8f22d400786f4ac338b4a3eeeaecd5035875ce877d76b14de4472e942","observation_id":"f6e5d777-157d-4421-9480-31be1a41639a","resolution":{"observed_at":"2026-08-06T16:24:07.087178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:24:08.960746Z","title":"Exploring video quality assessment on user generated contents from aesthetic and technical perspectives","venue":null,"work_id":"299358f2-4cdf-4d94-ac53-5b476a39f90f","year":2023},"citing_paper":{"arxiv_id":"2507.13753","last_updated":"2025-07-18T08:59:02Z","snapshot_observed_at":"2026-08-09T23:30:14.905124Z","submitted_at":"2025-07-18T08:59:02Z","title":"Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T16:24:07.174284Z"},"links":{"citing_paper":"/paper/2507.13753"},"observation_digest":"sha256:b9f74d25aa41917f72e0054b5d953332fee99bf920423aa7483542ffc3b61e37","observation_id":"a9a1aa62-1b7b-41d2-9abd-0de5e46b7720","resolution":{"observed_at":"2026-08-06T16:24:09.038369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:24:08.750900Z","title":"Tune-a-video: One-shot tun- ing of image diffusion models for text-to-video generation","venue":null,"work_id":"b6712cff-dfb2-4dc7-b5ba-2e79950c41a8","year":2023},"citing_paper":{"arxiv_id":"2507.13753","last_updated":"2025-07-18T08:59:02Z","snapshot_observed_at":"2026-08-09T23:30:14.905124Z","submitted_at":"2025-07-18T08:59:02Z","title":"Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T16:24:07.254277Z"},"links":{"citing_paper":"/paper/2507.13753"},"observation_digest":"sha256:6d8ace5b9ced8c5002b0d4ee3e4009a84b2185920a5aa42e1912cf720e71374f","observation_id":"7cf0cde8-aba3-4dc7-b04d-146c968e51e1","resolution":{"observed_at":"2026-08-06T16:24:08.865062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:24:08.607855Z","title":"Rerender a video: Zero-shot text-guided video-to-video translation","venue":null,"work_id":"1dc9df0a-be89-4967-a944-5d2532592266","year":2023},"citing_paper":{"arxiv_id":"2507.13753","last_updated":"2025-07-18T08:59:02Z","snapshot_observed_at":"2026-08-09T23:30:14.905124Z","submitted_at":"2025-07-18T08:59:02Z","title":"Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T16:24:07.339187Z"},"links":{"citing_paper":"/paper/2507.13753"},"observation_digest":"sha256:bc98f5752364f2a0896538494122075caaf53e7b22f85dec5d690547d63d1aa2","observation_id":"ffa0efa5-6e01-4291-81c3-745e8b7e73d2","resolution":{"observed_at":"2026-08-06T16:24:08.669898Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:24:08.469874Z","title":"Fresco: Spatial-temporal correspondence for zero-shot video translation","venue":null,"work_id":"df695f61-11a0-4bfc-a88b-c78266935048","year":2024},"citing_paper":{"arxiv_id":"2507.13753","last_updated":"2025-07-18T08:59:02Z","snapshot_observed_at":"2026-08-09T23:30:14.905124Z","submitted_at":"2025-07-18T08:59:02Z","title":"Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T16:24:07.427186Z"},"links":{"citing_paper":"/paper/2507.13753"},"observation_digest":"sha256:d08a1d001adff6e53e110652926d72469f457ffbaf4cd33cdb262775ce8da935","observation_id":"a13928cf-a1bb-4530-9664-af5f101d3778","resolution":{"observed_at":"2026-08-06T16:24:08.509404Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-06T16:24:07.516251Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13753","last_updated":"2025-07-18T08:59:02Z","snapshot_observed_at":"2026-08-09T23:30:14.905124Z","submitted_at":"2025-07-18T08:59:02Z","title":"Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T16:24:07.516251Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2507.13753"},"observation_digest":"sha256:f4cd90966a24b2f35d5111b5c1278b0155bf20ac05dfc634b570f8d3f2ab4d6d","observation_id":"60f5666e-ec18-497c-99ac-9f1789767b36","resolution":{"observed_at":"2026-08-06T16:24:07.516251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04145","last_updated":"2023-11-07T17:16:06Z","snapshot_observed_at":"2026-08-02T12:25:34.488259Z","submitted_at":"2023-11-07T17:16:06Z","title":"I2VGen-XL: High-Quality Image-to-Video Synthesis via Cascaded Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04145","snapshot_observed_at":"2026-08-06T16:24:07.602629Z","title":"I2vgen-xl: High-quality image-to-video synthesis via cascaded diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13753","last_updated":"2025-07-18T08:59:02Z","snapshot_observed_at":"2026-08-09T23:30:14.905124Z","submitted_at":"2025-07-18T08:59:02Z","title":"Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T16:24:07.602629Z"},"links":{"cited_paper":"/paper/2311.04145","citing_paper":"/paper/2507.13753"},"observation_digest":"sha256:240d1444ec4add40aa3c52957205f84d5b9b116765aa0d32e43cbc77d19f28e4","observation_id":"97fe92c6-dd19-48d1-8024-14ca4544c834","resolution":{"observed_at":"2026-08-06T16:24:07.602629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13077","last_updated":"2023-05-22T14:48:53Z","snapshot_observed_at":"2026-08-08T20:41:37.700266Z","submitted_at":"2023-05-22T14:48:53Z","title":"ControlVideo: Training-free Controllable Text-to-Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13077","snapshot_observed_at":"2026-08-06T16:24:07.699049Z","title":"Controlvideo: Training-free controllable text-to-video generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13753","last_updated":"2025-07-18T08:59:02Z","snapshot_observed_at":"2026-08-09T23:30:14.905124Z","submitted_at":"2025-07-18T08:59:02Z","title":"Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T16:24:07.699049Z"},"links":{"cited_paper":"/paper/2305.13077","citing_paper":"/paper/2507.13753"},"observation_digest":"sha256:d76454b9ba7cb61547f463df873ad9e0ac0451915ac7ee1969f5771028ab5e95","observation_id":"6f4480d7-b3f2-4914-bd8d-0eb6e57c9371","resolution":{"observed_at":"2026-08-06T16:24:07.699049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05438","last_updated":"2024-03-08T16:44:54Z","snapshot_observed_at":"2026-07-06T17:41:38.868865Z","submitted_at":"2024-03-08T16:44:54Z","title":"VideoElevator: Elevating Video Generation Quality with Versatile Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":"2403.05438","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.05438","snapshot_observed_at":"2026-08-06T16:24:07.948797Z","title":"VideoElevator: Elevating Video Generation Quality with Versatile Text-to-Image Diffusion Models","venue":"cs.CV","work_id":"fa1ff2f0-ef24-4b08-8292-7ca89186c202","year":2024},"citing_paper":{"arxiv_id":"2507.13753","last_updated":"2025-07-18T08:59:02Z","snapshot_observed_at":"2026-08-09T23:30:14.905124Z","submitted_at":"2025-07-18T08:59:02Z","title":"Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T16:24:07.779000Z"},"links":{"cited_paper":"/paper/2403.05438","citing_paper":"/paper/2507.13753"},"observation_digest":"sha256:e982b73cc5dc14e9a060d364c4ac9d1b9265c5a93508627a93aa4963a4eda767","observation_id":"ec343ff1-a59f-4dbf-ac32-4a867b6a9583","resolution":{"observed_at":"2026-08-06T16:24:08.016744Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.13753","last_updated":"2025-07-18T08:59:02Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T23:30:14.905124Z","submitted_at":"2025-07-18T08:59:02Z","title":"Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis"},"reference_resolution":{"displayed":48,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":1,"verified_fuzzy":24},"total_outbound_references":48},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 48 of 48 outbound references and 0 inbound Pith citation observations for arXiv:2507.13753."}