{"as_of":"2026-08-18T15:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:abb8fec2563c878f176cbada9061ac7052a18f68d990e40ed2923a5b3d705ca6","coverage":[{"denominator":116,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T22:58:51.792047Z","state":"measured"},{"denominator":200,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":200,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":1074,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T21:41:59.389473Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":67,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":"2311.15127","doi":"10.48550/arxiv.2311.15127","metadata_source":"pith","pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","venue":"cs.CV","work_id":"4f68eada-27e3-437a-a2fe-6e4ca524d0d3","year":2023},"citing_paper":{"arxiv_id":"2312.14125","last_updated":"2024-06-04T17:25:20Z","snapshot_observed_at":"2026-08-14T12:12:01.418974Z","submitted_at":"2023-12-21T18:46:41Z","title":"VideoPoet: A Large Language Model for Zero-Shot Video Generation","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-15T17:51:05.465548Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2312.14125"},"observation_digest":"sha256:34ee9894790a6f477b165e5d9ef524a54c0d7ee2b6de37ff43d61a9135c82d03","observation_id":"677f517e-ed14-4944-b95a-9fa4b713fb03","resolution":{"observed_at":"2026-05-15T17:51:05.543020Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":"2311.15127","doi":"10.48550/arxiv.2311.15127","metadata_source":"pith","pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","venue":"cs.CV","work_id":"4f68eada-27e3-437a-a2fe-6e4ca524d0d3","year":2023},"citing_paper":{"arxiv_id":"2401.03048","last_updated":"2025-05-01T09:40:21Z","snapshot_observed_at":"2026-08-13T10:28:06.516901Z","submitted_at":"2024-01-05T19:55:15Z","title":"Latte: Latent Diffusion Transformer for Video Generation","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-13T21:45:35.754742Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2401.03048"},"observation_digest":"sha256:367ee423e84ef71839478c00bda05ba1d4c52d59bfd1ffe7763be37a3198eb51","observation_id":"75e31660-5491-4556-88cb-ccdecfdb3d77","resolution":{"observed_at":"2026-05-13T21:45:35.812408Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":"2311.15127","doi":"10.48550/arxiv.2311.15127","metadata_source":"pith","pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","venue":"cs.CV","work_id":"4f68eada-27e3-437a-a2fe-6e4ca524d0d3","year":2023},"citing_paper":{"arxiv_id":"2402.15852","last_updated":"2024-06-30T11:14:13Z","snapshot_observed_at":"2026-08-18T12:12:42.503422Z","submitted_at":"2024-02-24T16:39:16Z","title":"NaVid: Video-based VLM Plans the Next Step for Vision-and-Language Navigation","version":7},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-18T04:55:20.362512Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2402.15852"},"observation_digest":"sha256:9f4fc6edf15cc7872979de0b56a9778019938b1bb5cae22ad9375ba65926ee39","observation_id":"1f3eaacc-c372-456e-9c1d-a941e73eca30","resolution":{"observed_at":"2026-05-18T04:55:20.419878Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":"2311.15127","doi":"10.48550/arxiv.2311.15127","metadata_source":"pith","pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","venue":"cs.CV","work_id":"4f68eada-27e3-437a-a2fe-6e4ca524d0d3","year":2023},"citing_paper":{"arxiv_id":"2402.17177","last_updated":"2024-04-17T18:41:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-27T03:30:58Z","title":"Sora: A Review on Background, Technology, Limitations, and Opportunities of Large Vision Models","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-13T13:43:11.024069Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2402.17177"},"observation_digest":"sha256:8a79b70423ecd18d3ce59460840719090674d07d82037e09019c7fee949a3bb0","observation_id":"321e56ae-80eb-47fa-998c-2420a872f1e1","resolution":{"observed_at":"2026-05-13T13:43:11.088767Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":"2311.15127","doi":"10.48550/arxiv.2311.15127","metadata_source":"pith","pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","venue":"cs.CV","work_id":"4f68eada-27e3-437a-a2fe-6e4ca524d0d3","year":2023},"citing_paper":{"arxiv_id":"2403.03206","last_updated":"2024-03-05T18:45:39Z","snapshot_observed_at":"2026-08-13T01:47:21.043519Z","submitted_at":"2024-03-05T18:45:39Z","title":"Scaling Rectified Flow Transformers for High-Resolution Image Synthesis","version":1},"reference_index":114,"source":"arxiv_source","source_observed_at":"2026-05-12T08:27:53.446686Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2403.03206"},"observation_digest":"sha256:1eb57be51f2b34195ce9129dacdedc1080606541d34f2caf860c3d3cb3173e18","observation_id":"076c8b60-ee63-4f63-8fe3-f9764c5aca6e","resolution":{"observed_at":"2026-05-12T08:27:53.615646Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":"2311.15127","doi":"10.48550/arxiv.2311.15127","metadata_source":"pith","pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","venue":"cs.CV","work_id":"4f68eada-27e3-437a-a2fe-6e4ca524d0d3","year":2023},"citing_paper":{"arxiv_id":"2404.02101","last_updated":"2025-03-13T18:35:06Z","snapshot_observed_at":"2026-08-16T17:39:09.604516Z","submitted_at":"2024-04-02T16:52:41Z","title":"CameraCtrl: Enabling Camera Control for Text-to-Video Generation","version":2},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-05-13T02:06:23.410241Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2404.02101"},"observation_digest":"sha256:d3e5fa69267c94565765391773d24777bb84fe0141227191b77c69ffec2b00c2","observation_id":"6425987e-38d7-48ff-841b-678099452bc6","resolution":{"observed_at":"2026-05-13T02:06:23.575572Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":"2311.15127","doi":"10.48550/arxiv.2311.15127","metadata_source":"pith","pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","venue":"cs.CV","work_id":"4f68eada-27e3-437a-a2fe-6e4ca524d0d3","year":2023},"citing_paper":{"arxiv_id":"2404.07191","last_updated":"2024-04-14T16:54:24Z","snapshot_observed_at":"2026-08-13T18:57:44.379289Z","submitted_at":"2024-04-10T17:48:37Z","title":"InstantMesh: Efficient 3D Mesh Generation from a Single Image with Sparse-view Large Reconstruction Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-13T21:15:33.430513Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2404.07191"},"observation_digest":"sha256:3a29a962ccf7d62a009bd33b23685ef89567b853b959dbc0682ef50405951ab6","observation_id":"c828e4c4-3656-491e-84ee-4f08741443cf","resolution":{"observed_at":"2026-05-13T21:15:33.457880Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":"2311.15127","doi":"10.48550/arxiv.2311.15127","metadata_source":"pith","pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","venue":"cs.CV","work_id":"4f68eada-27e3-437a-a2fe-6e4ca524d0d3","year":2023},"citing_paper":{"arxiv_id":"2405.10314","last_updated":"2024-05-16T17:59:05Z","snapshot_observed_at":"2026-08-15T07:34:03.035482Z","submitted_at":"2024-05-16T17:59:05Z","title":"CAT3D: Create Anything in 3D with Multi-View Diffusion Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-19T21:29:51.062396Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2405.10314"},"observation_digest":"sha256:cdd026cc733ce7504af291b271fb1274ca28511dd74b9695c288b7d43798a61b","observation_id":"a3382bfb-fddc-4c12-a12d-8968b9ab22e9","resolution":{"observed_at":"2026-05-19T21:29:51.094198Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":"2311.15127","doi":"10.48550/arxiv.2311.15127","metadata_source":"pith","pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","venue":"cs.CV","work_id":"4f68eada-27e3-437a-a2fe-6e4ca524d0d3","year":2023},"citing_paper":{"arxiv_id":"2406.03520","last_updated":"2024-10-03T17:24:40Z","snapshot_observed_at":"2026-08-16T12:54:37.000371Z","submitted_at":"2024-06-05T17:53:55Z","title":"VideoPhy: Evaluating Physical Commonsense for Video Generation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-20T11:34:37.599691Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2406.03520"},"observation_digest":"sha256:fa71d918d6a68aefcd51b5fee71de5c25987f52f8a024f42d1b5689f1cfa71c4","observation_id":"0bf5dc40-2682-4de3-8de1-cb57f57c26ad","resolution":{"observed_at":"2026-05-20T11:34:37.690990Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":"2311.15127","doi":"10.48550/arxiv.2311.15127","metadata_source":"pith","pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","venue":"cs.CV","work_id":"4f68eada-27e3-437a-a2fe-6e4ca524d0d3","year":2023},"citing_paper":{"arxiv_id":"2407.02371","last_updated":"2025-02-13T10:13:24Z","snapshot_observed_at":"2026-08-07T10:03:56.902190Z","submitted_at":"2024-07-02T15:40:29Z","title":"OpenVid-1M: A Large-Scale High-Quality Dataset for Text-to-video Generation","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-14T20:34:53.141898Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2407.02371"},"observation_digest":"sha256:afb96202f2eb7780fa9180ef03946b43039560106d5f5e004cc3ffa7869b2e0f","observation_id":"bb8bf142-82cf-43d4-874c-aa0f3ee16a3a","resolution":{"observed_at":"2026-05-14T20:34:53.169615Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":"2311.15127","doi":"10.48550/arxiv.2311.15127","metadata_source":"pith","pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","venue":"cs.CV","work_id":"4f68eada-27e3-437a-a2fe-6e4ca524d0d3","year":2023},"citing_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-08-15T19:52:28.153954Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-05-10T18:26:22.224924Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2408.06072"},"observation_digest":"sha256:2b83ffd63c956c568bcb6a6e118c3f28113c412b09569c6cef8e17016fdb3b77","observation_id":"a3cdd265-58fa-4aa8-9359-fb467f8c3595","resolution":{"observed_at":"2026-05-10T22:58:52.491420Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":"2311.15127","doi":"10.48550/arxiv.2311.15127","metadata_source":"pith","pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","venue":"cs.CV","work_id":"4f68eada-27e3-437a-a2fe-6e4ca524d0d3","year":2023},"citing_paper":{"arxiv_id":"2408.14837","last_updated":"2025-04-24T03:03:57Z","snapshot_observed_at":"2026-08-14T07:06:06.462400Z","submitted_at":"2024-08-27T07:46:07Z","title":"Diffusion Models Are Real-Time Game Engines","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-05-16T12:04:44.162343Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2408.14837"},"observation_digest":"sha256:18d7e52c6581441d692ee5ff84791d8307f74b13b99a8994087c05380616cf24","observation_id":"94ea79f7-864c-4058-a759-95fb8bf2e203","resolution":{"observed_at":"2026-05-16T12:04:44.211533Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":"2311.15127","doi":"10.48550/arxiv.2311.15127","metadata_source":"pith","pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","venue":"cs.CV","work_id":"4f68eada-27e3-437a-a2fe-6e4ca524d0d3","year":2023},"citing_paper":{"arxiv_id":"2409.02048","last_updated":"2024-09-03T16:53:19Z","snapshot_observed_at":"2026-08-14T12:22:44.567374Z","submitted_at":"2024-09-03T16:53:19Z","title":"ViewCrafter: Taming Video Diffusion Models for High-fidelity Novel View Synthesis","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-13T22:59:03.642189Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2409.02048"},"observation_digest":"sha256:7efce5a90340357718140b9e14e2ed51f1caf5113449e50dcf2843ee0f2bc76f","observation_id":"20e19241-9f9d-4c4d-8186-82bbbe15b687","resolution":{"observed_at":"2026-05-13T22:59:03.767446Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":"2311.15127","doi":"10.48550/arxiv.2311.15127","metadata_source":"pith","pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","venue":"cs.CV","work_id":"4f68eada-27e3-437a-a2fe-6e4ca524d0d3","year":2023},"citing_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-11T10:56:06.418360Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2409.18869"},"observation_digest":"sha256:423ef76ba6f930444927fce215822739f4672c3883882cd825363d831363f0f3","observation_id":"83453ea2-74ea-49e4-aa2b-fcc77435730a","resolution":{"observed_at":"2026-05-11T10:56:06.835877Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":"2311.15127","doi":"10.48550/arxiv.2311.15127","metadata_source":"pith","pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","venue":"cs.CV","work_id":"4f68eada-27e3-437a-a2fe-6e4ca524d0d3","year":2023},"citing_paper":{"arxiv_id":"2410.06940","last_updated":"2025-06-18T04:35:42Z","snapshot_observed_at":"2026-07-06T19:30:26.233621Z","submitted_at":"2024-10-09T14:34:53Z","title":"Representation Alignment for Generation: Training Diffusion Transformers Is Easier Than You Think","version":4},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-05-12T15:09:36.982610Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2410.06940"},"observation_digest":"sha256:7753c358d25bc1c67b3220f9682572a88cb6d15e666fdd1375ae083e0d1192b3","observation_id":"c0cdda6d-db31-45f2-a834-168fdac0b0dc","resolution":{"observed_at":"2026-05-12T15:09:37.066514Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":"2311.15127","doi":"10.48550/arxiv.2311.15127","metadata_source":"pith","pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","venue":"cs.CV","work_id":"4f68eada-27e3-437a-a2fe-6e4ca524d0d3","year":2023},"citing_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-17T10:09:03.767186Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-11T14:16:18.521699Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2410.13720"},"observation_digest":"sha256:98f33f0b16cccbf484b844090b1a3b99a82aa5de5811fe502b778d0d39714472","observation_id":"10a9d913-aaf0-4b72-8189-aac96663ddfa","resolution":{"observed_at":"2026-05-11T14:16:20.818910Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-12T21:41:59.389473Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-08-15T19:31:44.704542Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T21:41:59.389473Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2411.08380"},"observation_digest":"sha256:42deb96543d26cf749e2476ff3508df72ddd6aed4128bde767cdb9d2a54b062c","observation_id":"84e4c6b2-ee04-44c5-9037-1d6f79041a67","resolution":{"observed_at":"2026-08-12T21:41:59.389473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-12T21:18:03.727266Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.08954","last_updated":"2024-11-15T16:06:23Z","snapshot_observed_at":"2026-08-17T08:28:39.025560Z","submitted_at":"2024-11-13T19:00:02Z","title":"Inconsistencies In Consistency Models: Better ODE Solving Does Not Imply Better Samples","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T21:18:03.727266Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2411.08954"},"observation_digest":"sha256:9b34f996384b9ddad0677c9350d6ade1f081fcb11fe012ff2f37a50474cef6fb","observation_id":"565a1922-dc46-4826-8cb3-3c7397282881","resolution":{"observed_at":"2026-08-12T21:18:03.727266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-12T21:04:21.804079Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.09153","last_updated":"2024-11-14T03:13:26Z","snapshot_observed_at":"2026-08-17T17:11:35.275111Z","submitted_at":"2024-11-14T03:13:26Z","title":"VidMan: Exploiting Implicit Dynamics from Video Diffusion Model for Effective Robot Manipulation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T21:04:21.804079Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2411.09153"},"observation_digest":"sha256:a4237570e37cfa454f409f876951c550cb38b10dfc470050cde677407fcbe30a","observation_id":"ada0954a-fa50-4a24-8d99-61e35478ad2a","resolution":{"observed_at":"2026-08-12T21:04:21.804079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-12T20:53:14.800657Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.09259","last_updated":"2024-12-09T14:22:14Z","snapshot_observed_at":"2026-08-15T23:29:53.216494Z","submitted_at":"2024-11-14T07:51:51Z","title":"Jailbreak Attacks and Defenses against Multimodal Generative Models: A Survey","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T20:53:14.800657Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2411.09259"},"observation_digest":"sha256:ff0d8f0d68d979b5cd9572925a6c4bcacde32d8b11e287f53ae8e3f644aad6dd","observation_id":"5dc5de44-5a52-4d42-92f1-7ab9ecf08cf9","resolution":{"observed_at":"2026-08-12T20:53:14.800657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-12T19:20:48.099378Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10818","last_updated":"2024-11-16T14:53:03Z","snapshot_observed_at":"2026-08-12T19:13:42.887078Z","submitted_at":"2024-11-16T14:53:03Z","title":"FlipSketch: Flipping Static Drawings to Text-Guided Sketch Animations","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T19:20:48.099378Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2411.10818"},"observation_digest":"sha256:4e9b551dc841dedc480ca79319d6c6d402405d351703b222a113774fda04a192","observation_id":"11152d15-d8fb-47ee-80f7-4bc5d27a4c12","resolution":{"observed_at":"2026-08-12T19:20:48.099378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-12T18:56:47.843475Z","title":"Blattmann, Tim Dockhorn, Sumith Kulal, Daniel Mendelevitch, Maciej Kilian, and Do- minik Lorenz","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11162","last_updated":"2024-11-17T19:45:26Z","snapshot_observed_at":"2026-08-14T04:45:38.459526Z","submitted_at":"2024-11-17T19:45:26Z","title":"RPN 2: On Interdependence Function Learning Towards Unifying and Advancing CNN, RNN, GNN, and Transformer","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T18:56:47.843475Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2411.11162"},"observation_digest":"sha256:01c6d349f9b82146f8f19a0810732a87b5593744750007e4d2538da57ef2cd88","observation_id":"393f26d0-2319-40c7-a8a0-6d1ea5e00796","resolution":{"observed_at":"2026-08-12T18:56:47.843475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-12T18:50:32.332554Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11252","last_updated":"2024-11-18T03:00:33Z","snapshot_observed_at":"2026-08-16T02:06:32.674449Z","submitted_at":"2024-11-18T03:00:33Z","title":"DrivingSphere: Building a High-fidelity 4D World for Closed-loop Simulation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T18:50:32.332554Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2411.11252"},"observation_digest":"sha256:6e08d3f0ba745193a6fb582da35fca6c26c4a20a84607b22adf0b3610859ffdb","observation_id":"1603c780-1067-450f-bb66-76d1021955db","resolution":{"observed_at":"2026-08-12T18:50:32.332554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-12T18:09:24.021530Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets, 2023 a","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11844","last_updated":"2025-09-08T14:56:58Z","snapshot_observed_at":"2026-08-14T03:10:28.424146Z","submitted_at":"2024-11-18T18:59:31Z","title":"Generative World Explorer","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-12T18:09:24.021530Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2411.11844"},"observation_digest":"sha256:0fcf29ad5a0767abe2a779596bf835794bd607370d23e9805b86b58306fe504a","observation_id":"cf62f43f-c85c-4500-b4b8-88f420ad6239","resolution":{"observed_at":"2026-08-12T18:09:24.021530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-12T18:23:28.365169Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11934","last_updated":"2025-04-27T07:46:27Z","snapshot_observed_at":"2026-08-15T12:22:32.674577Z","submitted_at":"2024-11-18T15:12:59Z","title":"SpatialDreamer: Self-supervised Stereo Video Synthesis from Monocular Input","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T18:23:28.365169Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2411.11934"},"observation_digest":"sha256:4f8f5f24b9b5a3e08db45e77cd941cdbe20201d04aa16e3d501532cf5c844fb8","observation_id":"52e97db3-16c8-4758-afbb-0b35f933e8a7","resolution":{"observed_at":"2026-08-12T18:23:28.365169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-12T18:11:36.525393Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11943","last_updated":"2024-11-18T18:37:09Z","snapshot_observed_at":"2026-08-13T14:50:18.789212Z","submitted_at":"2024-11-18T18:37:09Z","title":"Medical Video Generation for Disease Progression Simulation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T18:11:36.525393Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2411.11943"},"observation_digest":"sha256:a5159157a59ffc8c994342bb2d834ce18e43906cb64a091bfefd713eb9c01072","observation_id":"ead9e6a5-5e03-493d-b160-f594c6da1e47","resolution":{"observed_at":"2026-08-12T18:11:36.525393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-12T17:34:25.845410Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.12789","last_updated":"2025-07-26T05:03:09Z","snapshot_observed_at":"2026-08-12T17:26:55.710291Z","submitted_at":"2024-11-19T12:52:21Z","title":"Efficient Physics Simulation for 3D Scenes via MLLM-Guided Gaussian Splatting","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T17:34:25.845410Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2411.12789"},"observation_digest":"sha256:2266292911042e0c0a6717eb807126e9d94709f5af973e2f80f1c883631ac966","observation_id":"bf4effda-49b5-4da8-a1c9-b578898fd42a","resolution":{"observed_at":"2026-08-12T17:34:25.845410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-12T16:22:43.958215Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13503","last_updated":"2024-11-20T17:54:41Z","snapshot_observed_at":"2026-08-12T19:44:40.357419Z","submitted_at":"2024-11-20T17:54:41Z","title":"VBench++: Comprehensive and Versatile Benchmark Suite for Video Generative Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:43.958215Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2411.13503"},"observation_digest":"sha256:16adde65f2727268d9e1f2421f4a769b79788d7fbbe243d55e9efd4427fffabd","observation_id":"160307a6-ca9f-4acb-8007-32a238f273ea","resolution":{"observed_at":"2026-08-12T16:22:43.958215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":"2311.15127","doi":"10.48550/arxiv.2311.15127","metadata_source":"pith","pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","venue":"cs.CV","work_id":"4f68eada-27e3-437a-a2fe-6e4ca524d0d3","year":2023},"citing_paper":{"arxiv_id":"2411.13549","last_updated":"2026-05-06T19:17:31Z","snapshot_observed_at":"2026-08-15T01:49:34.697725Z","submitted_at":"2024-11-20T18:58:31Z","title":"KFC-W: Generating 3D-Consistent Videos from Unposed Internet Photos","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-23T16:47:09.717923Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2411.13549"},"observation_digest":"sha256:c108e8887eb916869d5d2be955f860098f94dca6b57a2443f8b9ee029437a73d","observation_id":"7ed2eb50-bcf6-42f5-9b9a-992f78905002","resolution":{"observed_at":"2026-05-23T16:48:12.512254Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-12T17:06:37.364487Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13609","last_updated":"2024-11-24T09:57:15Z","snapshot_observed_at":"2026-08-18T04:58:18.146364Z","submitted_at":"2024-11-20T01:40:00Z","title":"What You See Is What Matters: A Novel Visual and Physics-Based Metric for Evaluating Video Generation Quality","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T17:06:37.364487Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2411.13609"},"observation_digest":"sha256:702a4f6e870c3461871258842d207b9394c1dbcf3f4e9c0811a144ca9d4c6076","observation_id":"29bcaf08-54ce-42b0-b31d-dcb75b4451cc","resolution":{"observed_at":"2026-08-12T17:06:37.364487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-12T15:56:27.063283Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13807","last_updated":"2025-07-25T02:30:46Z","snapshot_observed_at":"2026-08-12T15:49:27.374609Z","submitted_at":"2024-11-21T03:13:30Z","title":"MagicDrive-V2: High-Resolution Long Video Generation for Autonomous Driving with Adaptive Control","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T15:56:27.063283Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2411.13807"},"observation_digest":"sha256:c2bc989686814a502393f222a6fed4e379647ff14573a52e3e9528eeb28ede87","observation_id":"38660f6e-eaa7-4cd0-a368-71b6c93ced1d","resolution":{"observed_at":"2026-08-12T15:56:27.063283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-12T15:44:08.089281Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13975","last_updated":"2024-11-21T09:41:33Z","snapshot_observed_at":"2026-08-15T21:42:40.376001Z","submitted_at":"2024-11-21T09:41:33Z","title":"Transforming Static Images Using Generative Models for Video Salient Object Detection","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T15:44:08.089281Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2411.13975"},"observation_digest":"sha256:c46d89003fa2f8e54f8de0152371d8da75334ddf1b8b6278e283c2474b954281","observation_id":"b3017906-ab9c-4d57-87a3-9f90f9b6e2e1","resolution":{"observed_at":"2026-08-12T15:44:08.089281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-12T15:30:23.336641Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14208","last_updated":"2024-11-21T15:16:48Z","snapshot_observed_at":"2026-08-17T21:25:29.680858Z","submitted_at":"2024-11-21T15:16:48Z","title":"Novel View Extrapolation with Video Diffusion Priors","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T15:30:23.336641Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2411.14208"},"observation_digest":"sha256:99e3ed9f483bae3fb49624e3264c14062931f943a2b112aad255d61f0ff69913","observation_id":"7ab1391d-a32e-45b7-8de5-8c2d27109c60","resolution":{"observed_at":"2026-08-12T15:30:23.336641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-12T15:14:41.528135Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14423","last_updated":"2025-05-08T08:27:10Z","snapshot_observed_at":"2026-08-17T23:21:13.175219Z","submitted_at":"2024-11-21T18:55:23Z","title":"PhysFlow: Unleashing the Potential of Multi-modal Foundation Models and Video Diffusion for 4D Dynamic Physical Scene Simulation","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T15:14:41.528135Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2411.14423"},"observation_digest":"sha256:0e15fcb3f6dd7bfbd375018e3780ad7099a0714891f5f02ce930f9b7e4ae0a12","observation_id":"6d963a4e-9d0c-4a52-89c0-76b0c9c2e4c2","resolution":{"observed_at":"2026-08-12T15:14:41.528135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-12T14:55:41.648696Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14808","last_updated":"2025-03-02T08:53:47Z","snapshot_observed_at":"2026-08-12T17:52:10.062964Z","submitted_at":"2024-11-22T09:08:58Z","title":"High-Resolution Image Synthesis via Next-Token Prediction","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:41.648696Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2411.14808"},"observation_digest":"sha256:c6e0f3ac3db582440f95d46197357a05063a3a5cede36784bd3d6453cc007712","observation_id":"63de849b-7c06-4ff4-8926-169e3a8dc27f","resolution":{"observed_at":"2026-08-12T14:55:41.648696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":"2311.15127","doi":"10.48550/arxiv.2311.15127","metadata_source":"pith","pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","venue":"cs.CV","work_id":"4f68eada-27e3-437a-a2fe-6e4ca524d0d3","year":2023},"citing_paper":{"arxiv_id":"2411.15115","last_updated":"2026-04-20T17:59:36Z","snapshot_observed_at":"2026-08-02T10:06:23.710148Z","submitted_at":"2024-11-22T18:31:47Z","title":"Self-Correcting Text-to-Video Generation with Misalignment Detection and Localized Refinement","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-23T08:25:01.468957Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2411.15115"},"observation_digest":"sha256:bb412d22b885215623372cd7287567b80af7d5bc088d50fd291f4e6e960adfac","observation_id":"a68c16b4-5018-4766-aa85-77a91a44ceab","resolution":{"observed_at":"2026-05-23T08:25:29.354394Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-12T14:53:11.542684Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15262","last_updated":"2025-03-31T02:52:56Z","snapshot_observed_at":"2026-08-17T06:16:48.528716Z","submitted_at":"2024-11-22T10:25:08Z","title":"MovieBench: A Hierarchical Movie Level Dataset for Long Video Generation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T14:53:11.542684Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2411.15262"},"observation_digest":"sha256:0955178c161f52318fc4456c9a614b8d21fb46bd7cdb80fe0d013e99b8281dc6","observation_id":"9116f29c-f09a-47b2-95b3-3d823ad99807","resolution":{"observed_at":"2026-08-12T14:53:11.542684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-12T13:34:56.915543Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16157","last_updated":"2025-03-06T02:45:21Z","snapshot_observed_at":"2026-08-18T09:25:56.207854Z","submitted_at":"2024-11-25T07:34:23Z","title":"MVGenMaster: Scaling Multi-View Generation from Any Image via 3D Priors Enhanced Diffusion Model","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T13:34:56.915543Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2411.16157"},"observation_digest":"sha256:5abafe88a8cdfee78ee99e0e0e0bc343d94148ec11de919d38ff12c820df854e","observation_id":"8374e394-8fd1-46ed-9b7c-025d35695774","resolution":{"observed_at":"2026-08-12T13:34:56.915543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-12T13:17:46.427178Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16331","last_updated":"2025-06-05T11:49:59Z","snapshot_observed_at":"2026-08-14T22:06:30.252612Z","submitted_at":"2024-11-25T12:24:52Z","title":"Sonic: Shifting Focus to Global Audio Perception in Portrait Animation","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T13:17:46.427178Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2411.16331"},"observation_digest":"sha256:75ce20dc89456753b2123923c225dc531761b154019bcf6b492cf086cf47c530","observation_id":"c9223a25-2189-4a83-8888-b3051444de5c","resolution":{"observed_at":"2026-08-12T13:17:46.427178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-12T13:17:41.855795Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.16375","last_updated":"2025-05-21T10:38:01Z","snapshot_observed_at":"2026-08-17T01:27:04.025030Z","submitted_at":"2024-11-25T13:33:41Z","title":"Ca2-VDM: Efficient Autoregressive Video Diffusion Model with Causal Generation and Cache Sharing","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-12T13:17:41.855795Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2411.16375"},"observation_digest":"sha256:199d5a921fe6fb8e818e23388d777a6e851b8f37ef81e2887d88eb7222b231f3","observation_id":"9f6ae92b-648b-417e-bf98-e2782f8b95d1","resolution":{"observed_at":"2026-08-12T13:17:41.855795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-12T13:10:06.136789Z","title":"arXiv preprint arXiv:2311.15127 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16437","last_updated":"2024-11-25T14:39:18Z","snapshot_observed_at":"2026-08-16T07:36:15.917558Z","submitted_at":"2024-11-25T14:39:18Z","title":"Privacy Protection in Personalized Diffusion Models via Targeted Cross-Attention Adversarial Attack","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T13:10:06.136789Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2411.16437"},"observation_digest":"sha256:f438f7fb5c2e3e35d83b8b1b60aac73ab79420a0f8be535d918d42a2c12b97e1","observation_id":"0491205b-7fb1-4233-9078-09704480f6d0","resolution":{"observed_at":"2026-08-12T13:10:06.136789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-12T12:56:32.798127Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16683","last_updated":"2025-03-24T16:08:09Z","snapshot_observed_at":"2026-08-16T08:34:28.913877Z","submitted_at":"2024-11-25T18:59:57Z","title":"Generative Omnimatte: Learning to Decompose Video into Layers","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T12:56:32.798127Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2411.16683"},"observation_digest":"sha256:8d85fdcc969f511a82423702075a323202cc50b08728f52c9b965fa96196e591","observation_id":"7346384f-8588-425c-b6d3-2dd8d8fc40d7","resolution":{"observed_at":"2026-08-12T12:56:32.798127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-12T14:24:43.242671Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16720","last_updated":"2025-04-24T21:37:00Z","snapshot_observed_at":"2026-08-17T13:41:18.242726Z","submitted_at":"2024-11-23T02:01:49Z","title":"Importance-Based Token Merging for Efficient Image and Video Generation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T14:24:43.242671Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2411.16720"},"observation_digest":"sha256:0bdb67ea9fcb78cecfa2c6e197d797db6ffa0ded11370cfe8961efa334c8a8ff","observation_id":"fdc87925-0efe-4256-8b08-76cf1c4d6812","resolution":{"observed_at":"2026-08-12T14:24:43.242671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-12T14:20:34.546964Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16726","last_updated":"2024-12-16T17:11:49Z","snapshot_observed_at":"2026-08-18T10:24:15.022114Z","submitted_at":"2024-11-23T04:38:51Z","title":"EmotiveTalk: Expressive Talking Head Generation through Audio Information Decoupling and Emotional Video Diffusion","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T14:20:34.546964Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2411.16726"},"observation_digest":"sha256:8360272e0d7d1f6998cabc48ca18181c1418032ccf7f676b36b5b08bb6204c94","observation_id":"0c381b0a-75ac-4c4d-90d0-debd072b25f5","resolution":{"observed_at":"2026-08-12T14:20:34.546964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-12T13:03:42.363176Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16819","last_updated":"2025-03-20T07:02:30Z","snapshot_observed_at":"2026-08-18T08:02:47.318940Z","submitted_at":"2024-11-25T16:41:45Z","title":"Pathways on the Image Manifold: Image Editing via Video Generation","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T13:03:42.363176Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2411.16819"},"observation_digest":"sha256:08bf19276048610418357120c086f6acc273f796d39029a5269430b5a3b3fb15","observation_id":"0773e211-3941-434e-90cb-5149ee17a483","resolution":{"observed_at":"2026-08-12T13:03:42.363176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-12T12:27:41.518760Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17221","last_updated":"2024-11-26T08:43:15Z","snapshot_observed_at":"2026-08-14T11:06:10.978458Z","submitted_at":"2024-11-26T08:43:15Z","title":"AIGV-Assessor: Benchmarking and Evaluating the Perceptual Quality of Text-to-Video Generation with LMM","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T12:27:41.518760Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2411.17221"},"observation_digest":"sha256:fc7d5ffec99546f217cf31b1f3469c4274efb12e1e58f99ee40f5c42b3f98fe9","observation_id":"e99f3425-8652-4e6f-b561-f8c14e98878e","resolution":{"observed_at":"2026-08-12T12:27:41.518760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-12T12:26:49.345431Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-15T14:15:59.605732Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.345431Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:6080547026794cf69a555d3354a05fe0e93a5a9c228cf6b1741ea3424ebe3f37","observation_id":"2518f65c-8653-4fde-acf1-c5c1fb3e8f37","resolution":{"observed_at":"2026-08-12T12:26:49.345431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-12T12:18:02.480654Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17383","last_updated":"2025-06-23T06:27:21Z","snapshot_observed_at":"2026-08-16T09:32:44.099692Z","submitted_at":"2024-11-26T12:42:13Z","title":"AnchorCrafter: Animate Cyber-Anchors Selling Your Products via Human-Object Interacting Video Generation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T12:18:02.480654Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2411.17383"},"observation_digest":"sha256:1cacb2d0f32336db3573699cfbd10024de34ea60c64c5e087b9cdbbc3bbb0b42","observation_id":"848a662a-caff-4f38-9a73-a640104cf219","resolution":{"observed_at":"2026-08-12T12:18:02.480654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-12T12:10:27.167230Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17440","last_updated":"2025-03-25T23:08:48Z","snapshot_observed_at":"2026-08-15T17:17:11.643992Z","submitted_at":"2024-11-26T13:58:24Z","title":"Identity-Preserving Text-to-Video Generation by Frequency Decomposition","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T12:10:27.167230Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2411.17440"},"observation_digest":"sha256:6d688a58fbee96b0f43fadad12cf3e620b4bb6194275dc48d7b7f460a3994f82","observation_id":"5a8391a1-cc4b-442d-8d99-b9af9bfdf7a0","resolution":{"observed_at":"2026-08-12T12:10:27.167230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-12T12:11:26.703089Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17459","last_updated":"2025-04-11T12:31:07Z","snapshot_observed_at":"2026-08-17T00:15:38.851915Z","submitted_at":"2024-11-26T14:23:53Z","title":"WF-VAE: Enhancing Video VAE by Wavelet-Driven Energy Flow for Latent Video Diffusion Model","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T12:11:26.703089Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2411.17459"},"observation_digest":"sha256:f19575b3185e0b667b9bb87de47c620998ad09fbf5725cda40f15dbe48497099","observation_id":"ca0b4a33-3d29-4932-be9b-30eabaa338bb","resolution":{"observed_at":"2026-08-12T12:11:26.703089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-12T12:58:57.085344Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17470","last_updated":"2024-12-31T16:25:39Z","snapshot_observed_at":"2026-08-17T00:52:46.082386Z","submitted_at":"2024-11-25T18:59:04Z","title":"Towards Precise Scaling Laws for Video Diffusion Transformers","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T12:58:57.085344Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2411.17470"},"observation_digest":"sha256:8fcb1a59868c12d576e390fb30870d90fafac687fe04d4188a9a70f47da90c2d","observation_id":"523ba06a-a3aa-4b23-ab8f-f07675bb14a4","resolution":{"observed_at":"2026-08-12T12:58:57.085344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-12T11:56:28.113601Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17697","last_updated":"2024-11-27T07:39:20Z","snapshot_observed_at":"2026-08-15T07:21:59.072249Z","submitted_at":"2024-11-26T18:59:22Z","title":"StableAnimator: High-Quality Identity-Preserving Human Image Animation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T11:56:28.113601Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2411.17697"},"observation_digest":"sha256:31774045e210866361b74c5abeee8a9900e3ca1e94792e9ce6df3199ad4184a9","observation_id":"8314ebe8-b45e-4a36-8c70-8b77bac7a363","resolution":{"observed_at":"2026-08-12T11:56:28.113601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-12T12:36:49.118636Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17765","last_updated":"2025-07-30T10:27:47Z","snapshot_observed_at":"2026-08-17T00:14:28.635170Z","submitted_at":"2024-11-26T04:21:22Z","title":"I2VControl: Disentangled and Unified Video Motion Synthesis Control","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T12:36:49.118636Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2411.17765"},"observation_digest":"sha256:a12a47fcb78663b788e077b69b380ce4ad7b996b7a653a5aaf0eb24193cbcf37","observation_id":"ae14bb78-e9c3-45e5-945d-5ea7b1fbbe2f","resolution":{"observed_at":"2026-08-12T12:36:49.118636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-12T11:24:09.449935Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18293","last_updated":"2024-12-10T11:13:57Z","snapshot_observed_at":"2026-08-17T22:47:03.630926Z","submitted_at":"2024-11-27T12:30:24Z","title":"HiFiVFS: High Fidelity Video Face Swapping","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T11:24:09.449935Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2411.18293"},"observation_digest":"sha256:c33dea13a2d0ec65fe34ffb78e52dcb3a9f83ef8d155fc2f092df938113f70c0","observation_id":"7cf75921-3476-4144-b84f-643cd6039b9d","resolution":{"observed_at":"2026-08-12T11:24:09.449935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-12T11:20:37.723736Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18375","last_updated":"2025-08-05T13:33:54Z","snapshot_observed_at":"2026-08-17T16:32:23.168821Z","submitted_at":"2024-11-27T14:22:13Z","title":"Individual Content and Motion Dynamics Preserved Pruning for Video Diffusion Models","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T11:20:37.723736Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2411.18375"},"observation_digest":"sha256:9cdde99be69339a79f3a1b96656b5d6f3303ed028082a683b7b3f92618f05a93","observation_id":"b68b3016-ccce-483c-ba5d-265a41f3fa12","resolution":{"observed_at":"2026-08-12T11:20:37.723736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-12T11:05:32.553141Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18613","last_updated":"2024-12-18T21:21:07Z","snapshot_observed_at":"2026-08-17T09:55:47.957559Z","submitted_at":"2024-11-27T18:57:16Z","title":"CAT4D: Create Anything in 4D with Multi-View Video Diffusion Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T11:05:32.553141Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2411.18613"},"observation_digest":"sha256:918b19efd7dd6a09254fcc65132e965b80c2785dcfb63e1834685dbaee3f0fbe","observation_id":"94910b81-f451-43b8-8a45-a62c6d7f4d1e","resolution":{"observed_at":"2026-08-12T11:05:32.553141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-12T11:51:36.457544Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18644","last_updated":"2024-11-26T19:21:57Z","snapshot_observed_at":"2026-08-15T19:41:54.335964Z","submitted_at":"2024-11-26T19:21:57Z","title":"Scene Co-pilot: Procedural Text to Video Generation with Human in the Loop","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T11:51:36.457544Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2411.18644"},"observation_digest":"sha256:721540458d1bbeef60c21eb5c5d40e7815c93cd3c7b40694040f4c53e622e769","observation_id":"429afd48-6d0a-4214-af27-db9bc1c5e853","resolution":{"observed_at":"2026-08-12T11:51:36.457544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-12T11:14:14.980281Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18664","last_updated":"2024-11-27T15:59:48Z","snapshot_observed_at":"2026-08-18T00:50:54.619745Z","submitted_at":"2024-11-27T15:59:48Z","title":"Spatiotemporal Skip Guidance for Enhanced Video Diffusion Sampling","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T11:14:14.980281Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2411.18664"},"observation_digest":"sha256:f7a50c44148b78da5001a96f11e54f51362c214cb316c1126d299e5b58743f4b","observation_id":"dfc86daa-e6cc-4ebf-a9a2-a3bb04d3a2fb","resolution":{"observed_at":"2026-08-12T11:14:14.980281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-12T11:11:52.035699Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18668","last_updated":"2024-11-27T16:13:26Z","snapshot_observed_at":"2026-08-16T21:14:14.600627Z","submitted_at":"2024-11-27T16:13:26Z","title":"Towards Chunk-Wise Generation for Long Videos","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:52.035699Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2411.18668"},"observation_digest":"sha256:5ee9715db089deaa77d08c5efe7a57323558abe42afdb3b691a1abecf987e09e","observation_id":"6deccf3c-9644-4f84-8d6c-7246b6df6751","resolution":{"observed_at":"2026-08-12T11:11:52.035699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-12T11:07:39.401420Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18673","last_updated":"2025-05-06T13:11:14Z","snapshot_observed_at":"2026-08-16T08:18:45.331169Z","submitted_at":"2024-11-27T18:49:13Z","title":"AC3D: Analyzing and Improving 3D Camera Control in Video Diffusion Transformers","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T11:07:39.401420Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2411.18673"},"observation_digest":"sha256:1c72e52dfaef21b7303497d58b26749255d58e65aa15d31ae73ddccd1be03589","observation_id":"0fd80ce2-7101-4b02-863e-a416b4534ddf","resolution":{"observed_at":"2026-08-12T11:07:39.401420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-12T11:05:09.632876Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18677","last_updated":"2024-11-27T18:59:59Z","snapshot_observed_at":"2026-08-18T10:45:54.713212Z","submitted_at":"2024-11-27T18:59:59Z","title":"MatchDiffusion: Training-free Generation of Match-cuts","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T11:05:09.632876Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2411.18677"},"observation_digest":"sha256:92e58773634af2b95902dfb9f7c3f0b4f477389f97518e9a25cf9466c54def50","observation_id":"53844a28-1ea9-40e3-81ab-6fa1467c4ec7","resolution":{"observed_at":"2026-08-12T11:05:09.632876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-12T10:51:56.409783Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18866","last_updated":"2024-11-28T02:19:28Z","snapshot_observed_at":"2026-08-18T09:29:48.471463Z","submitted_at":"2024-11-28T02:19:28Z","title":"RIGI: Rectifying Image-to-3D Generation Inconsistency via Uncertainty-aware Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T10:51:56.409783Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2411.18866"},"observation_digest":"sha256:82a90cb8783606006efac9f320da311413831b1d268c221276cc1e299ec8d64d","observation_id":"f6c191ab-df5c-46c7-8c80-c8ccb6961f80","resolution":{"observed_at":"2026-08-12T10:51:56.409783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-12T10:44:14.674984Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18983","last_updated":"2024-11-28T08:07:32Z","snapshot_observed_at":"2026-08-16T12:05:07.284509Z","submitted_at":"2024-11-28T08:07:32Z","title":"SPAgent: Adaptive Task Decomposition and Model Selection for General Video Generation and Editing","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T10:44:14.674984Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2411.18983"},"observation_digest":"sha256:067847332ea60abb0689f6472a59ffde1744989ecef5a3f2668da60ac1c6146a","observation_id":"eeee9981-fa00-474e-baa8-eb65bfa3d1f9","resolution":{"observed_at":"2026-08-12T10:44:14.674984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-12T10:40:43.371378Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19036","last_updated":"2025-03-25T09:55:45Z","snapshot_observed_at":"2026-08-18T08:59:18.234043Z","submitted_at":"2024-11-28T10:31:59Z","title":"PCDreamer: Point Cloud Completion Through Multi-view Diffusion Priors","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T10:40:43.371378Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2411.19036"},"observation_digest":"sha256:03b54cf48dd0a4c75399033deb6c1b586deb643d698f0ee555070bfa7ffd2d93","observation_id":"efca951a-66a1-401e-a52e-7e9aaa51eb96","resolution":{"observed_at":"2026-08-12T10:40:43.371378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-12T10:35:25.003650Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19108","last_updated":"2025-03-18T04:49:23Z","snapshot_observed_at":"2026-08-18T13:36:07.854734Z","submitted_at":"2024-11-28T12:50:05Z","title":"Timestep Embedding Tells: It's Time to Cache for Video Diffusion Model","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T10:35:25.003650Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2411.19108"},"observation_digest":"sha256:664c188788d64934e7ae78517e44bc09974874c2da2f2fccd8de5559a4c27411","observation_id":"472b89b3-4891-4dc7-a2f1-4eb3cfbd4b75","resolution":{"observed_at":"2026-08-12T10:35:25.003650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-12T10:31:01.634186Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19189","last_updated":"2025-03-17T12:43:52Z","snapshot_observed_at":"2026-08-12T12:43:00.612672Z","submitted_at":"2024-11-28T14:50:14Z","title":"Video Depth without Video Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T10:31:01.634186Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2411.19189"},"observation_digest":"sha256:f39674a32d6f90e9e9188b26071ce95f7a90bc7e2b791309fe7547479fa5948e","observation_id":"75bbbc40-938c-48f2-979b-ed448ffca992","resolution":{"observed_at":"2026-08-12T10:31:01.634186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-12T10:25:21.832731Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19233","last_updated":"2025-03-07T12:37:47Z","snapshot_observed_at":"2026-08-15T19:19:48.577264Z","submitted_at":"2024-11-28T16:01:58Z","title":"Gaussians-to-Life: Text-Driven Animation of 3D Gaussian Splatting Scenes","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T10:25:21.832731Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2411.19233"},"observation_digest":"sha256:ae501c9edc09b95a7d607dbe3c44598eca4aa1be45e21da72b7c24339bf0b1ba","observation_id":"85493b80-5517-42c4-b137-a042533dd9d8","resolution":{"observed_at":"2026-08-12T10:25:21.832731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-12T10:21:23.856183Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.19324","last_updated":"2024-11-28T18:59:51Z","snapshot_observed_at":"2026-08-17T15:25:09.988792Z","submitted_at":"2024-11-28T18:59:51Z","title":"Trajectory Attention for Fine-grained Video Motion Control","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-12T10:21:23.856183Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2411.19324"},"observation_digest":"sha256:17a8945ad689dd7cf18dbe7593cabb6ced836835dc89ed71c3ffe97791374430","observation_id":"a728a35c-4f27-4461-9da4-62b7f0fe18fd","resolution":{"observed_at":"2026-08-12T10:21:23.856183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-12T10:13:40.490628Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19459","last_updated":"2024-11-29T04:09:13Z","snapshot_observed_at":"2026-08-16T16:36:55.743106Z","submitted_at":"2024-11-29T04:09:13Z","title":"Fleximo: Towards Flexible Text-to-Human Motion Video Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T10:13:40.490628Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2411.19459"},"observation_digest":"sha256:34ee853ccd71595d06d6f948e2e64ffbb624a57838c39a2134a01265a433c583","observation_id":"aa37aba5-55c7-4dd9-a31a-5c6e062c5d5e","resolution":{"observed_at":"2026-08-12T10:13:40.490628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-12T10:08:47.608457Z","title":"Stable Video Diffu- sion: Scaling Latent Video Diffusion Models to Large Datasets,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19537","last_updated":"2026-07-31T16:21:46Z","snapshot_observed_at":"2026-08-13T22:56:57.054824Z","submitted_at":"2024-11-29T08:29:25Z","title":"Deepfake Media Generation and Detection in the Generative AI Era: A Survey and Outlook","version":4},"reference_index":131,"source":"pdf_text","source_observed_at":"2026-08-12T10:08:47.608457Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2411.19537"},"observation_digest":"sha256:a75dd81e83c86e0c33e314c730a757e1f45d8c73fe12e930e75293a8828565c8","observation_id":"241544b3-e6b4-4dba-84b2-a965d4e59fcc","resolution":{"observed_at":"2026-08-12T10:08:47.608457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-12T10:09:30.510135Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19548","last_updated":"2024-11-29T08:47:46Z","snapshot_observed_at":"2026-08-15T17:12:37.171263Z","submitted_at":"2024-11-29T08:47:46Z","title":"ReconDreamer: Crafting World Models for Driving Scene Reconstruction via Online Restoration","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T10:09:30.510135Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2411.19548"},"observation_digest":"sha256:0cbabd1cfbb2784f8f348b4044887d8fddc298c53b7cef3a256b54e3b5b9707b","observation_id":"31993a5c-f1f5-46e4-93a8-28e6fdeacb1f","resolution":{"observed_at":"2026-08-12T10:09:30.510135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-12T06:03:03.692589Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19654","last_updated":"2025-03-23T17:27:04Z","snapshot_observed_at":"2026-08-17T00:32:09.467201Z","submitted_at":"2024-11-29T12:19:39Z","title":"TexGaussian: Generating High-quality PBR Material via Octree-based 3D Gaussian Splatting","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T06:03:03.692589Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2411.19654"},"observation_digest":"sha256:4fe2d9b4ae1f76ddaa9dc2d6d65d7e11636f77f6e567acd590408cf84087a19c","observation_id":"c5458a79-4f71-42ff-b7b8-286731055181","resolution":{"observed_at":"2026-08-12T06:03:03.692589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-12T10:44:52.396362Z","title":"Stable video diffusion: Scaling la- tent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00115","last_updated":"2025-01-04T06:16:56Z","snapshot_observed_at":"2026-08-17T01:19:21.155701Z","submitted_at":"2024-11-28T07:01:06Z","title":"OpenHumanVid: A Large-Scale High-Quality Dataset for Enhancing Human-Centric Video Generation","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T10:44:52.396362Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2412.00115"},"observation_digest":"sha256:8d0dd5e49838149f09a4b22d497c180f421902fbaa646b3e83dce9c35dce6aab","observation_id":"da528990-3540-4961-b533-26120a10fcc0","resolution":{"observed_at":"2026-08-12T10:44:52.396362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":"2311.15127","doi":"10.48550/arxiv.2311.15127","metadata_source":"pith","pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","venue":"cs.CV","work_id":"4f68eada-27e3-437a-a2fe-6e4ca524d0d3","year":2023},"citing_paper":{"arxiv_id":"2412.00131","last_updated":"2024-11-28T14:07:45Z","snapshot_observed_at":"2026-08-13T21:19:07.777045Z","submitted_at":"2024-11-28T14:07:45Z","title":"Open-Sora Plan: Open-Source Large Video Generation Model","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-23T08:38:27.946746Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2412.00131"},"observation_digest":"sha256:13bde54d780e02625e260ed9bb9ce6af7209dd84591c28be9541be32216c37d2","observation_id":"a49ec532-a065-4d3f-af8b-b838a26ca687","resolution":{"observed_at":"2026-05-23T08:42:45.258752Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-12T10:15:31.831422Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00148","last_updated":"2024-11-29T01:51:08Z","snapshot_observed_at":"2026-08-16T22:21:07.569867Z","submitted_at":"2024-11-29T01:51:08Z","title":"Motion Modes: What Could Happen Next?","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T10:15:31.831422Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2412.00148"},"observation_digest":"sha256:32b53a81d63d7805f3dc8c9f1fda3fb98808512aca3fc1cfff4b64862197a728","observation_id":"73abef5b-6755-4ee4-859e-20d4f321bf19","resolution":{"observed_at":"2026-08-12T10:15:31.831422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-12T10:10:43.546739Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00157","last_updated":"2024-11-29T08:14:07Z","snapshot_observed_at":"2026-08-15T12:37:02.407628Z","submitted_at":"2024-11-29T08:14:07Z","title":"AerialGo: Walking-through City View Generation from Aerial Perspectives","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T10:10:43.546739Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2412.00157"},"observation_digest":"sha256:86daa0d620599dcaeb58af301e0cc8766ee51c9ad8ae54d7949ba6a14c2d4d9d","observation_id":"5e757bfd-07f5-46ee-961a-5eea5c882c7e","resolution":{"observed_at":"2026-08-12T10:10:43.546739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-12T05:29:09.400491Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00397","last_updated":"2024-11-30T08:42:13Z","snapshot_observed_at":"2026-08-15T17:37:22.100750Z","submitted_at":"2024-11-30T08:42:13Z","title":"DreamDance: Animating Human Images by Enriching 3D Geometry Cues from 2D Poses","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T05:29:09.400491Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2412.00397"},"observation_digest":"sha256:026080c3bc257a924f61083dfc76c328f28bbaaefcee674f3ea0a4aff6cedb40","observation_id":"72dd2002-bf37-4940-a96b-f8428733cf5e","resolution":{"observed_at":"2026-08-12T05:29:09.400491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-12T05:23:20.620799Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.00526","last_updated":"2025-06-22T18:13:18Z","snapshot_observed_at":"2026-08-17T19:10:28.060925Z","submitted_at":"2024-11-30T16:20:58Z","title":"Human Action CLIPs: Detecting AI-generated Human Motion","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T05:23:20.620799Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2412.00526"},"observation_digest":"sha256:a093c1bd4cdc4119706464077dfa572229e32802e243ffa83c8eb14f571bfab3","observation_id":"9f07d460-e61c-4e4d-bdc7-9dcf7f770f24","resolution":{"observed_at":"2026-08-12T05:23:20.620799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-12T04:58:26.922490Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets.arXiv preprint arXiv:2311.15127,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.00887","last_updated":"2024-12-01T16:53:02Z","snapshot_observed_at":"2026-08-17T11:59:32.675898Z","submitted_at":"2024-12-01T16:53:02Z","title":"Playable Game Generation","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-12T04:58:26.922490Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2412.00887"},"observation_digest":"sha256:4356359b9717d89929f0467bfc24cc89b4e85376083dae86d06027ef1cf788eb","observation_id":"18988e7f-9dc5-404f-9084-cce3e638ef9c","resolution":{"observed_at":"2026-08-12T04:58:26.922490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-12T04:44:08.204504Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01106","last_updated":"2024-12-02T04:27:41Z","snapshot_observed_at":"2026-08-18T14:51:24.093507Z","submitted_at":"2024-12-02T04:27:41Z","title":"One Shot, One Talk: Whole-body Talking Avatar from a Single Image","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T04:44:08.204504Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2412.01106"},"observation_digest":"sha256:d3681458ec739afd2c204191f5d7e8d12b81751ebe9e96bf267ffe31dc274140","observation_id":"6e2bab96-5313-4cb4-83c8-32003370b88c","resolution":{"observed_at":"2026-08-12T04:44:08.204504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-12T04:27:23.825112Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01429","last_updated":"2024-12-02T12:10:00Z","snapshot_observed_at":"2026-08-15T11:14:44.922577Z","submitted_at":"2024-12-02T12:10:00Z","title":"CPA: Camera-pose-awareness Diffusion Transformer for Video Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T04:27:23.825112Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2412.01429"},"observation_digest":"sha256:e1c2b3fddeb90fb7f72e14399623d7056f22a8ab2569bee0c8b939af5ed3e1be","observation_id":"3db66a20-5065-4c40-85ea-92dddfad7f83","resolution":{"observed_at":"2026-08-12T04:27:23.825112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-12T00:59:22.321343Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01821","last_updated":"2024-12-02T18:58:23Z","snapshot_observed_at":"2026-08-14T17:37:06.716611Z","submitted_at":"2024-12-02T18:58:23Z","title":"World-consistent Video Diffusion with Explicit 3D Modeling","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T00:59:22.321343Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2412.01821"},"observation_digest":"sha256:3d5f9db6db50a11938da8d16c0b1c06d7c7f51032f05d9fc1bb709cb374082ec","observation_id":"ec2399cf-bf68-446c-bea6-32c26bcd16e6","resolution":{"observed_at":"2026-08-12T00:59:22.321343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-12T00:04:08.675581Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01987","last_updated":"2025-03-24T19:50:08Z","snapshot_observed_at":"2026-08-14T02:39:08.853226Z","submitted_at":"2024-12-02T21:40:17Z","title":"ShowHowTo: Generating Scene-Conditioned Step-by-Step Visual Instructions","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T00:04:08.675581Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2412.01987"},"observation_digest":"sha256:2a343c50c38b903b2c5b7c722b252bfe306ab81fa1255995e4569c1fff241ea6","observation_id":"746ffd17-70f9-4af0-a183-6a1a1a6b9442","resolution":{"observed_at":"2026-08-12T00:04:08.675581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-11T23:50:28.574952Z","title":"Stable video diffusion: Scaling la- tent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.02168","last_updated":"2025-03-25T03:31:50Z","snapshot_observed_at":"2026-08-14T09:08:44.881632Z","submitted_at":"2024-12-03T04:55:02Z","title":"Generative Photography: Scene-Consistent Camera Control for Realistic Text-to-Image Synthesis","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:28.574952Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2412.02168"},"observation_digest":"sha256:7f799735f217fc8879e28070e01d2d7dde1a2e9d3bbc9507c00c8d80adf8f60f","observation_id":"3a8530e8-25b9-45cc-b074-db5796b2cc5b","resolution":{"observed_at":"2026-08-11T23:50:28.574952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-11T23:41:26.891437Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.02359","last_updated":"2024-12-03T10:32:41Z","snapshot_observed_at":"2026-08-18T09:37:26.490995Z","submitted_at":"2024-12-03T10:32:41Z","title":"Realistic Surgical Simulation from Monocular Videos","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T23:41:26.891437Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2412.02359"},"observation_digest":"sha256:027a5e31f09cdbde2f0b20b4218065179759d431ea66e9b1f70de3d083c060b5","observation_id":"c9f6f8e6-0976-42f8-8cb1-b705222ce6ad","resolution":{"observed_at":"2026-08-11T23:41:26.891437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-11T23:15:09.508424Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.02700","last_updated":"2025-03-27T21:38:09Z","snapshot_observed_at":"2026-08-17T17:55:41.151533Z","submitted_at":"2024-12-03T18:59:56Z","title":"Motion Prompting: Controlling Video Generation with Motion Trajectories","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T23:15:09.508424Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2412.02700"},"observation_digest":"sha256:2023e3b57f5912a9e4f67b0ccfd03db324615ea3f4000b5b16f7830fab2ed280","observation_id":"b3b54629-ec09-4ccd-b41d-4437a51e7b80","resolution":{"observed_at":"2026-08-11T23:15:09.508424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-11T22:51:11.634791Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03085","last_updated":"2024-12-04T07:26:44Z","snapshot_observed_at":"2026-08-16T03:54:00.453682Z","submitted_at":"2024-12-04T07:26:44Z","title":"Mimir: Improving Video Diffusion Models for Precise Text Understanding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T22:51:11.634791Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2412.03085"},"observation_digest":"sha256:1136ec43df63b6358fb9ce54d3e618a615d59a64b91e842854f09cbd9dc3d766","observation_id":"dc2703c4-4df9-446b-ae3f-c6d6f1b7fdb4","resolution":{"observed_at":"2026-08-11T22:51:11.634791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-11T22:22:03.731286Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03517","last_updated":"2024-12-06T13:56:50Z","snapshot_observed_at":"2026-08-15T09:07:26.144979Z","submitted_at":"2024-12-04T17:58:03Z","title":"NVComposer: Boosting Generative Novel View Synthesis with Multiple Sparse and Unposed Images","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T22:22:03.731286Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2412.03517"},"observation_digest":"sha256:5fe3df851dd119780405619eee858c2dec288bb7ed5bc41ca1f6c95e67a75402","observation_id":"27e71c43-362d-4814-bd33-65e155686682","resolution":{"observed_at":"2026-08-11T22:22:03.731286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-11T22:23:15.397135Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03552","last_updated":"2024-12-04T18:50:08Z","snapshot_observed_at":"2026-08-17T12:42:29.889109Z","submitted_at":"2024-12-04T18:50:08Z","title":"Imagine360: Immersive 360 Video Generation from Perspective Anchor","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T22:23:15.397135Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2412.03552"},"observation_digest":"sha256:a29e21bfa12e5a27a55e3d7ddf9cbac06ceba2824c5288b3f3d5bd1d61dc0298","observation_id":"95dae0a5-a140-429e-bae2-3f7a17ec6b12","resolution":{"observed_at":"2026-08-11T22:23:15.397135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-11T22:19:24.477120Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03558","last_updated":"2025-07-17T08:26:21Z","snapshot_observed_at":"2026-08-17T23:47:37.185555Z","submitted_at":"2024-12-04T18:52:40Z","title":"MIDI: Multi-Instance Diffusion for Single Image to 3D Scene Generation","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:24.477120Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2412.03558"},"observation_digest":"sha256:74a2341e9e2a8f4f56e376dba442376c3cd3317b2d11f5fa3d8e0ef154bddb46","observation_id":"6e2bcb3f-4e3d-4f15-9319-b75e40814483","resolution":{"observed_at":"2026-08-11T22:19:24.477120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-11T22:19:31.010412Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03566","last_updated":"2024-12-04T18:58:21Z","snapshot_observed_at":"2026-08-14T19:27:30.756118Z","submitted_at":"2024-12-04T18:58:21Z","title":"FreeSim: Toward Free-viewpoint Camera Simulation in Driving Scenes","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:31.010412Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2412.03566"},"observation_digest":"sha256:2beb1e56089f8837740f7c977577a3c5df7e1566211768779c3bd24b1055aa57","observation_id":"ff12859c-97dc-4101-a8e3-0cfabb908a13","resolution":{"observed_at":"2026-08-11T22:19:31.010412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-11T22:18:09.705748Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03572","last_updated":"2025-04-11T19:20:22Z","snapshot_observed_at":"2026-08-16T19:44:01.189794Z","submitted_at":"2024-12-04T18:59:45Z","title":"Navigation World Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T22:18:09.705748Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2412.03572"},"observation_digest":"sha256:5b935f9e97b2abe81b21c3e9e7ecae5769ef47d5616e0dbbb74c18235712ffd0","observation_id":"fb0bca9b-a2ce-438d-81e7-e323d6e6721d","resolution":{"observed_at":"2026-08-11T22:18:09.705748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-11T22:20:31.418758Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03632","last_updated":"2024-12-04T18:48:20Z","snapshot_observed_at":"2026-08-17T17:36:02.898640Z","submitted_at":"2024-12-04T18:48:20Z","title":"MV-Adapter: Multi-view Consistent Image Generation Made Easy","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-11T22:20:31.418758Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2412.03632"},"observation_digest":"sha256:1e123287e7f672f7a25269d80b6847b46175130dcc0b62f4f3be4015f54ca0e9","observation_id":"19aa098a-4fb0-4a97-a98b-6034561afd07","resolution":{"observed_at":"2026-08-11T22:20:31.418758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-11T21:58:38.068259Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03934","last_updated":"2025-06-26T03:10:09Z","snapshot_observed_at":"2026-08-15T00:39:35.339714Z","submitted_at":"2024-12-05T07:32:20Z","title":"InfiniCube: Unbounded and Controllable Dynamic 3D Driving Scene Generation with World-Guided Video Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T21:58:38.068259Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2412.03934"},"observation_digest":"sha256:347751f7a9176cbb0a7ed75ff4bc3e18bb24cca7e98845ff9a7a98955767d13b","observation_id":"ac079213-b637-407f-941f-fa609d26185e","resolution":{"observed_at":"2026-08-11T21:58:38.068259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-11T21:30:08.188344Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-14T13:59:34.648701Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.188344Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:7f1ee149ad76b4831fb36d9f8a5daba719bb62a91e9f69bdb8cea4563970e112","observation_id":"1141abc7-39f4-4ee4-8990-e6794b58c03d","resolution":{"observed_at":"2026-08-11T21:30:08.188344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-11T21:28:20.845667Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04440","last_updated":"2024-12-05T18:56:05Z","snapshot_observed_at":"2026-08-13T08:37:38.494788Z","submitted_at":"2024-12-05T18:56:05Z","title":"GenMAC: Compositional Text-to-Video Generation with Multi-Agent Collaboration","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:20.845667Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2412.04440"},"observation_digest":"sha256:e8658e4e33854eb5da24c735c2fb5ec186afb8bb2e8a991f3469694da14d1946","observation_id":"00949303-f71d-41d2-ab55-2af4b7c42bd2","resolution":{"observed_at":"2026-08-11T21:28:20.845667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-11T21:28:25.477711Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04448","last_updated":"2024-12-05T18:57:26Z","snapshot_observed_at":"2026-08-17T10:09:04.714513Z","submitted_at":"2024-12-05T18:57:26Z","title":"MEMO: Memory-Guided Diffusion for Expressive Talking Video Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:25.477711Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2412.04448"},"observation_digest":"sha256:03104adb1afe7694710594e02c76e39464aadf96ea7b6a908566955a0781e2a1","observation_id":"8ad0522d-d14d-4c64-bc72-0403f2d0a388","resolution":{"observed_at":"2026-08-11T21:28:25.477711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-11T21:30:03.607910Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04452","last_updated":"2025-06-11T18:15:59Z","snapshot_observed_at":"2026-08-16T13:44:22.320376Z","submitted_at":"2024-12-05T18:58:17Z","title":"Factorized Video Autoencoders for Efficient Generative Modelling","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:03.607910Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2412.04452"},"observation_digest":"sha256:6cc180c1848e3ca765a62c77b6d3bac9b85734b4663b7aee97ad3b63fdaf68ac","observation_id":"c7633e65-5254-4364-85a8-a7e2253132b1","resolution":{"observed_at":"2026-08-11T21:30:03.607910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-11T20:55:01.863979Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.05263","last_updated":"2025-03-08T01:36:55Z","snapshot_observed_at":"2026-08-16T05:49:54.758834Z","submitted_at":"2024-12-06T18:52:20Z","title":"Mind the Time: Temporally-Controlled Multi-Event Video Generation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T20:55:01.863979Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2412.05263"},"observation_digest":"sha256:0e98060c6a57f8f4192aeebc0d49276c58fd7791509112d8963c43af238bfece","observation_id":"fbe116fe-4c3f-4a21-82bf-136f5980f7a8","resolution":{"observed_at":"2026-08-11T20:55:01.863979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-11T20:20:36.436348Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.05848","last_updated":"2024-12-08T08:12:37Z","snapshot_observed_at":"2026-08-18T01:52:10.329183Z","submitted_at":"2024-12-08T08:12:37Z","title":"MotionStone: Decoupled Motion Intensity Modulation with Diffusion Transformer for Image-to-Video Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T20:20:36.436348Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2412.05848"},"observation_digest":"sha256:f520c999d5c6dce169e58cfb46f3a1e7eb8e1fd57b5a5fe677fc4a7344a564b7","observation_id":"a334d119-9f6d-4022-9229-0a8b19a8ca4f","resolution":{"observed_at":"2026-08-11T20:20:36.436348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2311.15127/citation-record","integrity":"/paper/2311.15127/integrity","json":"/paper/2311.15127/citation-record.json","paper":"/paper/2311.15127"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2304.08477","last_updated":"2023-04-18T03:27:52Z","snapshot_observed_at":"2026-08-16T15:39:48.920549Z","submitted_at":"2023-04-17T17:57:06Z","title":"Latent-Shift: Latent Diffusion with Temporal Shift for Efficient Text-to-Video Generation","version":2},"cited_work":{"arxiv_id":"2304.08477","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2304.08477","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Latent- shift: Latent diffusion with temporal shift for efficient text-to-video generation","venue":null,"work_id":"bedd3bfc-5b36-4f28-80c6-ccc058c0b411","year":2023},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"cited_paper":"/paper/2304.08477","citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:b12deeaee9073fa6ef3f85bd14a49f2cefa8f3bb7e68812dfaa727d5d1cd680f","observation_id":"5da6655c-ed78-40ef-bafd-3a4f839b1168","resolution":{"observed_at":"2026-05-10T22:58:52.156087Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Renderdiffusion: Image diffusion for 3d reconstruction, in- painting and generation","venue":null,"work_id":"a714454d-cb1e-4784-b885-eb0e4439b8ee","year":2023},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:4543fced0a9e9b41507cc484baebd63f84cfabffe73e5fb5d893076fa7d6fd3d","observation_id":"144bcf58-117e-4840-8e26-ea1f0d350bab","resolution":{"observed_at":"2026-05-10T22:58:52.351279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A general language assistant as a laboratory for alignment","venue":null,"work_id":"810fae76-3f07-4c2d-9250-900f7ea33bf9","year":2021},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:b3b88676e7a63e243d7f38a1cf0c53dc7c284356ddb118a2f4dc02f7c7ab67eb","observation_id":"1369ee33-e07b-4808-a922-19ef6454c28c","resolution":{"observed_at":"2026-05-10T22:58:52.354002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Campbell, and Sergey Levine","venue":null,"work_id":"15c72efc-3acc-4890-828a-80791b11569f","year":2018},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:33f483408993da00f4d983727bb509ae651b9b427c40167e22e98c9910ed93fb","observation_id":"93cc8df8-95fc-4c9f-be29-a1da5d5b8662","resolution":{"observed_at":"2026-05-10T22:58:52.356405Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Character region awareness for text de- tection","venue":null,"work_id":"a2d228e7-70fa-4046-b3a4-5805c6f5feea","year":null},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:ba0e453f33d187ae1d5345709c7c28e8066445a3811f6571f33795be2dd7dff1","observation_id":"933ef10c-4406-4898-814a-9df65483ee6b","resolution":{"observed_at":"2026-05-10T22:58:52.360851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Training a helpful and harm- less assistant with reinforcement learning from human feed- back","venue":null,"work_id":"cb7ffc19-6c12-4050-8ed7-06d525703da2","year":2022},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:586cde3877594747e3ff6921d0fc6747c145a76d5a22092263db4fa369f59bb6","observation_id":"db7d9742-6bab-457f-821b-97f97f659745","resolution":{"observed_at":"2026-05-10T22:58:52.367993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Frozen in time: A joint video and image encoder for end-to-end retrieval","venue":null,"work_id":"0b780ad1-899b-4349-9c3e-29fa9d6d885b","year":2022},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:94109fdfc73ed7c9585d6847d531b979f3ba2ef489dda11e6465e64f15ddb1e2","observation_id":"22aa8867-91ab-44a3-a949-85e04be5d2bb","resolution":{"observed_at":"2026-05-10T22:58:52.372008Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ipoke: Poking a still image for con- trolled stochastic video synthesis","venue":null,"work_id":"e1650dc6-f9e9-4730-86b3-3902db53ea4f","year":2021},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:f8fafc27b290bc06d807b09741dde5d67866a244da8a85f344053a7a825b9b62","observation_id":"50404684-73cb-43f0-aa23-7cf3fbb80143","resolution":{"observed_at":"2026-05-10T22:58:52.374897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08818","last_updated":"2023-12-28T03:31:59Z","snapshot_observed_at":"2026-08-16T15:39:39.840882Z","submitted_at":"2023-04-18T08:30:32Z","title":"Align your Latents: High-Resolution Video Synthesis with Latent Diffusion Models","version":2},"cited_work":{"arxiv_id":"2304.08818","doi":"10.48550/arxiv.2304.08818","metadata_source":"arxiv_reference","pith_arxiv_id":"2304.08818","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Align your latents: High-resolution video synthesis with latent diffusion models, 2023 b","venue":"arXiv (Cornell University)","work_id":"76496561-867d-44bb-9836-fef3004046ca","year":2023},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"cited_paper":"/paper/2304.08818","citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:f391a6c39ff67d0b77d60b6b819d57d165c0704014cb39fa6846aeae312975fb","observation_id":"9911c2c8-7ca3-40c2-a592-bbe9e7d0d173","resolution":{"observed_at":"2026-05-10T22:58:52.140275Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Generating long videos of dynamic scenes","venue":null,"work_id":"0f7c81b2-6089-4646-95e9-765905d269fe","year":2022},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:b3e758f4f4279c2e420284688bded41db19ea93482f0613fe3cbbcbfbc3bca40","observation_id":"560ec6c5-ca90-4822-bdfa-d8858b739e0e","resolution":{"observed_at":"2026-05-10T22:58:52.380162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Quo vadis, action recognition? a new model and the kinetics dataset","venue":null,"work_id":"9e7a9359-3974-402e-a595-b5ab6aea45ff","year":2017},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:a3e21bad3c8c5f143a862bc5129593eddc692e1b312420a39d6798a7e4f44aea","observation_id":"84289ebc-a5e0-4436-98b1-657f7e6aac5a","resolution":{"observed_at":"2026-05-10T22:58:52.383092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Im- proved conditional vrnns for video prediction","venue":null,"work_id":"d7a15f8e-6e9a-4dd1-892d-ab80667f17a8","year":null},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:c44fcdd04c74a39aeb5cb0a046c487c591f7a4515dc43ac901180c3f073d0690","observation_id":"3df0282d-bca6-472d-93e9-a5c7ff611852","resolution":{"observed_at":"2026-05-10T22:58:52.389104Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Emu: Enhancing image generation models using photogenic nee- dles in a haystack","venue":null,"work_id":"a67ed3ba-ceae-4e6e-a69b-01a9f1c7695f","year":2023},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:f2c2f45ba2ca05749a7da48118c3d1b7c8c9ee47495975c421feea92674678c2","observation_id":"3a9c73d5-ff6c-42ac-99ee-0e9da43b4573","resolution":{"observed_at":"2026-05-10T22:58:52.395124Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.05663","last_updated":"2023-07-11T17:57:40Z","snapshot_observed_at":"2026-08-17T00:31:15.553571Z","submitted_at":"2023-07-11T17:57:40Z","title":"Objaverse-XL: A Universe of 10M+ 3D Objects","version":1},"cited_work":{"arxiv_id":"2307.05663","doi":"10.48550/arxiv.2307.05663","metadata_source":"pith","pith_arxiv_id":"2307.05663","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Objaverse-XL: A Universe of 10M+ 3D Objects","venue":"cs.CV","work_id":"1c5475ad-d1ec-4de1-8670-b8cd5a4c85d3","year":2023},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"cited_paper":"/paper/2307.05663","citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:7e506bc1e1424ba50572bff2d67fec32b3e9b5827c95072b4ee4ce4d693df7b1","observation_id":"d0f5b2f2-63ce-40e6-943e-a29cb2343dad","resolution":{"observed_at":"2026-05-17T13:02:11.861391Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Objaverse: A universe of annotated 3d objects","venue":null,"work_id":"7b0e3b67-5d51-47e2-878a-342823c92f0c","year":2023},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:3478b42c286dc3c54a17f723825a0fd97b417ebce886f9468f5f05176d1b1d85","observation_id":"bd7479d9-f02e-4934-9fdd-5e7b8e090b5d","resolution":{"observed_at":"2026-05-10T22:58:52.398112Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Nerdi: Single-view nerf synthesis with language-guided diffusion as general image priors","venue":null,"work_id":"f1958f32-3ed1-4792-905c-afdb72466607","year":2023},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:493c0f4e48acd46e7bcd948f062dcf284b8228a0a375cd0f283c3a3f5cf39af4","observation_id":"5a104dc8-f20a-4b87-be90-f5352dab01a2","resolution":{"observed_at":"2026-05-10T22:58:52.401071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Stochastic video genera- tion with a learned prior","venue":null,"work_id":"e83b6202-4c8e-476d-925e-11dddddf2a95","year":2018},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:12be6ccdacba3f6652fa323c796a0a986d0e3b6370d760c0e4ab328763403f11","observation_id":"320fb33a-6144-4d89-9f0b-560514fdc576","resolution":{"observed_at":"2026-05-10T22:58:52.404300Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.05233","last_updated":"2021-06-01T17:49:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-05-11T17:50:24Z","title":"Diffusion Models Beat GANs on Image Synthesis","version":4},"cited_work":{"arxiv_id":"2105.05233","doi":"10.48550/arxiv.2105.05233","metadata_source":"pith","pith_arxiv_id":"2105.05233","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Diffusion Models Beat GANs on Image Synthesis","venue":"cs.LG","work_id":"2eb944bb-93ba-462c-8111-4e8c915dd873","year":2021},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"cited_paper":"/paper/2105.05233","citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:87bd6d311f63539849df4114de201497c9dce6f90a37a66c4f74f320c81c5eb6","observation_id":"6b2076e6-a43b-4069-99c3-f9aa92e5dbba","resolution":{"observed_at":"2026-05-13T11:16:28.664120Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-05-24T01:23:30.424112+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T01:23:30.424112+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Derpanis, and Bj¨orn Om- mer","venue":null,"work_id":"af0932ef-152b-4137-97ac-ac786e46ad7d","year":2021},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:4493cc9f4b520c31d310b5a1e0a4fb46868f91f0c19ad0bb9b909229e0123084","observation_id":"020a0ee9-fbcb-44c6-af09-1542b02f5622","resolution":{"observed_at":"2026-05-10T22:58:52.406918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Google scanned objects: A high-quality dataset of 3d scanned household items","venue":null,"work_id":"1a9ed824-8764-48e7-b8f0-8bbc71718005","year":2022},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:8b71a293fe68db70fc9d104da81520499a5fe4fe27f64a8bdf6e0545ee460bbe","observation_id":"3f825f0d-913a-4c73-8220-2720c572daeb","resolution":{"observed_at":"2026-05-10T22:58:52.410446Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"6c47aff0-dc26-417d-ba19-268067ba588b","year":1978},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:7b3a43a6ba84363a0ac904ce4d8f3851c1a23e1452ce33633da9c571f6d1c974","observation_id":"8f93d1e6-83f0-4f7e-943b-9d7a023e0fdd","resolution":{"observed_at":"2026-05-10T22:58:52.413748Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.09841","last_updated":"2021-06-23T16:07:21Z","snapshot_observed_at":"2026-08-16T18:57:41.827625Z","submitted_at":"2020-12-17T18:57:28Z","title":"Taming Transformers for High-Resolution Image Synthesis","version":3},"cited_work":{"arxiv_id":"2012.09841","doi":"10.48550/arxiv.2012.09841","metadata_source":"arxiv_reference","pith_arxiv_id":"2012.09841","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Esser, R","venue":null,"work_id":"b467cc9a-4a7a-4b7e-a4e5-d966dc3be597","year":2012},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"cited_paper":"/paper/2012.09841","citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:a2780ba0599d1f4c039dc56ab3c89bda4e376d546296e6f826534941ee4e861c","observation_id":"d992ae0f-c056-43e8-8e4b-a13887ea7fe6","resolution":{"observed_at":"2026-05-10T22:58:52.084829Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Structure and content-guided video synthesis with diffusion models","venue":null,"work_id":"322ba24a-2ff8-47c8-922f-78b1d4e527a7","year":null},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:44a48eba809e1b896b3f25e572a326eb634c9ac3f3b5d594628f5d4d98a0240f","observation_id":"9f6ebd11-36e7-4089-9f9e-849e4be37272","resolution":{"observed_at":"2026-05-10T22:58:52.417956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Two-frame motion estimation based on polynomial expansion","venue":null,"work_id":"fefbe3ba-a03b-4eb4-881a-fd7f552af0a9","year":2003},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:f1c2f090be53098287706e29c05df1a907b186028d7e8a243f9af3e490b80fe8","observation_id":"47afb22e-77d8-4081-a419-162fe74e5bef","resolution":{"observed_at":"2026-05-10T22:58:52.423853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Stylevideogan: A temporal generative model using a pretrained stylegan","venue":null,"work_id":"08949b9f-af04-46a3-ad48-fe97b885923c","year":2021},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:9be8a2ebd7829dcffc998e8ae96a05bfeea52681fac9a4c24ac8df283c2e0618","observation_id":"5c183e3c-648f-488b-8aff-7287d2f187b1","resolution":{"observed_at":"2026-05-10T22:58:52.430349Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Stochastic latent residual video prediction","venue":null,"work_id":"2abd63b9-e065-4b88-8d3a-ed2abbaa13c5","year":2020},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:0194b7c66e949c2f0a16cb19c17cb099687bb91f7003ed7ad5d064a1d4e983ff","observation_id":"d13f1608-b9be-4757-a8c6-c7bb497ae565","resolution":{"observed_at":"2026-05-10T22:58:52.433370Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00027","last_updated":"2020-12-31T19:00:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-12-31T19:00:10Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling","version":1},"cited_work":{"arxiv_id":"2101.00027","doi":"10.1117/1.jmi.10.6.061104","metadata_source":"pith","pith_arxiv_id":"2101.00027","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling","venue":"cs.CL","work_id":"9b10667a-da61-4358-aceb-10578234d45d","year":2020},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"cited_paper":"/paper/2101.00027","citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:3255949b45cac4f2f1abd3f36ae48f9307a678f44b2e43de58ae3e61e6a5c28e","observation_id":"fcf8153a-93af-4fa2-927b-05d260211088","resolution":{"observed_at":"2026-05-10T22:58:52.107162Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Long video generation with time-agnostic vqgan and time- sensitive transformer","venue":null,"work_id":"6de3a64b-b8ea-444f-9442-8065f22ada64","year":2022},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:d562fb478eaf8410a4cf06eebe954eaa2e0ee2c1eef77a8a6227453f3b5f877a","observation_id":"690678e9-dadd-49a1-b826-a3233091cbef","resolution":{"observed_at":"2026-05-10T22:58:52.440342Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Preserve your own cor- relation: A noise prior for video diffusion models","venue":null,"work_id":"2c871b9c-fc12-4672-9002-0df024e2ae10","year":2023},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:29a3d92537c553d1931a466829208102e7906b9234188ee15b0573fa33c80049","observation_id":"9a39a536-4f21-4df2-ab0a-6b7b301a3307","resolution":{"observed_at":"2026-05-10T22:58:52.443748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Generative adversarial nets","venue":null,"work_id":"a9a6c32d-820c-46f7-bfe3-284681f9adac","year":2014},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:dcd522ac9c1c29e8aba5cfd4ccd0aa37ab6e12e2072977b4d4d7a7546bc9a92d","observation_id":"243d2d62-1813-4d4d-a44c-b8a5abda79b6","resolution":{"observed_at":"2026-05-10T22:58:52.446463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.03549","last_updated":"2023-09-07T08:12:58Z","snapshot_observed_at":"2026-08-16T15:02:36.646129Z","submitted_at":"2023-09-07T08:12:58Z","title":"Reuse and Diffuse: Iterative Denoising for Text-to-Video Generation","version":1},"cited_work":{"arxiv_id":"2309.03549","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.03549","snapshot_observed_at":"2026-07-08T10:54:49.290119Z","title":"Reuse and diffuse: Iterative denoising for text-to-video generation","venue":"cs.CV","work_id":"95d14a9f-6bb3-4a2a-b557-0c8994b4b509","year":2023},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"cited_paper":"/paper/2309.03549","citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:176fc1e49cb4e8227689a534a3138c7dbd994ce66ee8707fea70f1d3d4835b6e","observation_id":"a5b19aa2-1efc-46ca-bfcf-feb54b55f7e5","resolution":{"observed_at":"2026-05-10T22:58:52.031672Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04725","last_updated":"2024-02-08T18:08:57Z","snapshot_observed_at":"2026-08-17T14:04:31.230742Z","submitted_at":"2023-07-10T17:34:16Z","title":"AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning","version":2},"cited_work":{"arxiv_id":"2307.04725","doi":"10.48550/arxiv.2307.04725","metadata_source":"pith","pith_arxiv_id":"2307.04725","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning","venue":"cs.CV","work_id":"1f9d1d3b-a6d6-45a9-9f13-51393c03be8a","year":2023},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"cited_paper":"/paper/2307.04725","citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:a5ed64f6220ea1140fa34bd08455c343dfeef3e5b36544bbda55cd52f948b9f8","observation_id":"e1db8544-3368-4414-b1c3-2e9bbd7852bb","resolution":{"observed_at":"2026-05-10T22:58:52.081067Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rv-gan: Recurrent gan for unconditional video generation","venue":null,"work_id":"93258464-2825-43f7-a524-d4339f2ad5ea","year":2024},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:1f2493a73d9ef8d2f10c159ee5df8aab55b5fa916d53459af8de153994aeb7fd","observation_id":"2d998d1c-bee5-4b8c-af61-db9795cfdeb9","resolution":{"observed_at":"2026-05-10T22:58:52.449183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Diffusion with offset noise","venue":null,"work_id":"9798da22-22cb-4599-82ee-6592ce3ab91d","year":2023},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:6a2327a8133cb23f0073cf68b447325892553470088004755b0d101baee57541","observation_id":"91f40faa-f813-4d60-a401-8a1b820a41b4","resolution":{"observed_at":"2026-05-10T22:58:52.453606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Latent video diffusion models for high- fidelity long video generation","venue":null,"work_id":"e39a2292-c1ee-4273-883e-87bcb432dcf5","year":2023},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:5fed77cee1fb975473346336e7d1990b21e8b99b6ccf5a28cfb2b08ed539d36e","observation_id":"7a87548d-6f96-4e28-a5cd-86b861b1dd53","resolution":{"observed_at":"2026-05-10T22:58:52.456584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Classifier-free diffusion guidance","venue":null,"work_id":"bd6fc1af-2a0f-466d-8514-f0e5e02b7a30","year":2021},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:9ce3d777ecf186f9c2d5d6016fb368bee743fc3a96dc96b255dc22d644ef5820","observation_id":"47f51d8f-25a7-488a-ad22-bbb4152a5a59","resolution":{"observed_at":"2026-05-10T22:58:52.459221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-08-14T06:37:15.299690Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":"2207.12598","doi":"10.1109/cvpr52733.2024.02494","metadata_source":"pith","pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Classifier-Free Diffusion Guidance","venue":"cs.LG","work_id":"acf2c588-c088-4a6c-938e-150ad7c666d7","year":2022},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:991c5870b65efff9a73312464dfb7f264e4e13993692f2837edd401db9b3eadd","observation_id":"2552e170-3aef-480c-b3d9-88cc076c19d3","resolution":{"observed_at":"2026-05-10T22:58:51.924296Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Denoising dif- fusion probabilistic models","venue":null,"work_id":"fa446095-fefa-4286-82a8-9c65913c98f8","year":2020},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:6fc25652d3fc1ef10b46c20483bd15da448904f3c88994da7445fe91082e8789","observation_id":"93c36309-9772-43af-a905-4895897a2b09","resolution":{"observed_at":"2026-05-10T22:58:52.461828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.15282","last_updated":"2021-12-17T17:21:04Z","snapshot_observed_at":"2026-08-16T19:20:27.997234Z","submitted_at":"2021-05-30T17:14:52Z","title":"Cascaded Diffusion Models for High Fidelity Image Generation","version":3},"cited_work":{"arxiv_id":"2106.15282","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2106.15282","snapshot_observed_at":"2026-06-30T13:14:41.217333Z","title":"Cascaded diffusion models for high fidelity image generation","venue":null,"work_id":"683a54c3-7d5f-454f-854b-a4aeca9df7d7","year":2021},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"cited_paper":"/paper/2106.15282","citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:b7cfa87f7fa2d14ee4c2c2887e93177e07b73eca3ee03657849923158f43d181","observation_id":"063774ac-f08c-4560-bad1-c08ba661c7d8","resolution":{"observed_at":"2026-05-10T22:58:51.972482Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02303","last_updated":"2022-10-05T14:41:38Z","snapshot_observed_at":"2026-08-18T00:41:06.039123Z","submitted_at":"2022-10-05T14:41:38Z","title":"Imagen Video: High Definition Video Generation with Diffusion Models","version":1},"cited_work":{"arxiv_id":"2210.02303","doi":"10.48550/arxiv.2210.02303","metadata_source":"pith","pith_arxiv_id":"2210.02303","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Imagen Video: High Definition Video Generation with Diffusion Models","venue":"cs.CV","work_id":"bb20d241-dc6f-4b0a-b071-fd43a2cbd57f","year":2022},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"cited_paper":"/paper/2210.02303","citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:8b098ec6020e6b3362e5b9b0769415919d1d8ac5cc45019d29cd17e62d0f1c96","observation_id":"bac83294-60f9-4168-9ed8-008d896ab7b0","resolution":{"observed_at":"2026-05-11T03:31:08.340948Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:49:59.676131+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:49:59.676131+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.03458","last_updated":"2022-06-22T20:22:29Z","snapshot_observed_at":"2026-08-17T13:08:14.312126Z","submitted_at":"2022-04-07T14:08:02Z","title":"Video Diffusion Models","version":2},"cited_work":{"arxiv_id":"2204.03458","doi":"10.48550/arxiv.2204.03458","metadata_source":"pith","pith_arxiv_id":"2204.03458","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video Diffusion Models","venue":"cs.CV","work_id":"02e03469-549e-4b5a-9bf0-ac6617a89882","year":2022},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"cited_paper":"/paper/2204.03458","citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:c47fb44393d0cf00fecb8279254e4a18db25039118dfcf38e8de61c961ef3dbe","observation_id":"e481fdc1-9476-4793-8abc-787900d4fca1","resolution":{"observed_at":"2026-05-13T14:38:28.190773Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cogvideo: Large-scale pretraining for text-to- video generation via transformers","venue":null,"work_id":"8995bb48-6cd6-486f-88dd-b255ae757b71","year":2022},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:879e81eb36403f2e8121ad4edc7f6994e40d6ddd1ec83a643fa560ca13ea8271","observation_id":"bfa7556b-0994-4e58-9826-50e9a7be80cd","resolution":{"observed_at":"2026-05-10T22:58:52.465451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.11093","last_updated":"2023-12-12T14:00:08Z","snapshot_observed_at":"2026-08-17T08:34:07.033481Z","submitted_at":"2023-01-26T13:35:02Z","title":"Simple diffusion: End-to-end diffusion for high resolution images","version":2},"cited_work":{"arxiv_id":"2301.11093","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2301.11093","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"simple diffusion: End-to-end diffusion for high resolution images","venue":null,"work_id":"48d852c5-765d-4517-9771-e8d2c8d52d3c","year":2023},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"cited_paper":"/paper/2301.11093","citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:0e5d8a3bfcda2e01f95504fe47e8b2c11bde209a5c3aa815abfc41a804e2352a","observation_id":"a2d7b100-b1a6-4787-b0c2-88e567d362a9","resolution":{"observed_at":"2026-05-10T22:58:52.051355Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-17T18:04:53.578114Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":"2106.09685","doi":"10.4088/pcc.v03n0609","metadata_source":"pith","pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","venue":"cs.CL","work_id":"0426219a-789e-4964-adc8-a04538510818","year":2021},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:60b096f19b5bffa4eb7e540dc1859e9c97710860624102925539d66d156658ef","observation_id":"80ea7579-f424-4acd-99ee-ffcb0f3bfe4a","resolution":{"observed_at":"2026-05-10T22:58:52.070238Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Estimation of Non- Normalized Statistical Models by Score Matching","venue":null,"work_id":"841efe5d-d32d-46ba-8dcf-de44a7c38074","year":2005},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:1a1154ec1a5b1999052b2ad0790068b7e82c62cb9c4651327d197c8629a35b9b","observation_id":"3086b5be-cc65-4653-892e-e2273ce0e237","resolution":{"observed_at":"2026-05-10T22:58:52.467988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Open- clip","venue":null,"work_id":"86803498-741d-44e7-9628-5a3308efbf53","year":2021},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:fb9a21464c8425bea5744bae4923399cbd6dfe082aa9bec55b52683fc56337ba","observation_id":"ba979575-0310-45df-ba27-f1508672c505","resolution":{"observed_at":"2026-05-10T22:58:52.470262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Open source computer vision library","venue":null,"work_id":"8fae09d3-a1e6-4d3e-a06e-05b5e3c98323","year":2015},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:d90ef0fcfe829bb8ddd930a324a0a3b919817ec4bee05ae421c93a13bd1e6716","observation_id":"f113f498-f494-41e8-8c7a-0e2fb4feba54","resolution":{"observed_at":"2026-05-10T22:58:52.472725Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Shap-e: Generating condi- tional 3d implicit functions","venue":null,"work_id":"517d5c1b-31c8-4fb7-8f26-7529fe8863a1","year":2023},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:27ed28a794887972f2d5b9e144a3fbd409d1e23a697953d0ff632672f6c9f350","observation_id":"850225e8-c922-427e-b7ca-a5de58c892b4","resolution":{"observed_at":"2026-05-10T22:58:52.475372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lower dimensional kernels for video discriminators","venue":null,"work_id":"38e715f6-e8c4-4435-bead-ffff7fe84d75","year":2020},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:3dc821e7c9e255374553f84ac6b22e477c90dc35fd539dfdb5fab0f5a64e521e","observation_id":"a244474e-b377-4cb7-8994-d8f16a92ef16","resolution":{"observed_at":"2026-05-10T22:58:52.478776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.00364","last_updated":"2022-10-11T13:20:30Z","snapshot_observed_at":"2026-07-06T13:16:16.926712Z","submitted_at":"2022-06-01T10:03:24Z","title":"Elucidating the Design Space of Diffusion-Based Generative Models","version":2},"cited_work":{"arxiv_id":"2206.00364","doi":"10.48550/arxiv.2206.00364","metadata_source":"pith","pith_arxiv_id":"2206.00364","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Elucidating the Design Space of Diffusion-Based Generative Models","venue":"cs.CV","work_id":"a80a774d-caed-4e4c-9b69-471be05076e6","year":2022},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"cited_paper":"/paper/2206.00364","citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:df19c72e6cddf2c552775b5756f26bb3d62de2ecb41636b24da1ee895800630b","observation_id":"7a1154aa-5e2d-4727-8b2f-4426575ecb7d","resolution":{"observed_at":"2026-05-14T17:46:53.453910Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-07-12T13:49:30.261846+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T13:49:30.261846+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Text2video-zero: Text- to-image diffusion models are zero-shot video generators","venue":null,"work_id":"e7b13d92-a6f6-479b-bac8-7ded064af384","year":null},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:8b96cbd79d96ad93e44d526ccdb62fc97ca6c268ed85b61c9d82e6ed63c03f9c","observation_id":"f98227f2-8af8-4cce-a16a-8e71eb6f1bc0","resolution":{"observed_at":"2026-05-10T22:58:52.481343Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Variational diffusion models","venue":null,"work_id":"6c42d0fb-c528-4218-bd25-1a17ac72f4d2","year":2021},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:47033b884441f6cdffef376bb8fcf9674ac19188f68185a59298e45158a5feeb","observation_id":"0b4bce9d-a8b5-4b0a-90ad-b1ee75f5da75","resolution":{"observed_at":"2026-05-10T22:58:52.483561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pika labs, https://www.pika.art/","venue":null,"work_id":"40cd2190-1149-420c-bbb7-1751b37740b7","year":null},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:f709fcb21f617aca34a7c7e9d81f579eb5b4c22413c8f026d9c52051b044c2db","observation_id":"afffa12c-1938-460a-9ce6-adc9320f50a0","resolution":{"observed_at":"2026-05-10T22:58:52.485890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1804.01523","last_updated":"2018-04-04T17:55:40Z","snapshot_observed_at":"2026-08-16T16:05:25.921493Z","submitted_at":"2018-04-04T17:55:40Z","title":"Stochastic Adversarial Video Prediction","version":1},"cited_work":{"arxiv_id":"1804.01523","doi":null,"metadata_source":"pith","pith_arxiv_id":"1804.01523","snapshot_observed_at":"2026-06-29T08:43:15.688169Z","title":"Stochastic Adversarial Video Prediction","venue":"cs.CV","work_id":"79566ba2-e12d-4661-895e-bb788b1108e4","year":2018},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"cited_paper":"/paper/1804.01523","citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:5169e79d635412a196ae3cae6bd59acf0d39358aa3e0e417449cad6a674c4b91","observation_id":"3fca2898-f60b-487f-af8d-341ceb1f05fc","resolution":{"observed_at":"2026-05-10T22:58:51.976482Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.08891","last_updated":"2024-01-23T03:08:28Z","snapshot_observed_at":"2026-08-18T03:37:34.976613Z","submitted_at":"2023-05-15T12:21:08Z","title":"Common Diffusion Noise Schedules and Sample Steps are Flawed","version":4},"cited_work":{"arxiv_id":"2305.08891","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.08891","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flow matching for generative modeling","venue":null,"work_id":"abdf465f-a666-4bc8-bcc6-1148df861601","year":2023},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"cited_paper":"/paper/2305.08891","citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:cd6f8a82668e44d8a67ca124d9e24a5ee3e6696cdb4494e21bb7ae740f30b13e","observation_id":"3551b37e-644c-4587-ad56-bb649e380c8e","resolution":{"observed_at":"2026-05-10T22:58:51.982261Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Zero-1-to-3: Zero-shot one image to 3d object","venue":null,"work_id":"2ce38952-6cdc-4d2d-ba6c-920a8ca8acec","year":2023},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:284e4a251482e1be851fbe2cde0c46f5c38ccda42ca7a79564900dcaa0f91ec6","observation_id":"3dc4f274-ad4c-421d-98d0-83360ec06777","resolution":{"observed_at":"2026-05-10T22:58:52.488826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.03453","last_updated":"2024-04-15T10:28:44Z","snapshot_observed_at":"2026-08-12T22:52:54.817720Z","submitted_at":"2023-09-07T02:28:04Z","title":"SyncDreamer: Generating Multiview-consistent Images from a Single-view Image","version":2},"cited_work":{"arxiv_id":"2309.03453","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.03453","snapshot_observed_at":"2026-07-08T01:44:26.219240Z","title":"SyncDreamer: Generating Multiview-consistent Images from a Single-view Image","venue":"cs.CV","work_id":"b0c47120-5c87-4e79-8fe8-1be8e49f855f","year":2023},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"cited_paper":"/paper/2309.03453","citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:21654fb9c3c92ae8fe1c2c5906fa551dbb9764f6be4e675e09530107be8f0528","observation_id":"4f7f2d8c-d0c4-4c54-8d56-1dfd30365503","resolution":{"observed_at":"2026-05-16T10:35:43.296571Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":"1711.05101","doi":"10.1137/1.9781611972825.47","metadata_source":"pith","pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Decoupled Weight Decay Regularization","venue":"cs.LG","work_id":"07ef7360-d385-4033-83f7-8384a6325204","year":2017},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:d554b68d4227027a4c8aed510d2e42b364604dba58e7768de9d54ca4e39519af","observation_id":"0345f43f-3b3e-4fe8-8b28-1b23a2831069","resolution":{"observed_at":"2026-05-10T22:58:52.010731Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Transformation-based adversarial video predic- tion on large-scale data","venue":null,"work_id":"c727b68f-1fc9-4258-93f0-d10bd1c310d5","year":2020},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:b7df7ff91b6ff1a309a7ee10ff2becaa45a65e7371ebb4f0aa3e35bbcb2e5a4c","observation_id":"70223a73-0f29-4875-90ba-cb84849a1dbc","resolution":{"observed_at":"2026-05-10T22:58:52.159200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kingma, Stefano Ermon, Jonathan Ho, and Tim Salimans","venue":null,"work_id":"02614675-8019-4e64-96aa-3d3f0457c119","year":2023},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:85424d83d7a35a5bc4d851d85714690a7a1664b3efcd55e5e243f277d6f50b24","observation_id":"10ba17ca-7d1e-4955-a69d-afc3eb79366b","resolution":{"observed_at":"2026-05-10T22:58:52.162066Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Point-e: A system for generating 3d point clouds from complex prompts","venue":null,"work_id":"e6e87b75-5749-4823-86a2-8f573f72fa91","year":2022},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:d199d797601fb86631b52585c8656e7791de073746e16f1eee629ec96ee06829","observation_id":"786d8902-6c1f-4998-8440-9e7b4ba5be80","resolution":{"observed_at":"2026-05-10T22:58:52.165074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.01116","last_updated":"2023-06-01T20:03:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-01T20:03:56Z","title":"The RefinedWeb Dataset for Falcon LLM: Outperforming Curated Corpora with Web Data, and Web Data Only","version":1},"cited_work":{"arxiv_id":"2306.01116","doi":"10.48550/arxiv.2306.01116","metadata_source":"pith","pith_arxiv_id":"2306.01116","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The RefinedWeb Dataset for Falcon LLM: Outperforming Curated Corpora with Web Data, and Web Data Only","venue":"cs.CL","work_id":"edfb45ee-84c2-4531-b3cd-bd8eb830f4e1","year":2023},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"cited_paper":"/paper/2306.01116","citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:e30dba04832116e163ad39f819275bedb98d316b68ad068a2bd6bebe422e138e","observation_id":"11226907-7541-4eef-8724-e5170230b98f","resolution":{"observed_at":"2026-05-13T20:43:45.999902Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-08-14T22:54:08.184266Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":"2307.01952","doi":"10.48500/arxiv.2307.01952","metadata_source":"pith","pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","venue":"cs.CV","work_id":"8034c587-fba6-4941-87ba-c98f2ac962cb","year":2023},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:1b0d0796b4fd8a94ac109720d4e7178a5f5208c0db177be347cea863705aebfc","observation_id":"f9985714-33e4-4fea-a5d7-d10d465cff3e","resolution":{"observed_at":"2026-05-10T22:58:52.063212Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Training contrastive captioners","venue":null,"work_id":"6d1f5a59-5cff-4087-a9c4-6aa44dbedebc","year":2023},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:714af34a663703a637c554236b5899972937955d18224613cbe21f51ecf1c374","observation_id":"7370bdaa-45ce-411a-8e06-5168591e9001","resolution":{"observed_at":"2026-05-10T22:58:52.167803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00020","last_updated":"2021-02-26T19:04:58Z","snapshot_observed_at":"2026-07-06T10:45:03.059688Z","submitted_at":"2021-02-26T19:04:58Z","title":"Learning Transferable Visual Models From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":"2103.00020","doi":"10.1021/acs.jcim.0c00174","metadata_source":"pith","pith_arxiv_id":"2103.00020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Learning Transferable Visual Models From Natural Language Supervision","venue":"cs.CV","work_id":"6de86bb5-27bd-4d5c-8b89-967ebfc52659","year":2021},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"cited_paper":"/paper/2103.00020","citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:9b387fbc70e300eaafbca7b34d1c425899010fd1ccb242e7e3cf6829ec1e568e","observation_id":"7d7aaa5e-a0d0-480e-9ad9-22ff8f14c19e","resolution":{"observed_at":"2026-05-10T22:58:52.074775Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"0bc409f3-448b-4d02-81a7-f32c5786903e","year":2019},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:44c662a0c1faadf77677cd798ac78f4ca53b865b761a334575b0979781a8eede","observation_id":"fb34dd4b-1bda-4d08-8db5-3bbd2325aea6","resolution":{"observed_at":"2026-05-10T22:58:52.170395Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"How dall·e 2 works","venue":null,"work_id":"2329341e-cfc6-43c8-810a-f716d933ee8d","year":2022},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:db9688b2a8a3c72bf0855e91c7813672d4414039e9c308b2a1e51e83e55a132f","observation_id":"a901f9ff-a6a0-41f0-bdbc-c1991e011740","resolution":{"observed_at":"2026-05-10T22:58:52.175437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-08-15T12:50:58.405488Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":"2204.06125","doi":"10.48550/arxiv.2204.06125","metadata_source":"pith","pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","venue":"cs.CV","work_id":"0c6a768b-70b8-4242-bb0e-459f1008c9fc","year":2022},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:a672c664685fa826cf8629989756a1df73e929b0cf295ffaa26a3e42d407f54d","observation_id":"e428c13a-b90e-41af-9ee7-d6c201de1a31","resolution":{"observed_at":"2026-05-10T22:58:52.092030Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-13T20:38:17.101149+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-13T20:38:17.101149+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10752","last_updated":"2022-04-13T11:38:44Z","snapshot_observed_at":"2026-07-06T12:20:47.369918Z","submitted_at":"2021-12-20T18:55:25Z","title":"High-Resolution Image Synthesis with Latent Diffusion Models","version":2},"cited_work":{"arxiv_id":"2112.10752","doi":"10.48550/arxiv.2112.10752","metadata_source":"pith","pith_arxiv_id":"2112.10752","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"High-Resolution Image Synthesis with Latent Diffusion Models","venue":"cs.CV","work_id":"f0270d36-2952-47fb-84c1-95e3ec341126","year":2021},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"cited_paper":"/paper/2112.10752","citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:be83cb223bcb90f415f21aed34fe3f8d50d39819c521ee70a27d7ea86787c369","observation_id":"2f8e63da-c358-482b-9917-e97dcb5efc17","resolution":{"observed_at":"2026-05-10T22:58:52.096430Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-05-24T01:24:00.877132+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T01:24:00.877132+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1505.04597","last_updated":"2015-05-18T11:28:37Z","snapshot_observed_at":"2026-08-15T21:30:31.645090Z","submitted_at":"2015-05-18T11:28:37Z","title":"U-Net: Convolutional Networks for Biomedical Image Segmentation","version":1},"cited_work":{"arxiv_id":"1505.04597","doi":"10.1007/978-3-662-06400-9_9","metadata_source":"pith","pith_arxiv_id":"1505.04597","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"U-Net: Convolutional Networks for Biomedical Image Segmentation","venue":"cs.CV","work_id":"5c6b13d6-e704-4bf4-9df7-3a3a4d3b6950","year":2015},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"cited_paper":"/paper/1505.04597","citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:fa75522eb93f47ae1442a8f7584cf28cc4c95fd586438372398a2b28f0ae91ab","observation_id":"2a66a5ed-5b6f-4efa-9d32-435f2b17b5f2","resolution":{"observed_at":"2026-05-10T22:58:52.103805Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gen-2 by runway, https://research","venue":null,"work_id":"b2b6e128-8639-47a4-990b-5437c494fc8a","year":2023},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:f612b432e0ed42acce2a8c919ee570900e6c746dd30132edb70f7e131a14b688","observation_id":"b7c509d8-9f86-4d8a-adcd-54bcf546cf10","resolution":{"observed_at":"2026-05-10T22:58:52.178198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.07636","last_updated":"2021-06-30T07:34:57Z","snapshot_observed_at":"2026-08-16T18:31:18.345286Z","submitted_at":"2021-04-15T17:50:42Z","title":"Image Super-Resolution via Iterative Refinement","version":2},"cited_work":{"arxiv_id":"2104.07636","doi":"10.48550/arxiv.2104.07636","metadata_source":"arxiv_reference","pith_arxiv_id":"2104.07636","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Saharia, J","venue":"arXiv (Cornell University)","work_id":"e9b412f4-75e3-4695-be45-4a12069939ac","year":2021},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"cited_paper":"/paper/2104.07636","citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:34ad6e3eb26bc03d9a268ef4fad9ac8203f7d80ed6ef8b871a4e65fbdd79c7bf","observation_id":"5ed6e231-1a11-4c9f-9a22-312c2450f838","resolution":{"observed_at":"2026-05-10T22:58:52.111625Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.11487","last_updated":"2022-05-23T17:42:53Z","snapshot_observed_at":"2026-08-17T05:51:02.087480Z","submitted_at":"2022-05-23T17:42:53Z","title":"Photorealistic Text-to-Image Diffusion Models with Deep Language Understanding","version":1},"cited_work":{"arxiv_id":"2205.11487","doi":"10.48550/arxiv.2205.11487","metadata_source":"pith","pith_arxiv_id":"2205.11487","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Photorealistic Text-to-Image Diffusion Models with Deep Language Understanding","venue":"cs.CV","work_id":"af16442b-a46f-469d-8818-c37b53a504c7","year":2022},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"cited_paper":"/paper/2205.11487","citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:9694918cfc28f161afeaa55f7ead7d139447aec3e670263fca2b87cd98620fd9","observation_id":"a642a08a-88d5-43fb-b08f-f323c26ee55f","resolution":{"observed_at":"2026-05-12T07:38:54.138183Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:50:02.677+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:50:02.677+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tempo- ral generative adversarial nets with singular value clipping","venue":null,"work_id":"0f3e8f94-5bf3-4c75-9dec-0109a4074d2a","year":2017},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:ab536b69d400f1dcd12229995d335b9f60eeff7fa645499018a7784db01fb25f","observation_id":"8c4286f9-9084-4c24-8a4e-97f72bd68b88","resolution":{"observed_at":"2026-05-10T22:58:52.187263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Train sparsely, generate densely: Memory- efficient unsupervised training of high-resolution temporal gan","venue":null,"work_id":"4c882b02-640f-45f2-9de0-e9bf7ddfd331","year":2020},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:40a3238b40e8d2ac853889b843ff2b1bb8e53e485831fc2a1a655d7b3d06de38","observation_id":"41416f5f-b999-466b-91a0-e07ec90dc987","resolution":{"observed_at":"2026-05-10T22:58:52.190766Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.00512","last_updated":"2022-06-07T09:17:35Z","snapshot_observed_at":"2026-08-12T01:14:44.484432Z","submitted_at":"2022-02-01T16:07:25Z","title":"Progressive Distillation for Fast Sampling of Diffusion Models","version":2},"cited_work":{"arxiv_id":"2202.00512","doi":"10.48550/arxiv.2202.00512","metadata_source":"pith","pith_arxiv_id":"2202.00512","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Progressive Distillation for Fast Sampling of Diffusion Models","venue":"cs.LG","work_id":"fd04f498-ff85-4de3-bcc7-31ef072b2ceb","year":2022},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"cited_paper":"/paper/2202.00512","citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:9fb9841866b91945f45c33d77dc7552bd446c06b06d54e0095f7c422232d6525","observation_id":"4ab4e3b3-883d-4fb5-a4a7-c28d21fae26d","resolution":{"observed_at":"2026-05-11T09:37:44.815756Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Laion-5b: An open large-scale dataset for train- ing next generation image-text models","venue":null,"work_id":"cc73a8c8-3462-459d-a81c-a05775a195d1","year":2022},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:2777d16d348c7500699fdc420382695f41885150a8e4fcbc698aa1798dc4f952","observation_id":"c0620f95-20b6-4d95-8a0d-5ebb612dd05b","resolution":{"observed_at":"2026-05-10T22:58:52.195095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16512","last_updated":"2024-04-18T04:12:32Z","snapshot_observed_at":"2026-08-17T23:11:03.362702Z","submitted_at":"2023-08-31T07:49:06Z","title":"MVDream: Multi-view Diffusion for 3D Generation","version":4},"cited_work":{"arxiv_id":"2308.16512","doi":"10.48550/arxiv.2308.16512","metadata_source":"pith","pith_arxiv_id":"2308.16512","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MVDream: Multi-view Diffusion for 3D Generation","venue":"cs.CV","work_id":"269d1cf4-9ad9-4b6b-8f5f-da1567956dd6","year":2023},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"cited_paper":"/paper/2308.16512","citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:10a7d92ebaf0106fc40fa3073a41d1d2103add822604326e58ff23e80287f289","observation_id":"34feb37c-b32b-4396-a56c-7092ec300e26","resolution":{"observed_at":"2026-05-15T08:36:20.266102Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-13T20:38:17.236325+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-13T20:38:17.236325+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14792","last_updated":"2022-09-29T13:59:46Z","snapshot_observed_at":"2026-07-06T13:57:47.051387Z","submitted_at":"2022-09-29T13:59:46Z","title":"Make-A-Video: Text-to-Video Generation without Text-Video Data","version":1},"cited_work":{"arxiv_id":"2209.14792","doi":"10.48550/arxiv.2209.14792","metadata_source":"pith","pith_arxiv_id":"2209.14792","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Make-A-Video: Text-to-Video Generation without Text-Video Data","venue":"cs.CV","work_id":"52a801fc-a707-45a1-a8cd-0d6702f124ab","year":2022},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"cited_paper":"/paper/2209.14792","citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:0e63afa3fc2f375657b6d359b48357628b0a155719aab86e967ef44ea3a2b943","observation_id":"9889afaa-6ea3-4723-a270-acb42ef8f891","resolution":{"observed_at":"2026-05-11T01:13:03.403852Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Stylegan-v: A continuous video generator with the price, image quality and perks of stylegan2","venue":null,"work_id":"bbafed97-74be-4b81-a5f2-bed5015af75a","year":2022},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:13f0eb4626cf8f7ed4ed50f9a0734fb97085d421c207970e571e519b5cdc7722","observation_id":"a2c8a657-23a3-4415-bf59-d6f14e87f27b","resolution":{"observed_at":"2026-05-10T22:58:52.198584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1503.03585","last_updated":"2015-11-18T21:50:51Z","snapshot_observed_at":"2026-07-06T04:11:47.439779Z","submitted_at":"2015-03-12T04:51:37Z","title":"Deep Unsupervised Learning using Nonequilibrium Thermodynamics","version":8},"cited_work":{"arxiv_id":"1503.03585","doi":"10.48550/arxiv.1503.03585","metadata_source":"pith","pith_arxiv_id":"1503.03585","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Deep Unsupervised Learning using Nonequilibrium Thermodynamics","venue":"cs.LG","work_id":"986277c3-5997-4593-942c-17cdec737a72","year":2015},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"cited_paper":"/paper/1503.03585","citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:a232cd9afbabaef978b31650ae451792e1721a66a57afd784121f49db0eca5aa","observation_id":"49a95cb2-cbf4-435d-9106-4b640c78c46d","resolution":{"observed_at":"2026-05-13T20:12:28.687532Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-07-16T23:21:00.213109+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-16T23:21:00.213109+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Understanding and mitigating copying in diffusion models","venue":null,"work_id":"a2f02638-7382-476e-bfd0-be3795b3d670","year":2023},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:a5e7a4d5ec5960c78bbd434fbf68ab545413fd04d502374db44231d47d9d4f6f","observation_id":"e14a40b7-92cb-4361-9d15-4735feaadbe3","resolution":{"observed_at":"2026-05-10T22:58:52.201576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.09011","last_updated":"2020-10-23T19:37:51Z","snapshot_observed_at":"2026-08-15T21:45:18.426164Z","submitted_at":"2020-06-16T09:17:17Z","title":"Improved Techniques for Training Score-Based Generative Models","version":2},"cited_work":{"arxiv_id":"2006.09011","doi":null,"metadata_source":"pith","pith_arxiv_id":"2006.09011","snapshot_observed_at":"2026-07-10T06:26:51.341581Z","title":"Improved techniques for training Score-Based generative models","venue":"cs.LG","work_id":"5c40fb2a-218b-4d28-a13d-b5302d2f1718","year":2020},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"cited_paper":"/paper/2006.09011","citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:c4933dbe80e4e14833d34682011115c2699b71dcaf3bed8642bb835bcd8212dd","observation_id":"94f7f97f-5ae4-4be9-a194-770bd2b6d255","resolution":{"observed_at":"2026-05-10T22:58:51.954301Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.13456","last_updated":"2021-02-10T18:17:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-11-26T19:39:10Z","title":"Score-Based Generative Modeling through Stochastic Differential Equations","version":2},"cited_work":{"arxiv_id":"2011.13456","doi":"10.1088/1748-9326/aae98d","metadata_source":"pith","pith_arxiv_id":"2011.13456","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Score-Based Generative Modeling through Stochastic Differential Equations","venue":"cs.LG","work_id":"d9110e53-a5d4-4794-a4c5-a575e91c31ad","year":2020},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"cited_paper":"/paper/2011.13456","citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:e85e0daa69862806d4807458f6d86451e85ae921c0c28c9d281b3e99e0fb34ae","observation_id":"7e794e55-785f-4775-a471-dc44b8ae111e","resolution":{"observed_at":"2026-05-10T22:58:51.958806Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-06-01T22:58:00.812405+00:00","source":"crossref_status_cache"},{"observed_at":"2026-06-01T22:58:00.812405+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1212.0402","last_updated":"2012-12-03T14:45:31Z","snapshot_observed_at":"2026-08-16T21:21:44.768787Z","submitted_at":"2012-12-03T14:45:31Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","version":1},"cited_work":{"arxiv_id":"1212.0402","doi":"10.48550/arxiv.1212.0402","metadata_source":"pith","pith_arxiv_id":"1212.0402","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","venue":"cs.CV","work_id":"5dfb46e7-e952-409d-a3c7-ba7f20aebad6","year":2012},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"cited_paper":"/paper/1212.0402","citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:6f9953ebf4223389ad1d93f34389d47f4f8b6454b9524ff2f2f7c1cdc251bb94","observation_id":"12eb4b0f-eb97-4a00-b0c3-e577c4f0923f","resolution":{"observed_at":"2026-05-11T01:25:00.378223Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Raft: Recurrent all-pairs field transforms for optical flow","venue":null,"work_id":"b27b2b23-ea71-4978-bc82-86ee21d17c78","year":2020},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:1cfbb99e200dcd3897580716c5330ce4c5c3c74c6db7b1f902acc1bca92ce7b7","observation_id":"2188a425-4618-4d2e-a17a-c9f8587e3775","resolution":{"observed_at":"2026-05-10T22:58:52.209334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Metaxas, and Sergey Tulyakov","venue":null,"work_id":"8107840e-bb4e-4d84-afae-a814ca6a4997","year":2021},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:abc8febfbf725a59319264a1f171d0687605f3a0b0ed60b25f8a441d70a7b3ee","observation_id":"10c673ff-2f67-46c1-b8dd-1f2ce189ba37","resolution":{"observed_at":"2026-05-10T22:58:52.212551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Converting video formats with ffmpeg","venue":null,"work_id":"72121954-6d3b-426e-bd74-d0df7b43ff78","year":2006},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:c80544a92aba9a82b5188e8697d818e990d83b7b5e384692305eab8710b2a854","observation_id":"1f66e2b7-e935-4535-9e1f-82f4c0c19672","resolution":{"observed_at":"2026-05-10T22:58:52.220100Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Score-based generative modeling in latent space","venue":null,"work_id":"e8ddd3b1-19d9-4afb-b628-2bdadced6768","year":2021},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:8a3d938630d9b8cb83c1c924c98696f5df23436e5d66e87f63d0b2ed7b30de36","observation_id":"f5a396a0-1a76-49d3-bc6f-7c805e91a29b","resolution":{"observed_at":"2026-05-10T22:58:52.230113Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Decomposing motion and content for natural video sequence prediction","venue":null,"work_id":"7595f25c-e356-4a1d-8daa-1e91fe8a9f38","year":2017},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:79c5d7687963457f9e49efada5daf6642ef6ea996cd9d7f2a73be623c627403f","observation_id":"1bf1c45a-fbe8-4a90-bbe9-9f7fd079c56a","resolution":{"observed_at":"2026-05-10T22:58:52.234644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02399","last_updated":"2022-10-05T17:18:28Z","snapshot_observed_at":"2026-08-15T13:11:17.068630Z","submitted_at":"2022-10-05T17:18:28Z","title":"Phenaki: Variable Length Video Generation From Open Domain Textual Description","version":1},"cited_work":{"arxiv_id":"2210.02399","doi":"10.48550/arxiv.2210.02399","metadata_source":"pith","pith_arxiv_id":"2210.02399","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Phenaki: Variable Length Video Generation From Open Domain Textual Description","venue":"cs.CV","work_id":"a325cd53-6549-4726-b3e9-94509f0df168","year":2022},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"cited_paper":"/paper/2210.02399","citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:77fb7710157e0f0d22f91a5cace0ab16afd90bda5a343c099c158d53133e1f76","observation_id":"cd012fbc-e7d0-4450-85b0-cd7b2ad9d52e","resolution":{"observed_at":"2026-05-17T01:43:34.268786Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mcvd: Masked conditional video diffusion for prediction, generation, and interpolation","venue":null,"work_id":"041aaa93-44d8-40c1-b01c-9a0a8dd8121d","year":2022},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:2d0f72fecd1858d5c31dd74fa49b61013c069c067942b402a38b51f6eede4acd","observation_id":"301c62a7-1e1c-4f9d-b3af-a1b3cce9a07f","resolution":{"observed_at":"2026-05-10T22:58:52.239876Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Generating videos with scene dynamics","venue":null,"work_id":"40ae80f9-62fc-4cdc-a9f8-00d5f0ea8b77","year":2016},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:21e98adecc8cb1537e824eebc4ce06f685e8d4ca3b2afa6726464148ae9ceef6","observation_id":"0ede45f9-e289-4435-a4e4-d06e131f0308","resolution":{"observed_at":"2026-05-10T22:58:52.248191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06571","last_updated":"2023-08-12T13:53:10Z","snapshot_observed_at":"2026-08-14T13:59:50.878772Z","submitted_at":"2023-08-12T13:53:10Z","title":"ModelScope Text-to-Video Technical Report","version":1},"cited_work":{"arxiv_id":"2308.06571","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.06571","snapshot_observed_at":"2026-07-11T01:57:50.025885Z","title":"ModelScope Text-to-Video Technical Report","venue":"cs.CV","work_id":"1b1baf78-58ec-44d0-b700-84dff57b2f1f","year":2023},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"cited_paper":"/paper/2308.06571","citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:260b19a6cd92782a05ed3d1646150037a1096a4ed28ed5020f79f8f8e200d918","observation_id":"867eb3c0-1e04-4c90-b25a-f9635e1a6e03","resolution":{"observed_at":"2026-05-12T19:47:29.701736Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"G3an: Disentangling appearance and mo- tion for video generation","venue":null,"work_id":"ba0f849a-894c-4688-8d18-601f956151b5","year":2020},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:0ea5041d36159f4a05ac4d6050c3ad9fa605945aceb0751dca85550a9131ecfd","observation_id":"ddb335e0-703c-4c00-9b86-35e1f131e0e3","resolution":{"observed_at":"2026-05-10T22:58:52.252462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15103","last_updated":"2023-09-27T03:51:52Z","snapshot_observed_at":"2026-08-17T12:21:00.357059Z","submitted_at":"2023-09-26T17:52:03Z","title":"LAVIE: High-Quality Video Generation with Cascaded Latent Diffusion Models","version":2},"cited_work":{"arxiv_id":"2309.15103","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.15103","snapshot_observed_at":"2026-06-29T18:43:51.114876Z","title":"Lavie: High-quality video gener- ation with cascaded latent diffusion models","venue":null,"work_id":"e26464f0-6aed-49c2-b00f-e3639b1da5b1","year":2023},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"cited_paper":"/paper/2309.15103","citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:1392117b573f2b801eb4d0ca820e5a5ea0122d3f963d9c7cd8b5dcee46645818","observation_id":"16e5198c-4583-429d-bb8b-1eb3433d4008","resolution":{"observed_at":"2026-05-10T22:58:52.038771Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Internvid: A large-scale video-text dataset for multimodal understanding and generation","venue":null,"work_id":"7c6d5652-f5a1-41a6-bb82-6874e92bccac","year":2023},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:876083a288c706bb7bfe1d681488eb7ec568dd5a50f6801be1cd8881d2d24ddb","observation_id":"53774ddc-6ab3-4442-aa6b-2eb8bccb4cae","resolution":{"observed_at":"2026-05-10T22:58:52.258107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Novel view synthesis with diffusion models","venue":null,"work_id":"82c5f816-a4b5-444c-9b7c-8721bd22543b","year":null},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:778f48e9b0800378ddc962c1e946675f7db5bb8f5d16210ee9a689bf0a5f21b4","observation_id":"3deb0188-2f50-4613-a69e-4b1ac2472a23","resolution":{"observed_at":"2026-05-10T22:58:52.262032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scaling autoregressive video models","venue":null,"work_id":"18025cd2-0e76-428f-8323-f3b4ea295c64","year":2020},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":102,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:e9023894441047b16e1f7978b7efaf8803f116839d30b2b4a4149223efce3ad3","observation_id":"052d33ce-9e4a-4aff-8ad6-a4f078eaff1d","resolution":{"observed_at":"2026-05-10T22:58:52.270162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.14806","last_updated":"2021-04-30T07:40:35Z","snapshot_observed_at":"2026-08-16T18:27:58.328538Z","submitted_at":"2021-04-30T07:40:35Z","title":"GODIVA: Generating Open-DomaIn Videos from nAtural Descriptions","version":1},"cited_work":{"arxiv_id":"2104.14806","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2104.14806","snapshot_observed_at":"2026-07-02T00:56:24.869825Z","title":"Godiva: Generating open-domain videos from natural descriptions","venue":null,"work_id":"6f53148b-2cd8-4a9b-9fc5-bfec20977e90","year":2021},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":103,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"cited_paper":"/paper/2104.14806","citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:24b1b1aa98b8af814888cd27b0f0563d13f8d5ea8c4e1b1020242678de0ca3a8","observation_id":"498e28fe-59c7-4351-9027-343899b4de02","resolution":{"observed_at":"2026-05-10T22:58:52.067091Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":6,"parse_uncertain":0,"unresolved":2,"verified_exact":32,"verified_fuzzy":60},"total_outbound_references":116},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 100 of 116 outbound references and 100 inbound Pith citation observations for arXiv:2311.15127."}