{"as_of":"2026-08-15T07:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6c9a3860f6f0e4a78eaab63cf99ab12ce90ae11535ff1408f3127a45c9c6b9d3","coverage":[{"denominator":83,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":83,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:01:09.561127Z","state":"measured"},{"denominator":86,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":86,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T04:54:58.643717Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-05T18:50:16.683799Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-09T23:45:49.184514Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"cited_work":{"arxiv_id":"2506.00830","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.00830","snapshot_observed_at":"2026-08-05T18:50:16.683799Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","venue":"cs.CV","work_id":"536e56d9-0b2c-4cda-87d3-96be03358761","year":2025},"citing_paper":{"arxiv_id":"2508.14033","last_updated":"2025-08-19T17:55:23Z","snapshot_observed_at":"2026-08-14T22:06:04.675421Z","submitted_at":"2025-08-19T17:55:23Z","title":"InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T18:50:16.222228Z"},"links":{"cited_paper":"/paper/2506.00830","citing_paper":"/paper/2508.14033"},"observation_digest":"sha256:29295323e7ca12f14b757a8babe29cae5fd26a56571fee04bb0ed608c3805dcf","observation_id":"ab09bcec-d3a2-40f7-9f11-4c6229fdc586","resolution":{"observed_at":"2026-08-05T18:50:16.689954Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-09T23:45:49.184514Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00830","snapshot_observed_at":"2026-08-08T04:54:58.643717Z","title":"Skyreels-audio: Omni audio-conditioned talking portraits in video diffusion transformers.arXiv preprint arXiv:2506.00830,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05648","last_updated":"2026-08-06T06:46:35Z","snapshot_observed_at":"2026-08-14T05:01:24.809733Z","submitted_at":"2026-08-06T06:46:35Z","title":"Vorch-IR: Long-Form Unified Multimodal Identity Replacement Video Generation","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-08T04:54:58.643717Z"},"links":{"cited_paper":"/paper/2506.00830","citing_paper":"/paper/2608.05648"},"observation_digest":"sha256:ec65156afc7fb0b62b9d362d951e1a840bd9e1a7cd177dbd925a924543b88507","observation_id":"74bb284c-54b8-47aa-99d2-c80300e66aec","resolution":{"observed_at":"2026-08-08T04:54:58.643717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-09T23:45:49.184514Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00830","snapshot_observed_at":"2026-08-07T23:16:52.478464Z","title":"Zhengcong Fei, Hao Jiang, Di Qiu, Baoxuan Gu, Youqiang Zhang, Jiahua Wang, Jialin Bai, Debang Li, Mingyuan Fan, Guibin Chen, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05803","last_updated":"2026-08-06T09:38:30Z","snapshot_observed_at":"2026-08-13T04:18:16.814258Z","submitted_at":"2026-08-06T09:38:30Z","title":"Vorch-Omni: Multi-Task Orchestration of Sight and Sound","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T23:16:52.478464Z"},"links":{"cited_paper":"/paper/2506.00830","citing_paper":"/paper/2608.05803"},"observation_digest":"sha256:1812f9e6c8f07449f65f1315846f4992232fdfe882d7578cc33c6a974e7a60fa","observation_id":"085f7559-aa81-4101-b8b4-4d893902df8a","resolution":{"observed_at":"2026-08-07T23:16:52.478464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.00830/citation-record","integrity":"/paper/2506.00830/integrity","json":"/paper/2506.00830/citation-record.json","paper":"/paper/2506.00830"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:04.255827Z","title":"https://www.prnewswire.com/news-releases/deepbrain-ai-delivers-ai-avatar-to empower-people-with-disabilities-302026965.html","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-09T23:45:49.184514Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:04.255827Z"},"links":{"citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:38aa82145a01823515257aee026fb63743ac339d1d9c40e3921be7e978895775","observation_id":"2df14923-be37-4abe-ac00-5d3e78b821e4","resolution":{"observed_at":"2026-08-07T12:01:04.255827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:04.296619Z","title":"Efficient 3d implicit head avatar with mesh-anchored hash table blendshapes","venue":null,"work_id":null,"year":1975},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-09T23:45:49.184514Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:04.296619Z"},"links":{"citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:eef6c5990e2ffb80a908bdd1ec1c7e39ba841a2167fcbbe6bdc1cd5cf2797636","observation_id":"135e397a-f7e2-49ce-9051-87c42fd9b728","resolution":{"observed_at":"2026-08-07T12:01:04.296619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-07T12:01:04.358842Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets.arXiv preprint arXiv:2311.15127, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-09T23:45:49.184514Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:04.358842Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:afcb9d9457ad327886820cc0be4dd3a1e47b7e9cb740c3ff8b25b16665c86aa4","observation_id":"ea566ae7-4703-4d94-9f1b-107b32f69767","resolution":{"observed_at":"2026-08-07T12:01:04.358842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:04.454450Z","title":"Lipnerf: What is the right feature space to lip-sync a nerf","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-09T23:45:49.184514Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:04.454450Z"},"links":{"citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:67784b6200d9dcebf6cde48d48cceb0c29fc4c7fe5ebc864177478862f7bb6e0","observation_id":"f662ac27-511f-4fe5-a720-da09c6b99c49","resolution":{"observed_at":"2026-08-07T12:01:04.454450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.19040","last_updated":"2024-04-29T18:28:36Z","snapshot_observed_at":"2026-08-14T14:03:07.012797Z","submitted_at":"2024-04-29T18:28:36Z","title":"GSTalker: Real-time Audio-Driven Talking Face Generation via Deformable Gaussian Splatting","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.19040","snapshot_observed_at":"2026-08-07T12:01:04.496571Z","title":"Gstalker: Real-time audio-driven talking face generation via deformable gaussian splatting.arXiv preprint arXiv:2404.19040, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-09T23:45:49.184514Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:04.496571Z"},"links":{"cited_paper":"/paper/2404.19040","citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:e07fb4a848400b3de3fd49bf33f9aad3b18abfe71c09fc01091ab3bc77e5541b","observation_id":"1dc9ce03-21bb-42dd-b406-8b9551be6ea4","resolution":{"observed_at":"2026-08-07T12:01:04.496571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13074","last_updated":"2025-04-21T10:34:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-17T16:37:27Z","title":"SkyReels-V2: Infinite-length Film Generative Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13074","snapshot_observed_at":"2026-08-07T12:01:04.582389Z","title":"Skyreels-v2: Infinite-length film generative model.arXiv preprint arXiv:2504.13074, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-09T23:45:49.184514Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:04.582389Z"},"links":{"cited_paper":"/paper/2504.13074","citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:24b34fa6040c21ad78591f40b88be4e47c8c2238f3b615f06212032e77cc279d","observation_id":"0ce23d57-43e9-458b-aca8-e89518896901","resolution":{"observed_at":"2026-08-07T12:01:04.582389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-07T12:01:04.662450Z","title":"Pixart-alpha: Fast training of diffusion transformer for photorealistic text-to-image synthesis.arXiv preprint arXiv:2310.00426, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-09T23:45:49.184514Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:04.662450Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:5e61c92f1f5da16b5290cc4b76dd913aa5562fd4d179737b37f6a7be40286932","observation_id":"82d2b146-147b-456e-ab9c-c15ede9407d4","resolution":{"observed_at":"2026-08-07T12:01:04.662450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08136","last_updated":"2024-07-12T02:41:51Z","snapshot_observed_at":"2026-08-14T00:48:00.234750Z","submitted_at":"2024-07-11T02:26:51Z","title":"EchoMimic: Lifelike Audio-Driven Portrait Animations through Editable Landmark Conditions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08136","snapshot_observed_at":"2026-08-07T12:01:04.758873Z","title":"Echomimic: Lifelike audio-driven portrait animations through editable landmark conditions.arXiv preprint arXiv:2407.08136, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-09T23:45:49.184514Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:04.758873Z"},"links":{"cited_paper":"/paper/2407.08136","citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:0d2aa0e41543831830c6f5a951636684a35e3653e2ff8dd1ee8140e592532d46","observation_id":"088bdfa4-1de9-482d-9b3e-bce0028c595a","resolution":{"observed_at":"2026-08-07T12:01:04.758873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:15.074225Z","title":"Yolo-world: Real-time open-vocabulary object detection","venue":null,"work_id":"49dc368c-dad8-4291-8ae8-cf711d9c99c6","year":2024},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-09T23:45:49.184514Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:04.843546Z"},"links":{"citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:182e5e537d8a7760079570723953c7033d2428f0765eff978fb7f50a964f9a91","observation_id":"e395d580-5434-479f-ade6-c58c3185fddf","resolution":{"observed_at":"2026-08-07T12:01:15.136306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16012","last_updated":"2024-04-25T10:25:11Z","snapshot_observed_at":"2026-08-14T19:46:13.419733Z","submitted_at":"2024-04-24T17:45:24Z","title":"GaussianTalker: Real-Time High-Fidelity Talking Head Synthesis with Audio-Driven 3D Gaussian Splatting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16012","snapshot_observed_at":"2026-08-07T12:01:04.901517Z","title":"Gaussiantalker: Real-time high-fidelity talking head synthesis with audio-driven 3d gaussian splatting.arXiv preprint arXiv:2404.16012, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-09T23:45:49.184514Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:04.901517Z"},"links":{"cited_paper":"/paper/2404.16012","citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:26335001b6110a0e498071ec61c97109d5e125f05a435831744368c0474ad727","observation_id":"7807034e-597f-4eee-ade7-54a915c1d5b0","resolution":{"observed_at":"2026-08-07T12:01:04.901517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:04.988523Z","title":"Out of time: automated lip sync in the wild","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-09T23:45:49.184514Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:04.988523Z"},"links":{"citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:fa5bcbe8a0473d15508054f2eb3a4dee6f853f0d0c4ad707e81486d8af690e9d","observation_id":"38667ac5-dbeb-451d-8e18-efaa6597b4ef","resolution":{"observed_at":"2026-08-07T12:01:04.988523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00733","last_updated":"2025-03-13T08:23:27Z","snapshot_observed_at":"2026-08-12T11:06:26.827328Z","submitted_at":"2024-12-01T08:54:30Z","title":"Hallo3: Highly Dynamic and Realistic Portrait Image Animation with Video Diffusion Transformer","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00733","snapshot_observed_at":"2026-08-07T12:01:05.049606Z","title":"Hallo3: Highly dynamic and realistic portrait image animation with diffusion transformer networks.arXiv preprint arXiv:2412.00733, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-09T23:45:49.184514Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:05.049606Z"},"links":{"cited_paper":"/paper/2412.00733","citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:b151afff232bab6e017fed268503c32620cded16c4c97b41a2fa9abb04088f37","observation_id":"c430a401-a2e7-4075-9517-77f260d9c4df","resolution":{"observed_at":"2026-08-07T12:01:05.049606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:05.131395Z","title":"Adam: A method for stochastic optimization.(No Title), 2014","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-09T23:45:49.184514Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:05.131395Z"},"links":{"citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:f9e0c7f153eb237cf0f17d577838e72b78a12eacdb7ad50db1b91256241cec8a","observation_id":"64299477-3f87-489c-8ad7-41a7079f339a","resolution":{"observed_at":"2026-08-07T12:01:05.131395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:05.180625Z","title":"Scaling rectified flow transform- ers for high-resolution image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-09T23:45:49.184514Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:05.180625Z"},"links":{"citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:14c9ebad0b7a86a7341d4f5d7c5430c2da3e81ca798f8e58baa798dd714e6251","observation_id":"a9673042-2025-4f01-b54d-8f8ab5cee2ef","resolution":{"observed_at":"2026-08-07T12:01:05.180625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:05.262820Z","title":"Motioncharacter: Identity- preserving and motion controllable human video generation.arXiv preprint arXiv:2411.18281, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-09T23:45:49.184514Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:05.262820Z"},"links":{"citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:f6e0f6e76d4e338d5404f98444eff5a5648472208817aa786d243d3aebd58866","observation_id":"5292dd83-0062-4f74-ad13-1b1c5d45a7cb","resolution":{"observed_at":"2026-08-07T12:01:05.262820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.07719","last_updated":"2024-07-02T09:03:26Z","snapshot_observed_at":"2026-08-13T21:15:18.571730Z","submitted_at":"2024-05-13T13:08:02Z","title":"USP: A Unified Sequence Parallelism Approach for Long Context Generative AI","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.07719","snapshot_observed_at":"2026-08-07T12:01:05.332091Z","title":"A unified sequence parallelism approach for long context generative ai.arXiv preprint arXiv:2405.07719, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-09T23:45:49.184514Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:05.332091Z"},"links":{"cited_paper":"/paper/2405.07719","citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:5e90cb14f312c94c950857fff0f021de8097cd422ff0e05e4b232215db135c66","observation_id":"a7a0ba40-9daf-45c9-82b3-89ca956fac7d","resolution":{"observed_at":"2026-08-07T12:01:05.332091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05608","last_updated":"2024-03-28T08:28:44Z","snapshot_observed_at":"2026-08-13T04:23:28.499061Z","submitted_at":"2024-02-08T12:08:42Z","title":"Scalable Diffusion Models with State Space Backbone","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05608","snapshot_observed_at":"2026-08-07T12:01:05.394751Z","title":"Scalable diffusion models with state space backbone.arXiv preprint arXiv:2402.05608, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-09T23:45:49.184514Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:05.394751Z"},"links":{"cited_paper":"/paper/2402.05608","citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:c6928dbcb166f8f081dc217826326cdb2078a93069b3f7bcbd027f31fe27fc74","observation_id":"4a16b846-7325-46de-8529-136300117e68","resolution":{"observed_at":"2026-08-07T12:01:05.394751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04478","last_updated":"2024-04-06T02:54:35Z","snapshot_observed_at":"2026-08-14T11:29:03.749651Z","submitted_at":"2024-04-06T02:54:35Z","title":"Diffusion-RWKV: Scaling RWKV-Like Architectures for Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.04478","snapshot_observed_at":"2026-08-07T12:01:05.470046Z","title":"Diffusion-rwkv: Scaling rwkv-like architectures for diffusion models.arXiv preprint arXiv:2404.04478, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-09T23:45:49.184514Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:05.470046Z"},"links":{"cited_paper":"/paper/2404.04478","citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:6fc5c827d3dde00b0c3829f3be3ab7c1f19d597e3aad604ac996efcaf446a1e3","observation_id":"e3b93b7c-1e8c-476d-8216-53b62b7e32aa","resolution":{"observed_at":"2026-08-07T12:01:05.470046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02436","last_updated":"2025-04-03T09:50:50Z","snapshot_observed_at":"2026-08-14T06:32:25.240770Z","submitted_at":"2025-04-03T09:50:50Z","title":"SkyReels-A2: Compose Anything in Video Diffusion Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.02436","snapshot_observed_at":"2026-08-07T12:01:05.579680Z","title":"Skyreels-a2: Compose anything in video diffusion transform- ers.arXiv preprint arXiv:2504.02436, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-09T23:45:49.184514Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:05.579680Z"},"links":{"cited_paper":"/paper/2504.02436","citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:60d938e28357590f511eee40e94a291c509604f99df1cd99a2d4fa16d9085051","observation_id":"ab65c0ea-f8a6-4c34-b126-694ca2bb456c","resolution":{"observed_at":"2026-08-07T12:01:05.579680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01790","last_updated":"2025-03-18T10:47:27Z","snapshot_observed_at":"2026-08-13T05:44:11.203234Z","submitted_at":"2025-01-03T12:45:22Z","title":"Ingredients: Blending Custom Photos with Video Diffusion Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01790","snapshot_observed_at":"2026-08-07T12:01:05.662040Z","title":"Ingredients: Blending custom photos with video diffusion transformers.arXiv preprint arXiv:2501.01790, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-09T23:45:49.184514Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:05.662040Z"},"links":{"cited_paper":"/paper/2501.01790","citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:aa89b10460acd5f2599e3307f2da5046d09fedd71fb20753395805a6fb1d56c9","observation_id":"297cb0a0-1f64-46ef-a439-4906f905835b","resolution":{"observed_at":"2026-08-07T12:01:05.662040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:05.733194Z","title":"Generative adversarial networks.Communications of the ACM, 63(11):139–144, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-09T23:45:49.184514Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:05.733194Z"},"links":{"citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:6d154c8be222c0279d635dbe40a3c04d85273122c7d4a5511f1527cf27c65a6e","observation_id":"b804ddc7-a3e7-4ade-96e2-4494385e97c7","resolution":{"observed_at":"2026-08-07T12:01:05.733194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:14.912822Z","title":"Stylesync: High-fidelity generalized and personalized lip sync in style-based generator","venue":null,"work_id":"7e8a4e4a-dea4-497c-a7d5-be5e57c09f1c","year":2023},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-09T23:45:49.184514Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:05.836728Z"},"links":{"citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:78010a4f1c11bd9a231b41b094db073ff9364affa9611bb3eddc1e51b34747fa","observation_id":"e19b237a-6533-420b-9d9b-0649773bb5ee","resolution":{"observed_at":"2026-08-07T12:01:14.966252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04725","last_updated":"2024-02-08T18:08:57Z","snapshot_observed_at":"2026-08-12T14:50:50.360929Z","submitted_at":"2023-07-10T17:34:16Z","title":"AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04725","snapshot_observed_at":"2026-08-07T12:01:05.900408Z","title":"Animatediff: Animate your personalized text-to-image diffusion models without specific tuning.arXiv preprint arXiv:2307.04725, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-09T23:45:49.184514Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:05.900408Z"},"links":{"cited_paper":"/paper/2307.04725","citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:c93d5bf2c3255831360718f1049eb6460af5d8a0ac57f5fd0b0b64569c11a413","observation_id":"d2f9ac78-4775-44dd-8155-7965204d2f2a","resolution":{"observed_at":"2026-08-07T12:01:05.900408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:06.008788Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilibrium.Advances in neural information processing systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-09T23:45:49.184514Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:06.008788Z"},"links":{"citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:b0608290084bf0471870f129d488033b85cd0def91a3ec882072ffbe9a3a1226","observation_id":"905819a1-f1e7-4e62-b054-d4b53bc336ae","resolution":{"observed_at":"2026-08-07T12:01:06.008788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16331","last_updated":"2025-06-05T11:49:59Z","snapshot_observed_at":"2026-08-14T22:06:30.252612Z","submitted_at":"2024-11-25T12:24:52Z","title":"Sonic: Shifting Focus to Global Audio Perception in Portrait Animation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.16331","snapshot_observed_at":"2026-08-07T12:01:06.053086Z","title":"Sonic: Shifting focus to global audio perception in portrait animation.arXiv preprint arXiv:2411.16331, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-09T23:45:49.184514Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:06.053086Z"},"links":{"cited_paper":"/paper/2411.16331","citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:448da8f51b4412ffe0e3b86f4a3760b248f27357625600d28ce506e8f2183748","observation_id":"a4796f77-70ec-4dae-b235-7a8b14eb59a0","resolution":{"observed_at":"2026-08-07T12:01:06.053086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:06.134499Z","title":"Audio-driven emotional video portraits","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-09T23:45:49.184514Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:06.134499Z"},"links":{"citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:32131b504de6aef4c205fd567bffa2f16bbc3738ccbbefb8f811c6441067cfe8","observation_id":"66b01852-f46e-48d8-a37a-77f2ae21e8a8","resolution":{"observed_at":"2026-08-07T12:01:06.134499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02634","last_updated":"2025-04-04T05:13:40Z","snapshot_observed_at":"2026-08-12T22:51:36.940485Z","submitted_at":"2024-09-04T11:55:14Z","title":"Loopy: Taming Audio-Driven Portrait Avatar with Long-Term Motion Dependency","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02634","snapshot_observed_at":"2026-08-07T12:01:06.223848Z","title":"Loopy: Taming audio-driven portrait avatar with long-term motion dependency.arXiv preprint arXiv:2409.02634, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-09T23:45:49.184514Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:06.223848Z"},"links":{"cited_paper":"/paper/2409.02634","citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:52bf1c5d361c00a1f16a5756c1e5eae57eb380378b4089033b5b13a0c2121f83","observation_id":"e5ab0ec4-5864-45ea-a4f2-1c29fda9eda8","resolution":{"observed_at":"2026-08-07T12:01:06.223848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:14.744529Z","title":"Assessing empathy and managing emotions through interactions with an affective avatar.Health informatics journal, 24(2):182–193, 2018","venue":null,"work_id":"eb0fea9b-dde4-48ca-aac3-51cf08ef39de","year":2018},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-09T23:45:49.184514Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:06.343672Z"},"links":{"citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:7b0311d51bb13c0846b59daf3b8d7c24914d8ce24343e003d533349fd7c8e90c","observation_id":"bc4f37c4-a317-4b99-8a35-2d9277195d7b","resolution":{"observed_at":"2026-08-07T12:01:14.818039Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:14.596281Z","title":"Educational virtual reality game design for film and animation","venue":null,"work_id":"3c71a459-6cf2-4996-b0f2-6344fe219003","year":2024},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-09T23:45:49.184514Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:06.410579Z"},"links":{"citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:c2537ad6256297e8cc449b3fadd7a11134151dbcbd3d5bcc10ff4fc96f516d80","observation_id":"0413af8e-d553-412d-bdd7-1a50bdef7b88","resolution":{"observed_at":"2026-08-07T12:01:14.669546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:06.487818Z","title":"3d gaussian splatting for real-time radiance field rendering.ACM Trans","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-09T23:45:49.184514Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:06.487818Z"},"links":{"citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:e631f2b3cdba130a60cb48a7c3ebe248b1a52cb5ec008fd0b46e756b47cadfa7","observation_id":"f5c80228-bd0d-453a-ae91-4cb97050f5f4","resolution":{"observed_at":"2026-08-07T12:01:06.487818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-08-14T23:50:45.029465Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-07T12:01:06.530018Z","title":"Auto-encoding variational bayes.arXiv preprint arXiv:1312.6114, 2013","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-09T23:45:49.184514Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:06.530018Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:f7fa411943148eedebec1b03d9628499b00bb0b5a916bd65b01a1abe93faa7d5","observation_id":"d26bead3-9f11-4848-96f9-3026309ff20f","resolution":{"observed_at":"2026-08-07T12:01:06.530018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-13T14:41:45.809481Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-07T12:01:06.596226Z","title":"Hunyuanvideo: A systematic framework for large video generative models.arXiv preprint arXiv:2412.03603, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-09T23:45:49.184514Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:06.596226Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:3beb89440b241ed1dc1345995e6f243ed79d6664707c74eb0392d3b4d2c2ed04","observation_id":"ddb1a76e-3e1e-411e-afe9-2ac66e000fd0","resolution":{"observed_at":"2026-08-07T12:01:06.596226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09262","last_updated":"2025-03-13T09:17:52Z","snapshot_observed_at":"2026-08-14T04:53:10.712854Z","submitted_at":"2024-12-12T13:20:52Z","title":"LatentSync: Taming Audio-Conditioned Latent Diffusion Models for Lip Sync with SyncNet Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09262","snapshot_observed_at":"2026-08-07T12:01:06.693590Z","title":"Latentsync: Audio conditioned latent diffusion models for lip sync.arXiv preprint arXiv:2412.09262, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-09T23:45:49.184514Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:06.693590Z"},"links":{"cited_paper":"/paper/2412.09262","citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:8a013dae5b9abb5f3995c252cdabfc9862710700d51a64b6082fa0fc12c4cdf5","observation_id":"b0ba2e37-e88a-4c9f-adc8-9341d5a5b77a","resolution":{"observed_at":"2026-08-07T12:01:06.693590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:14.437833Z","title":"Ae- nerf: Audio enhanced neural radiance field for few shot talking head synthesis","venue":null,"work_id":"fa643cfa-7262-4b27-b2b1-1e6c41853e80","year":2024},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-09T23:45:49.184514Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:06.754688Z"},"links":{"citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:25945cf34c446348ac818a60ceac09343a940386b0c95e4713578aeb47627e56","observation_id":"bfcec5b4-063a-40e0-8512-198b8c24f05c","resolution":{"observed_at":"2026-08-07T12:01:14.546838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00115","last_updated":"2025-01-04T06:16:56Z","snapshot_observed_at":"2026-08-14T19:56:57.989410Z","submitted_at":"2024-11-28T07:01:06Z","title":"OpenHumanVid: A Large-Scale High-Quality Dataset for Enhancing Human-Centric Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00115","snapshot_observed_at":"2026-08-07T12:01:06.821951Z","title":"Openhumanvid: A large-scale high-quality dataset for enhancing human-centric video generation.arXiv preprint arXiv:2412.00115, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-09T23:45:49.184514Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:06.821951Z"},"links":{"cited_paper":"/paper/2412.00115","citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:7703f055adbae77a613872c29ebb7e9e6a281d5aa069a2b3e653119e37e207d2","observation_id":"c73b9690-e4ec-40d0-9335-48afd3d47c78","resolution":{"observed_at":"2026-08-07T12:01:06.821951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.15264","last_updated":"2024-07-05T04:09:46Z","snapshot_observed_at":"2026-08-13T00:23:35.500427Z","submitted_at":"2024-04-23T17:55:07Z","title":"TalkingGaussian: Structure-Persistent 3D Talking Head Synthesis via Gaussian Splatting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.15264","snapshot_observed_at":"2026-08-07T12:01:06.890022Z","title":"Talkinggaus- sian: Structure-persistent 3d talking head synthesis via gaussian splatting.arXiv preprint arXiv:2404.15264, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-09T23:45:49.184514Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:06.890022Z"},"links":{"cited_paper":"/paper/2404.15264","citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:ca2ca66647f1b708d66aa603f066f162418ac75d5ab1746555a0fdb3e3ad1066","observation_id":"e7811ccb-b8bc-4c31-9af8-acce66108131","resolution":{"observed_at":"2026-08-07T12:01:06.890022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:06.956820Z","title":"Learning a model of facial shape and expression from 4d scans.ACM Trans","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-09T23:45:49.184514Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:06.956820Z"},"links":{"citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:6e69eb6e55ec9e332001f231f9e2ad51e8c4f15db19d90886c5a6e6e46204e68","observation_id":"1b47b76c-b73d-4402-87bb-2eea3da8d6cf","resolution":{"observed_at":"2026-08-07T12:01:06.956820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:14.283795Z","title":"Omnihuman-1: Rethinking the scaling-up of one-stage conditioned human animation models, 2025","venue":null,"work_id":"1f8e716e-6861-4fc1-96fe-312323bbf55c","year":2025},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-09T23:45:49.184514Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:07.042283Z"},"links":{"citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:9334fdef748403b53938428945f390d4d9e27155dcf3be58876804e72bf817e2","observation_id":"14975a58-5155-44b6-901d-3338eb87cc2e","resolution":{"observed_at":"2026-08-07T12:01:14.360029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-07T12:01:07.094496Z","title":"Flow matching for generative modeling.arXiv preprint arXiv:2210.02747, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-09T23:45:49.184514Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:07.094496Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:c9744fa187573550e4cdc1e25f1d4677a96ca438638902c9ae411aa36713c257","observation_id":"fe03e516-e660-49f5-b0ab-28728adcb9ac","resolution":{"observed_at":"2026-08-07T12:01:07.094496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19108","last_updated":"2025-03-18T04:49:23Z","snapshot_observed_at":"2026-08-12T10:29:40.066151Z","submitted_at":"2024-11-28T12:50:05Z","title":"Timestep Embedding Tells: It's Time to Cache for Video Diffusion Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19108","snapshot_observed_at":"2026-08-07T12:01:07.173781Z","title":"Timestep embedding tells: It’s time to cache for video diffusion model.arXiv preprint arXiv:2411.19108, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-09T23:45:49.184514Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:07.173781Z"},"links":{"cited_paper":"/paper/2411.19108","citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:22a9f464364eb39b12ba10ce25b374a3fd8c16305eab41eeb9a709b48baf3c4d","observation_id":"800eea90-808a-45e7-b61e-bcd224ae6bfd","resolution":{"observed_at":"2026-08-07T12:01:07.173781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:14.077970Z","title":"Moda: Mapping-once audio- driven portrait animation with dual attentions","venue":null,"work_id":"ea80b366-dcbf-4e95-a16a-bbdbeb8fe343","year":2023},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-09T23:45:49.184514Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:07.249929Z"},"links":{"citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:7dbc4406cb8077aba0000b50c7581e0d8ffa68e8f8553b65a89e7dc1c3190ebf","observation_id":"3a80e1e8-b2fc-4b43-aa6f-13d79eb19bff","resolution":{"observed_at":"2026-08-07T12:01:14.190565Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:13.836702Z","title":"Live speech portraits: real-time photorealistic talking-head animation.ACM Transactions on Graphics (ToG), 40(6):1–17, 2021","venue":null,"work_id":"ee33e9fe-17aa-48f1-b58e-aa576b50805b","year":2021},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-09T23:45:49.184514Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:07.331183Z"},"links":{"citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:a7d88491ac86344595eefa5841b6d7c3ceb6a049bf761bc064102bc78d64cfe8","observation_id":"74a95d57-eb40-48c1-8976-88b356343155","resolution":{"observed_at":"2026-08-07T12:01:13.952818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:13.579307Z","title":"Pixel codec avatars","venue":null,"work_id":"60c750b0-f5bc-43db-8a6a-009422840fa9","year":2021},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-09T23:45:49.184514Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:07.418254Z"},"links":{"citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:0685a1885a74b8690e1b0e94940053bdfdf963679783ff574031b73e3e7e1468","observation_id":"df620f67-8d1b-4205-98dc-3ddcfe928ae3","resolution":{"observed_at":"2026-08-07T12:01:13.722317Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:13.364652Z","title":"Styletalk: One-shot talking head generation with controllable speaking styles","venue":null,"work_id":"218e23c7-c68b-42a9-ad8e-6d9b6a511107","year":1904},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-09T23:45:49.184514Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:07.475665Z"},"links":{"citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:f1723682b818b38cc6431cc9fd96b898022e5b1a0eaa765b5c6324048f495b38","observation_id":"7cbe88cb-eafd-47a0-82a9-be069f4087ca","resolution":{"observed_at":"2026-08-07T12:01:13.445427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09767","last_updated":"2024-08-10T09:37:55Z","snapshot_observed_at":"2026-08-13T05:01:00.463111Z","submitted_at":"2023-12-15T13:15:42Z","title":"DreamTalk: When Emotional Talking Head Generation Meets Diffusion Probabilistic Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.09767","snapshot_observed_at":"2026-08-07T12:01:07.552280Z","title":"Dreamtalk: When expressive talking head generation meets diffusion probabilistic models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-09T23:45:49.184514Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:07.552280Z"},"links":{"cited_paper":"/paper/2312.09767","citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:637a024cd5630f3478d0c2e91f8adf496edaf782f7e6e23aac311236c1626cfe","observation_id":"5b524bad-e05e-4c5b-82cf-4f52c311a11b","resolution":{"observed_at":"2026-08-07T12:01:07.552280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:07.669803Z","title":"Nerf: Representing scenes as neural radiance fields for view synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-09T23:45:49.184514Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:07.669803Z"},"links":{"citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:0928cbba0874444f4324aae9e9dbceb039d93f4f326070b44ab732f0ef28e7ce","observation_id":"b491905f-e470-4cb2-a8d4-ab33c83b2819","resolution":{"observed_at":"2026-08-07T12:01:07.669803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:13.123843Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":"3ca15927-9752-4d80-abac-c29067b235c6","year":2023},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-09T23:45:49.184514Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:07.720769Z"},"links":{"citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:269bb47519e4b47ba0589540e3a4e5ce879fa3e1d814714168fa4e4d556e20eb","observation_id":"89d54c32-20a1-4d3f-8165-98039b15531d","resolution":{"observed_at":"2026-08-07T12:01:13.233371Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:12.978955Z","title":"Synctalk: The devil is in the synchronization for talking head synthesis","venue":null,"work_id":"8eb2c994-408f-4c35-b4c7-51b16a46400c","year":2024},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-09T23:45:49.184514Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:07.764696Z"},"links":{"citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:95c9dfcfbfb79a6b5c38a5742b25ea464fe57183d55587cea2b0b39e07627a68","observation_id":"038adc5b-50c4-4171-a42a-02f6a61dfaf7","resolution":{"observed_at":"2026-08-07T12:01:13.042259Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:12.790225Z","title":"Emotalk: Speech-driven emotional disentanglement for 3d face animation","venue":null,"work_id":"03dc4847-d32c-4b5e-9c6f-df12e363fbf1","year":2023},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-09T23:45:49.184514Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:07.812253Z"},"links":{"citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:287641bfe3eaa319767cfa446adf480d8729e44118a969415429a712807d3b6d","observation_id":"47f55df0-4e7f-40be-b0c3-5216353557df","resolution":{"observed_at":"2026-08-07T12:01:12.895509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-14T11:08:32.950294Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-07T12:01:07.866515Z","title":"Movie gen: A cast of media foundation models.arXiv preprint arXiv:2410.13720, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-09T23:45:49.184514Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:07.866515Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:52f155db2a3ac6e274ca5b465e33afd116c51688822b99507b1db567ee46912c","observation_id":"16317c3c-7c29-483a-ab92-48d8f5d94aa1","resolution":{"observed_at":"2026-08-07T12:01:07.866515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20974","last_updated":"2025-01-13T05:06:17Z","snapshot_observed_at":"2026-08-14T08:13:38.485676Z","submitted_at":"2024-10-28T12:46:05Z","title":"MovieCharacter: A Tuning-Free Framework for Controllable Character Video Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.20974","snapshot_observed_at":"2026-08-07T12:01:07.916907Z","title":"Moviecharacter: A tuning-free framework for controllable character video synthesis.arXiv preprint arXiv:2410.20974, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-09T23:45:49.184514Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:07.916907Z"},"links":{"cited_paper":"/paper/2410.20974","citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:322fe68da1bf27c43817a8ca3fd085bcacd7fd4852504a58b211d1c7333cac15","observation_id":"480e6963-8300-4990-b826-fe3a48def1ac","resolution":{"observed_at":"2026-08-07T12:01:07.916907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10841","last_updated":"2025-02-15T16:08:40Z","snapshot_observed_at":"2026-08-10T13:10:46.349703Z","submitted_at":"2025-02-15T16:08:40Z","title":"SkyReels-A1: Expressive Portrait Animation in Video Diffusion Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10841","snapshot_observed_at":"2026-08-07T12:01:07.948041Z","title":"Skyreels-a1: Expressive portrait animation in video diffusion transformers.arXiv preprint arXiv:2502.10841, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-09T23:45:49.184514Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:07.948041Z"},"links":{"cited_paper":"/paper/2502.10841","citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:26a03b5f1353e880f385527cb2c94d7bdae6ba298b10a97d5dd5867e989649b4","observation_id":"8697d019-ad12-4a05-8c31-75557fe4b10d","resolution":{"observed_at":"2026-08-07T12:01:07.948041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:08.022078Z","title":"Robust speech recognition via large-scale weak supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-09T23:45:49.184514Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:08.022078Z"},"links":{"citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:4da29a5b354c8e804014f6e7fc7f129ebd6323495859845abbd66d7aab9411bf","observation_id":"564fe11f-0334-4575-9643-06fef90f614d","resolution":{"observed_at":"2026-08-07T12:01:08.022078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:12.566526Z","title":"What role can avatars play in e-mental health interventions? exploring new models of client–therapist interaction.Frontiers in Psychiatry, 7:186, 2016","venue":null,"work_id":"3b80121a-d37d-41e8-9111-9e03756c7107","year":2016},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-09T23:45:49.184514Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:08.066203Z"},"links":{"citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:dd860ca44295c8d94fb45f943c4dc13a38aafe1b8846d644d754eb7c8f41a3e0","observation_id":"67cddcfa-9b75-43f7-81b9-640aa62b749e","resolution":{"observed_at":"2026-08-07T12:01:12.658036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:08.118208Z","title":"High- resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-09T23:45:49.184514Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:08.118208Z"},"links":{"citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:582d587b2417a96a5b1a1f74b4a455c09933cd3e6992ede0ff16373f7de54bcc","observation_id":"83bc4b14-d6cc-472d-932e-9acd5622bbec","resolution":{"observed_at":"2026-08-07T12:01:08.118208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:12.271318Z","title":"Audio-driven dubbing for user generated contents via style-aware semi-parametric synthesis.IEEE Transactions on Circuits and Systems for Video Technology, 33(3):1247–1261, 2022","venue":null,"work_id":"a60fccb8-651b-429c-ad03-e7bc97686e33","year":2022},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-09T23:45:49.184514Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:08.178368Z"},"links":{"citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:eb732de2454f88055dacc20acaf3c01d79f925c60f4bb9cee47835a3d6fd48f8","observation_id":"4e4907f8-4b5e-4997-9001-5d198d5a6821","resolution":{"observed_at":"2026-08-07T12:01:12.413991Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05577","last_updated":"2024-07-08T03:17:10Z","snapshot_observed_at":"2026-08-12T23:27:08.313042Z","submitted_at":"2024-07-08T03:17:10Z","title":"Audio-driven High-resolution Seamless Talking Head Video Editing via StyleGAN","version":1},"cited_work":{"arxiv_id":"2407.05577","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.05577","snapshot_observed_at":"2026-08-07T12:01:10.070915Z","title":"Audio-driven High-resolution Seamless Talking Head Video Editing via StyleGAN","venue":"cs.CV","work_id":"43f87724-3917-4af0-9280-77a12918b013","year":2024},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-09T23:45:49.184514Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:08.213996Z"},"links":{"cited_paper":"/paper/2407.05577","citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:4a25c48db67763570fc5378ef836a1a02bf38479ab656f73c1a4c0e33d656b7c","observation_id":"35f01443-daac-45b5-8b08-a7dc58d68c7f","resolution":{"observed_at":"2026-08-07T12:01:10.171923Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:08.261036Z","title":"Roformer: Enhanced transformer with rotary position embedding.Neurocomputing, 568:127063, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-09T23:45:49.184514Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:08.261036Z"},"links":{"citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:f2e72793fe3a3b237fcbd90de841ae151ce88eb3252c9f3db5e0cf9d5f22e111","observation_id":"64137b0e-2f89-4712-8445-429e7625541b","resolution":{"observed_at":"2026-08-07T12:01:08.261036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17485","last_updated":"2024-08-08T03:48:38Z","snapshot_observed_at":"2026-08-13T04:09:10.236494Z","submitted_at":"2024-02-27T13:10:11Z","title":"EMO: Emote Portrait Alive -- Generating Expressive Portrait Videos with Audio2Video Diffusion Model under Weak Conditions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17485","snapshot_observed_at":"2026-08-07T12:01:08.319003Z","title":"Emo: Emote portrait alive-generating expressive portrait videos with audio2video diffusion model under weak conditions.arXiv preprint arXiv:2402.17485, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-09T23:45:49.184514Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:08.319003Z"},"links":{"cited_paper":"/paper/2402.17485","citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:7bf65bc4b1ae021605ff52c9e21e11886a0dc4c15b9aa1293ccc074c25de74c0","observation_id":"da075765-8bee-4534-a681-bf727410007c","resolution":{"observed_at":"2026-08-07T12:01:08.319003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:11.854758Z","title":"Nonlinear 3d face morphable model","venue":null,"work_id":"948084d3-59aa-41d2-b2ea-c659aaaea4c3","year":2018},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-09T23:45:49.184514Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:08.365172Z"},"links":{"citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:ce281395ee1fe057389f9c08373ab143b9126ca3d111c636ae447ad7c3c82946","observation_id":"506bcbd1-e816-4aa5-b6b7-125fb1d175d8","resolution":{"observed_at":"2026-08-07T12:01:12.052762Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:11.544642Z","title":"Fvd: A new metric for video generation","venue":null,"work_id":"9bcd3860-82c4-4c7d-85e1-b41d7784d5cd","year":2019},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-09T23:45:49.184514Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:08.427473Z"},"links":{"citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:b7e0d00a3ce1bec2fdad288e3a665f9a07b27458cec940940ce528317000849d","observation_id":"2d1ebd9a-f3b2-4fd0-abeb-7ed6dcd73987","resolution":{"observed_at":"2026-08-07T12:01:11.720900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-08-12T22:34:51.361078Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-07T12:01:08.462691Z","title":"Wan: Open and advanced large-scale video generative models.arXiv preprint arXiv:2503.20314, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-09T23:45:49.184514Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:08.462691Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:86f596ac607ceed8a0e0e08b68a7bf27603ef0b525b6ea9efe8474b4ae6c36a2","observation_id":"789024b5-367d-4b6b-ac4d-5409abc2e1e7","resolution":{"observed_at":"2026-08-07T12:01:08.462691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02511","last_updated":"2024-06-04T17:32:52Z","snapshot_observed_at":"2026-08-12T23:50:17.546227Z","submitted_at":"2024-06-04T17:32:52Z","title":"V-Express: Conditional Dropout for Progressive Training of Portrait Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02511","snapshot_observed_at":"2026-08-07T12:01:08.482037Z","title":"V-express: Conditional dropout for progressive training of portrait video generation.arXiv preprint arXiv:2406.02511, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-09T23:45:49.184514Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:08.482037Z"},"links":{"cited_paper":"/paper/2406.02511","citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:291565a1d2b304a080f1a55dc96e5e05cd53a85d34abdc9ed3336fe44a7301ae","observation_id":"d072b7de-f82f-4ae4-b929-62e7ced42bc0","resolution":{"observed_at":"2026-08-07T12:01:08.482037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:11.190543Z","title":"Seeing what you said: Talking face generation guided by a lip reading expert","venue":null,"work_id":"8671ba5d-a1f0-44a3-903b-b48bebdb1ab5","year":2023},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-09T23:45:49.184514Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:08.513318Z"},"links":{"citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:7a5b30dae1e07649ae67fc5649e9fd6af9d6108535ede32df032f5d6da2e70ba","observation_id":"046874be-8b90-4980-bbf8-202b867cb7a3","resolution":{"observed_at":"2026-08-07T12:01:11.391506Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.04842","last_updated":"2025-04-07T08:56:01Z","snapshot_observed_at":"2026-08-09T02:00:54.345290Z","submitted_at":"2025-04-07T08:56:01Z","title":"FantasyTalking: Realistic Talking Portrait Generation via Coherent Motion Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.04842","snapshot_observed_at":"2026-08-07T12:01:08.579080Z","title":"Fantasytalking: Realistic talking portrait generation via coherent motion synthesis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-09T23:45:49.184514Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:08.579080Z"},"links":{"cited_paper":"/paper/2504.04842","citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:310099485e464bfc6d245f6fabc00254ddd3d8f6e6818a655213f58a1b0f75a2","observation_id":"005dad01-d72c-4c8f-a3ec-0c0f2d47335a","resolution":{"observed_at":"2026-08-07T12:01:08.579080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:08.629999Z","title":"One-shot free-view neural talking-head synthesis for video conferencing","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-09T23:45:49.184514Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:08.629999Z"},"links":{"citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:f09899cfa92e1a3339a0e3952285bec6f366aa91111fd5e737c662576a610b44","observation_id":"45a057ed-6cca-4212-b8c6-a5f4821867dc","resolution":{"observed_at":"2026-08-07T12:01:08.629999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04468","last_updated":"2024-01-09T10:12:52Z","snapshot_observed_at":"2026-08-14T17:01:22.875100Z","submitted_at":"2024-01-09T10:12:52Z","title":"MagicVideo-V2: Multi-Stage High-Aesthetic Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04468","snapshot_observed_at":"2026-08-07T12:01:08.685760Z","title":"Magicvideo-v2: Multi-stage high-aesthetic video generation.arXiv preprint arXiv:2401.04468, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-09T23:45:49.184514Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:08.685760Z"},"links":{"cited_paper":"/paper/2401.04468","citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:91420ca6e74f3e5acf2662f4f9dd2dab63ecbb24d7f0179a28de275e0e3dc446","observation_id":"0465191f-b30f-46b5-aa31-73b4e528087b","resolution":{"observed_at":"2026-08-07T12:01:08.685760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:10.866942Z","title":"Panda: A gigapixel-level human-centric video dataset","venue":null,"work_id":"0498946a-fdaf-4d19-a5ab-d64d1ce2b5e9","year":2020},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-09T23:45:49.184514Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:08.738549Z"},"links":{"citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:c86ea786e7356527e6aaff2ad367e6a51b57d57d8d40daec322fb59fb9da1f19","observation_id":"fb09a09f-5380-400b-b2e2-df521df8918a","resolution":{"observed_at":"2026-08-07T12:01:11.058377Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17694","last_updated":"2024-03-26T13:35:02Z","snapshot_observed_at":"2026-08-13T00:44:42.973028Z","submitted_at":"2024-03-26T13:35:02Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17694","snapshot_observed_at":"2026-08-07T12:01:08.767656Z","title":"Aniportrait: Audio-driven synthesis of photore- alistic portrait animation.arXiv preprint arXiv:2403.17694, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-09T23:45:49.184514Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:08.767656Z"},"links":{"cited_paper":"/paper/2403.17694","citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:4753f8479501138465a9c5e614dda2afbec9357f4dc191e15eb9c8347c4200b9","observation_id":"67cedca9-14dc-44f2-b242-aff70eb235b5","resolution":{"observed_at":"2026-08-07T12:01:08.767656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.17090","last_updated":"2023-12-28T16:10:25Z","snapshot_observed_at":"2026-08-02T07:14:02.308302Z","submitted_at":"2023-12-28T16:10:25Z","title":"Q-Align: Teaching LMMs for Visual Scoring via Discrete Text-Defined Levels","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.17090","snapshot_observed_at":"2026-08-07T12:01:08.824060Z","title":"Q-align: Teaching lmms for visual scoring via discrete text-defined levels.arXiv preprint arXiv:2312.17090, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-09T23:45:49.184514Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:08.824060Z"},"links":{"cited_paper":"/paper/2312.17090","citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:e2ab92d523a2833128a574cdf61af7090c6c92aa5fa032891c54850398da23e6","observation_id":"b0558abf-a37e-4cfd-bcad-e2474b2d8609","resolution":{"observed_at":"2026-08-07T12:01:08.824060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:08.881537Z","title":"Codetalker: Speech-driven 3d facial animation with discrete motion prior","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-09T23:45:49.184514Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:08.881537Z"},"links":{"citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:64b60a636f99bb48b399e267b451c622bc4bb922ec7d6ef6a6b153ac49385ac8","observation_id":"4b103765-461f-4928-83fb-877d4d0092b0","resolution":{"observed_at":"2026-08-07T12:01:08.881537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:08.918756Z","title":"Easyanimate: A high-performance long video generation method based on transformer architecture.arXiv preprint arXiv:2405.18991, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-09T23:45:49.184514Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:08.918756Z"},"links":{"citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:48957ecc1fe37609f7489a904e0e8a189367a69dbdb6a4a9d010f55c5d9a2985","observation_id":"baffbf9b-c211-4082-9dd4-470662f66343","resolution":{"observed_at":"2026-08-07T12:01:08.918756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.14975","last_updated":"2024-08-27T11:31:47Z","snapshot_observed_at":"2026-08-12T22:56:41.996481Z","submitted_at":"2024-08-27T11:31:47Z","title":"MegActor-$\\Sigma$: Unlocking Flexible Mixed-Modal Control in Portrait Animation with Diffusion Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.14975","snapshot_observed_at":"2026-08-07T12:01:08.976755Z","title":"Megactor-sigma: Unlocking flexible mixed-modal control in portrait animation with diffusion transformer.arXiv preprint arXiv:2408.14975, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-09T23:45:49.184514Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:08.976755Z"},"links":{"cited_paper":"/paper/2408.14975","citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:df10d181d10981907cd27210e2f09c2ae5aa1d575c6d549b9dcda7225aa533ce","observation_id":"8d643f5b-4a3d-4e4a-aa01-157731aff9db","resolution":{"observed_at":"2026-08-07T12:01:08.976755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:09.030034Z","title":"Effective whole-body pose estimation with two-stages distillation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-09T23:45:49.184514Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:09.030034Z"},"links":{"citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:39f0527944209dbaf0853700abc608e74d725845bbb751f71b6b94aac742ac4b","observation_id":"23f9d9b7-859d-4575-9660-e8b056d0648d","resolution":{"observed_at":"2026-08-07T12:01:09.030034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-07T12:01:09.064934Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer.arXiv preprint arXiv:2408.06072, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-09T23:45:49.184514Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:09.064934Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:d0bb2ae76ef88a8f98027c4c54fb84414d4c9bdc248453c60060058236f31cec","observation_id":"a472f972-a72d-429c-813d-7718562ddb21","resolution":{"observed_at":"2026-08-07T12:01:09.064934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08503","last_updated":"2024-03-23T06:40:22Z","snapshot_observed_at":"2026-08-13T04:41:53.034723Z","submitted_at":"2024-01-16T17:04:30Z","title":"Real3D-Portrait: One-shot Realistic 3D Talking Portrait Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08503","snapshot_observed_at":"2026-08-07T12:01:09.114112Z","title":"Real3d-portrait: One-shot realistic 3d talking portrait synthesis.arXiv preprint arXiv:2401.08503, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-09T23:45:49.184514Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:09.114112Z"},"links":{"cited_paper":"/paper/2401.08503","citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:ad365db7c4dfc88f53083188dcfa9f1bd060cb81f942b156f9e87aebd19066c3","observation_id":"f7ed62cd-0952-48cc-a2e7-53fa20bc31c0","resolution":{"observed_at":"2026-08-07T12:01:09.114112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05978","last_updated":"2025-03-07T23:21:11Z","snapshot_observed_at":"2026-08-14T19:48:20.768180Z","submitted_at":"2025-03-07T23:21:11Z","title":"MagicInfinite: Generating Infinite Talking Videos with Your Words and Voice","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.05978","snapshot_observed_at":"2026-08-07T12:01:09.189058Z","title":"Magicinfinite: Generating infinite talking videos with your words and voice.arXiv preprint arXiv:2503.05978, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-09T23:45:49.184514Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:09.189058Z"},"links":{"cited_paper":"/paper/2503.05978","citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:fb9abaa49925a18647d134595c135bb049d81c4541c95ab76536f0aeb318ad89","observation_id":"6948a4df-cda3-4398-8093-8a432a7d9b6c","resolution":{"observed_at":"2026-08-07T12:01:09.189058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:09.233037Z","title":"Sadtalker: Learning realistic 3d motion coefficients for stylized audio-driven single image talking face animation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-09T23:45:49.184514Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:09.233037Z"},"links":{"citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:bc285a81fb69d1034392479c568c39c6415c7923c9d1df23fd1d1a7691bb7dbe","observation_id":"b2abdc3d-d2eb-4e01-9ac0-bdbff7effd07","resolution":{"observed_at":"2026-08-07T12:01:09.233037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:10.617106Z","title":"Flow-guided one-shot talking face generation with a high-resolution audio-visual dataset","venue":null,"work_id":"5c98e21c-1ffb-42a7-a2d3-42e612186565","year":2021},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-09T23:45:49.184514Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:09.303110Z"},"links":{"citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:a1e912d5c35a8b2cf04beef27200cb16154a46c54a67c966d25e79a9c5f3aa9b","observation_id":"4ebb5b4c-f4f4-439a-8f30-e00783eeb534","resolution":{"observed_at":"2026-08-07T12:01:10.709000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04448","last_updated":"2024-12-05T18:57:26Z","snapshot_observed_at":"2026-08-13T09:17:08.210766Z","submitted_at":"2024-12-05T18:57:26Z","title":"MEMO: Memory-Guided Diffusion for Expressive Talking Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04448","snapshot_observed_at":"2026-08-07T12:01:09.337775Z","title":"Memo: Memory-guided diffusion for expressive talking video generation.arXiv preprint arXiv:2412.04448, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-09T23:45:49.184514Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:09.337775Z"},"links":{"cited_paper":"/paper/2412.04448","citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:dd644b827b91b28089794c9163504880880b64e4f4931e9a73bc159f4dd877e4","observation_id":"9c612247-a0e5-44b8-83f3-b9743f5235ed","resolution":{"observed_at":"2026-08-07T12:01:09.337775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01561","last_updated":"2025-02-08T17:46:58Z","snapshot_observed_at":"2026-08-12T23:55:42.274995Z","submitted_at":"2024-06-03T17:44:11Z","title":"Guided Score identity Distillation for Data-Free One-Step Text-to-Image Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01561","snapshot_observed_at":"2026-08-07T12:01:09.387556Z","title":"Long and short guidance in score identity distillation for one-step text-to-image generation.ArXiv 2406.01561, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-09T23:45:49.184514Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:09.387556Z"},"links":{"cited_paper":"/paper/2406.01561","citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:f0be46b4bcc5313825e87f5f3dc7686ecf92e3cb46e99edb107eddb01dddf300","observation_id":"46f733c2-0eb1-4197-9ca4-6e096bada95d","resolution":{"observed_at":"2026-08-07T12:01:09.387556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15458","last_updated":"2024-10-20T17:51:35Z","snapshot_observed_at":"2026-08-12T22:19:09.109938Z","submitted_at":"2024-10-20T17:51:35Z","title":"Allegro: Open the Black Box of Commercial-Level Video Generation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.15458","snapshot_observed_at":"2026-08-07T12:01:09.480529Z","title":"Allegro: Open the black box of commercial-level video generation model.arXiv preprint arXiv:2410.15458, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-09T23:45:49.184514Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:09.480529Z"},"links":{"cited_paper":"/paper/2410.15458","citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:664db743bd0c754175879642a8151734658b09545e67a67912dfac3b90879706","observation_id":"0f82b039-061e-4c9a-ab90-560cdd0c3a34","resolution":{"observed_at":"2026-08-07T12:01:09.480529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12888","last_updated":"2024-04-19T13:45:14Z","snapshot_observed_at":"2026-08-13T00:26:02.448718Z","submitted_at":"2024-04-19T13:45:14Z","title":"Learn2Talk: 3D Talking Face Learns from 2D Talking Face","version":1},"cited_work":{"arxiv_id":"2404.12888","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.12888","snapshot_observed_at":"2026-08-07T12:01:09.651753Z","title":"Learn2Talk: 3D Talking Face Learns from 2D Talking Face","venue":"cs.CV","work_id":"c1827acf-3c04-4417-b6fa-583ba07f59a7","year":2024},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-09T23:45:49.184514Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:09.561127Z"},"links":{"cited_paper":"/paper/2404.12888","citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:8b642031152463471c1df05b2b712d7173ca24045dc2a2876f9b222e5de96699","observation_id":"1b6aa078-8e17-4763-873c-33eaaa507789","resolution":{"observed_at":"2026-08-07T12:01:09.744867Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T23:45:49.184514Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers"},"reference_resolution":{"displayed":83,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":61,"verified_exact":2,"verified_fuzzy":20},"total_outbound_references":83},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 83 of 83 outbound references and 3 inbound Pith citation observations for arXiv:2506.00830."}