Pith. sign in

Paper Citation Record · LEDGER

SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers

As of 15 August 2026, this Paper Citation Record lists 83 of 83 outbound references and 3 inbound Pith citation observations for arXiv:2506.00830.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2506.00830 v1

Coverage vector

measured 83 of 83 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-07T12:01:09.561127Z

measured 86 of 86 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-15T06:32:42.880941+00:00

measured 3 of 3 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-08T04:54:58.643717Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: pith, observed 2026-08-05T18:50:16.683799Z

Reference resolution

83 of 83 outbound references displayed

  • verified exact2
  • verified fuzzy20
  • unresolved61
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 2df14923-be37-4abe-ac00-5d3e78b821e4 · outbound

This paper cites https://www.prnewswire.com/news-releases/deepbrain-ai-delivers-ai-avatar-to empower-people-with-disabilities-302026965.html.

SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers https://www.prnewswire.com/news-releases/deepbrain-ai-delivers-ai-avatar-to empower-people-with-disabilities-302026965.html

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-07T12:01:04.255827Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:01:04.255827Z digest=sha256:38aa82145a01823515257aee026fb63743ac339d1d9c40e3921be7e978895775

Observation 135e397a-f7e2-49ce-9051-87c42fd9b728 · outbound

This paper cites Efficient 3d implicit head avatar with mesh-anchored hash table blendshapes.

SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers Efficient 3d implicit head avatar with mesh-anchored hash table blendshapes

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-07T12:01:04.296619Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:01:04.296619Z digest=sha256:eef6c5990e2ffb80a908bdd1ec1c7e39ba841a2167fcbbe6bdc1cd5cf2797636

Observation ea566ae7-4703-4d94-9f1b-107b32f69767 · outbound

This paper cites Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets.

SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-07T12:01:04.358842Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:01:04.358842Z digest=sha256:afcb9d9457ad327886820cc0be4dd3a1e47b7e9cb740c3ff8b25b16665c86aa4

Observation f662ac27-511f-4fe5-a720-da09c6b99c49 · outbound

This paper cites Lipnerf: What is the right feature space to lip-sync a nerf.

SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers Lipnerf: What is the right feature space to lip-sync a nerf

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-07T12:01:04.454450Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:01:04.454450Z digest=sha256:67784b6200d9dcebf6cde48d48cceb0c29fc4c7fe5ebc864177478862f7bb6e0

Observation 1dc9ce03-21bb-42dd-b406-8b9551be6ea4 · outbound

This paper cites GSTalker: Real-time Audio-Driven Talking Face Generation via Deformable Gaussian Splatting.

SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers GSTalker: Real-time Audio-Driven Talking Face Generation via Deformable Gaussian Splatting

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-07T12:01:04.496571Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:01:04.496571Z digest=sha256:e07fb4a848400b3de3fd49bf33f9aad3b18abfe71c09fc01091ab3bc77e5541b

Observation 0ce23d57-43e9-458b-aca8-e89518896901 · outbound

This paper cites SkyReels-V2: Infinite-length Film Generative Model.

SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers SkyReels-V2: Infinite-length Film Generative Model

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-07T12:01:04.582389Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:01:04.582389Z digest=sha256:24b34fa6040c21ad78591f40b88be4e47c8c2238f3b615f06212032e77cc279d

Observation 82d2b146-147b-456e-ab9c-c15ede9407d4 · outbound

This paper cites PixArt-$\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis.

SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers PixArt-$\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-07T12:01:04.662450Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:01:04.662450Z digest=sha256:5e61c92f1f5da16b5290cc4b76dd913aa5562fd4d179737b37f6a7be40286932

Observation 088bdfa4-1de9-482d-9b3e-bce0028c595a · outbound

This paper cites EchoMimic: Lifelike Audio-Driven Portrait Animations through Editable Landmark Conditions.

SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers EchoMimic: Lifelike Audio-Driven Portrait Animations through Editable Landmark Conditions

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-07T12:01:04.758873Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:01:04.758873Z digest=sha256:0d2aa0e41543831830c6f5a951636684a35e3653e2ff8dd1ee8140e592532d46

Observation e395d580-5434-479f-ade6-c58c3185fddf · outbound

This paper cites Yolo-world: Real-time open-vocabulary object detection.

SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers Yolo-world: Real-time open-vocabulary object detection

Reference 9

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T12:01:15.136306Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-07T12:01:04.843546Z digest=sha256:182e5e537d8a7760079570723953c7033d2428f0765eff978fb7f50a964f9a91

Observation 7807034e-597f-4eee-ade7-54a915c1d5b0 · outbound

This paper cites GaussianTalker: Real-Time High-Fidelity Talking Head Synthesis with Audio-Driven 3D Gaussian Splatting.

SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers GaussianTalker: Real-Time High-Fidelity Talking Head Synthesis with Audio-Driven 3D Gaussian Splatting

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-07T12:01:04.901517Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:01:04.901517Z digest=sha256:26335001b6110a0e498071ec61c97109d5e125f05a435831744368c0474ad727

Observation 38667ac5-dbeb-451d-8e18-efaa6597b4ef · outbound

This paper cites Out of time: automated lip sync in the wild.

SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers Out of time: automated lip sync in the wild

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-07T12:01:04.988523Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:01:04.988523Z digest=sha256:fa5bcbe8a0473d15508054f2eb3a4dee6f853f0d0c4ad707e81486d8af690e9d

Observation c430a401-a2e7-4075-9517-77f260d9c4df · outbound

This paper cites Hallo3: Highly Dynamic and Realistic Portrait Image Animation with Video Diffusion Transformer.

SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers Hallo3: Highly Dynamic and Realistic Portrait Image Animation with Video Diffusion Transformer

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-07T12:01:05.049606Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:01:05.049606Z digest=sha256:b151afff232bab6e017fed268503c32620cded16c4c97b41a2fa9abb04088f37

Observation 64299477-3f87-489c-8ad7-41a7079f339a · outbound

This paper cites Adam: A method for stochastic optimization.(No Title), 2014.

SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers Adam: A method for stochastic optimization.(No Title), 2014

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-07T12:01:05.131395Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:01:05.131395Z digest=sha256:f9e0c7f153eb237cf0f17d577838e72b78a12eacdb7ad50db1b91256241cec8a

Observation a9673042-2025-4f01-b54d-8f8ab5cee2ef · outbound

This paper cites Scaling rectified flow transform- ers for high-resolution image synthesis.

SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers Scaling rectified flow transform- ers for high-resolution image synthesis

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-07T12:01:05.180625Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:01:05.180625Z digest=sha256:14c9ebad0b7a86a7341d4f5d7c5430c2da3e81ca798f8e58baa798dd714e6251

Observation 5292dd83-0062-4f74-ad13-1b1c5d45a7cb · outbound

This paper cites Motioncharacter: Identity- preserving and motion controllable human video generation.arXiv preprint arXiv:2411.18281, 2024.

SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers Motioncharacter: Identity- preserving and motion controllable human video generation.arXiv preprint arXiv:2411.18281, 2024

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-07T12:01:05.262820Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:01:05.262820Z digest=sha256:f6e0f6e76d4e338d5404f98444eff5a5648472208817aa786d243d3aebd58866

Observation a7a0ba40-9daf-45c9-82b3-89ca956fac7d · outbound

This paper cites USP: A Unified Sequence Parallelism Approach for Long Context Generative AI.

SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers USP: A Unified Sequence Parallelism Approach for Long Context Generative AI

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-07T12:01:05.332091Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:01:05.332091Z digest=sha256:5e90cb14f312c94c950857fff0f021de8097cd422ff0e05e4b232215db135c66

Observation 4a16b846-7325-46de-8529-136300117e68 · outbound

This paper cites Scalable Diffusion Models with State Space Backbone.

SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers Scalable Diffusion Models with State Space Backbone

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-07T12:01:05.394751Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:01:05.394751Z digest=sha256:c6928dbcb166f8f081dc217826326cdb2078a93069b3f7bcbd027f31fe27fc74

Observation e3b93b7c-1e8c-476d-8216-53b62b7e32aa · outbound

This paper cites Diffusion-RWKV: Scaling RWKV-Like Architectures for Diffusion Models.

SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers Diffusion-RWKV: Scaling RWKV-Like Architectures for Diffusion Models

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-07T12:01:05.470046Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:01:05.470046Z digest=sha256:6fc5c827d3dde00b0c3829f3be3ab7c1f19d597e3aad604ac996efcaf446a1e3

Observation ab65c0ea-f8a6-4c34-b126-694ca2bb456c · outbound

This paper cites SkyReels-A2: Compose Anything in Video Diffusion Transformers.

SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers SkyReels-A2: Compose Anything in Video Diffusion Transformers

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-07T12:01:05.579680Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:01:05.579680Z digest=sha256:60d938e28357590f511eee40e94a291c509604f99df1cd99a2d4fa16d9085051

Observation 297cb0a0-1f64-46ef-a439-4906f905835b · outbound

This paper cites Ingredients: Blending Custom Photos with Video Diffusion Transformers.

SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers Ingredients: Blending Custom Photos with Video Diffusion Transformers

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-07T12:01:05.662040Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:01:05.662040Z digest=sha256:aa89b10460acd5f2599e3307f2da5046d09fedd71fb20753395805a6fb1d56c9

Observation b804ddc7-a3e7-4ade-96e2-4494385e97c7 · outbound

This paper cites Generative adversarial networks.Communications of the ACM, 63(11):139–144, 2020.

SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers Generative adversarial networks.Communications of the ACM, 63(11):139–144, 2020

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-07T12:01:05.733194Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:01:05.733194Z digest=sha256:6d154c8be222c0279d635dbe40a3c04d85273122c7d4a5511f1527cf27c65a6e

Observation e19b237a-6533-420b-9d9b-0649773bb5ee · outbound

This paper cites Stylesync: High-fidelity generalized and personalized lip sync in style-based generator.

SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers Stylesync: High-fidelity generalized and personalized lip sync in style-based generator

Reference 22

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T12:01:14.966252Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-07T12:01:05.836728Z digest=sha256:78010a4f1c11bd9a231b41b094db073ff9364affa9611bb3eddc1e51b34747fa

Observation d2f9ac78-4775-44dd-8155-7965204d2f2a · outbound

This paper cites AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning.

SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-07T12:01:05.900408Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:01:05.900408Z digest=sha256:c93d5bf2c3255831360718f1049eb6460af5d8a0ac57f5fd0b0b64569c11a413

Observation 905819a1-f1e7-4e62-b054-d4b53bc336ae · outbound

This paper cites Gans trained by a two time-scale update rule converge to a local nash equilibrium.Advances in neural information processing systems, 30, 2017.

SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers Gans trained by a two time-scale update rule converge to a local nash equilibrium.Advances in neural information processing systems, 30, 2017

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-07T12:01:06.008788Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:01:06.008788Z digest=sha256:b0608290084bf0471870f129d488033b85cd0def91a3ec882072ffbe9a3a1226

Observation a4796f77-70ec-4dae-b235-7a8b14eb59a0 · outbound

This paper cites Sonic: Shifting Focus to Global Audio Perception in Portrait Animation.

SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers Sonic: Shifting Focus to Global Audio Perception in Portrait Animation

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-07T12:01:06.053086Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:01:06.053086Z digest=sha256:448da8f51b4412ffe0e3b86f4a3760b248f27357625600d28ce506e8f2183748

Observation 66b01852-f46e-48d8-a37a-77f2ae21e8a8 · outbound

This paper cites Audio-driven emotional video portraits.

SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers Audio-driven emotional video portraits

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-07T12:01:06.134499Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:01:06.134499Z digest=sha256:32131b504de6aef4c205fd567bffa2f16bbc3738ccbbefb8f811c6441067cfe8

Observation e5ab0ec4-5864-45ea-a4f2-1c29fda9eda8 · outbound

This paper cites Loopy: Taming Audio-Driven Portrait Avatar with Long-Term Motion Dependency.

SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers Loopy: Taming Audio-Driven Portrait Avatar with Long-Term Motion Dependency

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-07T12:01:06.223848Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:01:06.223848Z digest=sha256:52bf1c5d361c00a1f16a5756c1e5eae57eb380378b4089033b5b13a0c2121f83

Observation bc4f37c4-a317-4b99-8a35-2d9277195d7b · outbound

This paper cites Assessing empathy and managing emotions through interactions with an affective avatar.Health informatics journal, 24(2):182–193, 2018.

SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers Assessing empathy and managing emotions through interactions with an affective avatar.Health informatics journal, 24(2):182–193, 2018

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T12:01:14.818039Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-07T12:01:06.343672Z digest=sha256:7b0311d51bb13c0846b59daf3b8d7c24914d8ce24343e003d533349fd7c8e90c

Observation 0413af8e-d553-412d-bdd7-1a50bdef7b88 · outbound

This paper cites Educational virtual reality game design for film and animation.

SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers Educational virtual reality game design for film and animation

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T12:01:14.669546Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-07T12:01:06.410579Z digest=sha256:c2537ad6256297e8cc449b3fadd7a11134151dbcbd3d5bcc10ff4fc96f516d80

Observation f5c80228-bd0d-453a-ae91-4cb97050f5f4 · outbound

This paper cites 3d gaussian splatting for real-time radiance field rendering.ACM Trans.

SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers 3d gaussian splatting for real-time radiance field rendering.ACM Trans

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-07T12:01:06.487818Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:01:06.487818Z digest=sha256:e631f2b3cdba130a60cb48a7c3ebe248b1a52cb5ec008fd0b46e756b47cadfa7

Observation d26bead3-9f11-4848-96f9-3026309ff20f · outbound

This paper cites Auto-Encoding Variational Bayes.

SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers Auto-Encoding Variational Bayes

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-07T12:01:06.530018Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:01:06.530018Z digest=sha256:f7fa411943148eedebec1b03d9628499b00bb0b5a916bd65b01a1abe93faa7d5

Observation ddb1a76e-3e1e-411e-afe9-2ac66e000fd0 · outbound

This paper cites HunyuanVideo: A Systematic Framework For Large Video Generative Models.

SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers HunyuanVideo: A Systematic Framework For Large Video Generative Models

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-07T12:01:06.596226Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:01:06.596226Z digest=sha256:3beb89440b241ed1dc1345995e6f243ed79d6664707c74eb0392d3b4d2c2ed04

Observation b0ba2e37-e88a-4c9f-adc8-9341d5a5b77a · outbound

This paper cites LatentSync: Taming Audio-Conditioned Latent Diffusion Models for Lip Sync with SyncNet Supervision.

SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers LatentSync: Taming Audio-Conditioned Latent Diffusion Models for Lip Sync with SyncNet Supervision

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-07T12:01:06.693590Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:01:06.693590Z digest=sha256:8a013dae5b9abb5f3995c252cdabfc9862710700d51a64b6082fa0fc12c4cdf5

Observation bfcec5b4-063a-40e0-8512-198b8c24f05c · outbound

This paper cites Ae- nerf: Audio enhanced neural radiance field for few shot talking head synthesis.

SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers Ae- nerf: Audio enhanced neural radiance field for few shot talking head synthesis

Reference 34

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T12:01:14.546838Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-07T12:01:06.754688Z digest=sha256:25945cf34c446348ac818a60ceac09343a940386b0c95e4713578aeb47627e56

Observation c73b9690-e4ec-40d0-9335-48afd3d47c78 · outbound

This paper cites OpenHumanVid: A Large-Scale High-Quality Dataset for Enhancing Human-Centric Video Generation.

SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers OpenHumanVid: A Large-Scale High-Quality Dataset for Enhancing Human-Centric Video Generation

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-07T12:01:06.821951Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:01:06.821951Z digest=sha256:7703f055adbae77a613872c29ebb7e9e6a281d5aa069a2b3e653119e37e207d2

Observation e7811ccb-b8bc-4c31-9af8-acce66108131 · outbound

This paper cites TalkingGaussian: Structure-Persistent 3D Talking Head Synthesis via Gaussian Splatting.

SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers TalkingGaussian: Structure-Persistent 3D Talking Head Synthesis via Gaussian Splatting

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-07T12:01:06.890022Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:01:06.890022Z digest=sha256:dc9dd7ccf5676ec821b3d79fd9ce92335975f08630dad37f8dd95b0ce918e2fc

Observation 1b47b76c-b73d-4402-87bb-2eea3da8d6cf · outbound

This paper cites Learning a model of facial shape and expression from 4d scans.ACM Trans.

SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers Learning a model of facial shape and expression from 4d scans.ACM Trans

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-07T12:01:06.956820Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:01:06.956820Z digest=sha256:6e69eb6e55ec9e332001f231f9e2ad51e8c4f15db19d90886c5a6e6e46204e68

Observation 14975a58-5155-44b6-901d-3338eb87cc2e · outbound

This paper cites Omnihuman-1: Rethinking the scaling-up of one-stage conditioned human animation models, 2025.

SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers Omnihuman-1: Rethinking the scaling-up of one-stage conditioned human animation models, 2025

Reference 38

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T12:01:14.360029Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-07T12:01:07.042283Z digest=sha256:9334fdef748403b53938428945f390d4d9e27155dcf3be58876804e72bf817e2

Observation fe03e516-e660-49f5-b0ab-28728adcb9ac · outbound

This paper cites Flow Matching for Generative Modeling.

SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers Flow Matching for Generative Modeling

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-07T12:01:07.094496Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:01:07.094496Z digest=sha256:c9744fa187573550e4cdc1e25f1d4677a96ca438638902c9ae411aa36713c257

Observation 800eea90-808a-45e7-b61e-bcd224ae6bfd · outbound

This paper cites Timestep Embedding Tells: It's Time to Cache for Video Diffusion Model.

SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers Timestep Embedding Tells: It's Time to Cache for Video Diffusion Model

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-07T12:01:07.173781Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:01:07.173781Z digest=sha256:22a9f464364eb39b12ba10ce25b374a3fd8c16305eab41eeb9a709b48baf3c4d

Observation 3a80e1e8-b2fc-4b43-aa6f-13d79eb19bff · outbound

This paper cites Moda: Mapping-once audio- driven portrait animation with dual attentions.

SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers Moda: Mapping-once audio- driven portrait animation with dual attentions

Reference 41

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T12:01:14.190565Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-07T12:01:07.249929Z digest=sha256:7dbc4406cb8077aba0000b50c7581e0d8ffa68e8f8553b65a89e7dc1c3190ebf

Observation 74a95d57-eb40-48c1-8976-88b356343155 · outbound

This paper cites Live speech portraits: real-time photorealistic talking-head animation.ACM Transactions on Graphics (ToG), 40(6):1–17, 2021.

SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers Live speech portraits: real-time photorealistic talking-head animation.ACM Transactions on Graphics (ToG), 40(6):1–17, 2021

Reference 42

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T12:01:13.952818Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-07T12:01:07.331183Z digest=sha256:a7d88491ac86344595eefa5841b6d7c3ceb6a049bf761bc064102bc78d64cfe8

Observation df620f67-8d1b-4205-98dc-3ddcfe928ae3 · outbound

This paper cites Pixel codec avatars.

SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers Pixel codec avatars

Reference 43

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T12:01:13.722317Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-07T12:01:07.418254Z digest=sha256:0685a1885a74b8690e1b0e94940053bdfdf963679783ff574031b73e3e7e1468

Observation 7cbe88cb-eafd-47a0-82a9-be069f4087ca · outbound

This paper cites Styletalk: One-shot talking head generation with controllable speaking styles.

SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers Styletalk: One-shot talking head generation with controllable speaking styles

Reference 44

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T12:01:13.445427Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-07T12:01:07.475665Z digest=sha256:f1723682b818b38cc6431cc9fd96b898022e5b1a0eaa765b5c6324048f495b38

Observation 5b524bad-e05e-4c5b-82cf-4f52c311a11b · outbound

This paper cites DreamTalk: When Emotional Talking Head Generation Meets Diffusion Probabilistic Models.

SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers DreamTalk: When Emotional Talking Head Generation Meets Diffusion Probabilistic Models

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-07T12:01:07.552280Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:01:07.552280Z digest=sha256:637a024cd5630f3478d0c2e91f8adf496edaf782f7e6e23aac311236c1626cfe

Observation b491905f-e470-4cb2-a8d4-ab33c83b2819 · outbound

This paper cites Nerf: Representing scenes as neural radiance fields for view synthesis.

SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers Nerf: Representing scenes as neural radiance fields for view synthesis

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-07T12:01:07.669803Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:01:07.669803Z digest=sha256:0928cbba0874444f4324aae9e9dbceb039d93f4f326070b44ab732f0ef28e7ce

Observation 89d54c32-20a1-4d3f-8165-98039b15531d · outbound

This paper cites Scalable diffusion models with transformers.

SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers Scalable diffusion models with transformers

Reference 47

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T12:01:13.233371Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-07T12:01:07.720769Z digest=sha256:269bb47519e4b47ba0589540e3a4e5ce879fa3e1d814714168fa4e4d556e20eb

Observation 038adc5b-50c4-4171-a42a-02f6a61dfaf7 · outbound

This paper cites Synctalk: The devil is in the synchronization for talking head synthesis.

SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers Synctalk: The devil is in the synchronization for talking head synthesis

Reference 48

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T12:01:13.042259Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-07T12:01:07.764696Z digest=sha256:95c9dfcfbfb79a6b5c38a5742b25ea464fe57183d55587cea2b0b39e07627a68

Observation 47f55df0-4e7f-40be-b0c3-5216353557df · outbound

This paper cites Emotalk: Speech-driven emotional disentanglement for 3d face animation.

SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers Emotalk: Speech-driven emotional disentanglement for 3d face animation

Reference 49

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T12:01:12.895509Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-07T12:01:07.812253Z digest=sha256:287641bfe3eaa319767cfa446adf480d8729e44118a969415429a712807d3b6d

Observation 16317c3c-7c29-483a-ab92-48d8f5d94aa1 · outbound

This paper cites Movie Gen: A Cast of Media Foundation Models.

SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers Movie Gen: A Cast of Media Foundation Models

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-07T12:01:07.866515Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:01:07.866515Z digest=sha256:52f155db2a3ac6e274ca5b465e33afd116c51688822b99507b1db567ee46912c

Observation 480e6963-8300-4990-b826-fe3a48def1ac · outbound

This paper cites MovieCharacter: A Tuning-Free Framework for Controllable Character Video Synthesis.

SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers MovieCharacter: A Tuning-Free Framework for Controllable Character Video Synthesis

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-07T12:01:07.916907Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:01:07.916907Z digest=sha256:322fe68da1bf27c43817a8ca3fd085bcacd7fd4852504a58b211d1c7333cac15

Observation 8697d019-ad12-4a05-8c31-75557fe4b10d · outbound

This paper cites SkyReels-A1: Expressive Portrait Animation in Video Diffusion Transformers.

SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers SkyReels-A1: Expressive Portrait Animation in Video Diffusion Transformers

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-07T12:01:07.948041Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:01:07.948041Z digest=sha256:26a03b5f1353e880f385527cb2c94d7bdae6ba298b10a97d5dd5867e989649b4

Observation 564fe11f-0334-4575-9643-06fef90f614d · outbound

This paper cites Robust speech recognition via large-scale weak supervision.

SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers Robust speech recognition via large-scale weak supervision

Reference 53

Resolution
unresolved
no resolver link, observed 2026-08-07T12:01:08.022078Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:01:08.022078Z digest=sha256:4da29a5b354c8e804014f6e7fc7f129ebd6323495859845abbd66d7aab9411bf

Observation 67cddcfa-9b75-43f7-81b9-640aa62b749e · outbound

This paper cites What role can avatars play in e-mental health interventions? exploring new models of client–therapist interaction.Frontiers in Psychiatry, 7:186, 2016.

SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers What role can avatars play in e-mental health interventions? exploring new models of client–therapist interaction.Frontiers in Psychiatry, 7:186, 2016

Reference 54

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T12:01:12.658036Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-07T12:01:08.066203Z digest=sha256:dd860ca44295c8d94fb45f943c4dc13a38aafe1b8846d644d754eb7c8f41a3e0

Observation 83bc4b14-d6cc-472d-932e-9acd5622bbec · outbound

This paper cites High- resolution image synthesis with latent diffusion models.

SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers High- resolution image synthesis with latent diffusion models

Reference 55

Resolution
unresolved
no resolver link, observed 2026-08-07T12:01:08.118208Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:01:08.118208Z digest=sha256:582d587b2417a96a5b1a1f74b4a455c09933cd3e6992ede0ff16373f7de54bcc

Observation 4e4907f8-4b5e-4997-9001-5d198d5a6821 · outbound

This paper cites Audio-driven dubbing for user generated contents via style-aware semi-parametric synthesis.IEEE Transactions on Circuits and Systems for Video Technology, 33(3):1247–1261, 2022.

SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers Audio-driven dubbing for user generated contents via style-aware semi-parametric synthesis.IEEE Transactions on Circuits and Systems for Video Technology, 33(3):1247–1261, 2022

Reference 56

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T12:01:12.413991Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-07T12:01:08.178368Z digest=sha256:eb732de2454f88055dacc20acaf3c01d79f925c60f4bb9cee47835a3d6fd48f8

Observation 35f01443-daac-45b5-8b08-a7dc58d68c7f · outbound

This paper cites Audio-driven High-resolution Seamless Talking Head Video Editing via StyleGAN.

SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers Audio-driven High-resolution Seamless Talking Head Video Editing via StyleGAN

Reference 57

Resolution
verified exact
local_arxiv, observed 2026-08-07T12:01:10.171923Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-07T12:01:08.213996Z digest=sha256:4a25c48db67763570fc5378ef836a1a02bf38479ab656f73c1a4c0e33d656b7c

Observation 64137b0e-2f89-4712-8445-429e7625541b · outbound

This paper cites Roformer: Enhanced transformer with rotary position embedding.Neurocomputing, 568:127063, 2024.

SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers Roformer: Enhanced transformer with rotary position embedding.Neurocomputing, 568:127063, 2024

Reference 58

Resolution
unresolved
no resolver link, observed 2026-08-07T12:01:08.261036Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:01:08.261036Z digest=sha256:f2e72793fe3a3b237fcbd90de841ae151ce88eb3252c9f3db5e0cf9d5f22e111

Observation da075765-8bee-4534-a681-bf727410007c · outbound

This paper cites EMO: Emote Portrait Alive -- Generating Expressive Portrait Videos with Audio2Video Diffusion Model under Weak Conditions.

SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers EMO: Emote Portrait Alive -- Generating Expressive Portrait Videos with Audio2Video Diffusion Model under Weak Conditions

Reference 59

Resolution
unresolved
no resolver link, observed 2026-08-07T12:01:08.319003Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:01:08.319003Z digest=sha256:7bf65bc4b1ae021605ff52c9e21e11886a0dc4c15b9aa1293ccc074c25de74c0

Observation 506bcbd1-e816-4aa5-b6b7-125fb1d175d8 · outbound

This paper cites Nonlinear 3d face morphable model.

SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers Nonlinear 3d face morphable model

Reference 60

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T12:01:12.052762Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-07T12:01:08.365172Z digest=sha256:ce281395ee1fe057389f9c08373ab143b9126ca3d111c636ae447ad7c3c82946

Observation 2d1ebd9a-f3b2-4fd0-abeb-7ed6dcd73987 · outbound

This paper cites Fvd: A new metric for video generation.

SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers Fvd: A new metric for video generation

Reference 61

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T12:01:11.720900Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-07T12:01:08.427473Z digest=sha256:b7e0d00a3ce1bec2fdad288e3a665f9a07b27458cec940940ce528317000849d

Observation 789024b5-367d-4b6b-ac4d-5409abc2e1e7 · outbound

This paper cites Wan: Open and Advanced Large-Scale Video Generative Models.

SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers Wan: Open and Advanced Large-Scale Video Generative Models

Reference 62

Resolution
unresolved
no resolver link, observed 2026-08-07T12:01:08.462691Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:01:08.462691Z digest=sha256:86f596ac607ceed8a0e0e08b68a7bf27603ef0b525b6ea9efe8474b4ae6c36a2

Observation d072b7de-f82f-4ae4-b929-62e7ced42bc0 · outbound

This paper cites V-Express: Conditional Dropout for Progressive Training of Portrait Video Generation.

SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers V-Express: Conditional Dropout for Progressive Training of Portrait Video Generation

Reference 63

Resolution
unresolved
no resolver link, observed 2026-08-07T12:01:08.482037Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:01:08.482037Z digest=sha256:291565a1d2b304a080f1a55dc96e5e05cd53a85d34abdc9ed3336fe44a7301ae

Observation 046874be-8b90-4980-bbf8-202b867cb7a3 · outbound

This paper cites Seeing what you said: Talking face generation guided by a lip reading expert.

SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers Seeing what you said: Talking face generation guided by a lip reading expert

Reference 64

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T12:01:11.391506Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-07T12:01:08.513318Z digest=sha256:7a5b30dae1e07649ae67fc5649e9fd6af9d6108535ede32df032f5d6da2e70ba

Observation 005dad01-d72c-4c8f-a3ec-0c0f2d47335a · outbound

This paper cites FantasyTalking: Realistic Talking Portrait Generation via Coherent Motion Synthesis.

SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers FantasyTalking: Realistic Talking Portrait Generation via Coherent Motion Synthesis

Reference 65

Resolution
unresolved
no resolver link, observed 2026-08-07T12:01:08.579080Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:01:08.579080Z digest=sha256:310099485e464bfc6d245f6fabc00254ddd3d8f6e6818a655213f58a1b0f75a2

Observation 45a057ed-6cca-4212-b8c6-a5f4821867dc · outbound

This paper cites One-shot free-view neural talking-head synthesis for video conferencing.

SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers One-shot free-view neural talking-head synthesis for video conferencing

Reference 66

Resolution
unresolved
no resolver link, observed 2026-08-07T12:01:08.629999Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:01:08.629999Z digest=sha256:f09899cfa92e1a3339a0e3952285bec6f366aa91111fd5e737c662576a610b44

Observation 0465191f-b30f-46b5-aa31-73b4e528087b · outbound

This paper cites MagicVideo-V2: Multi-Stage High-Aesthetic Video Generation.

SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers MagicVideo-V2: Multi-Stage High-Aesthetic Video Generation

Reference 67

Resolution
unresolved
no resolver link, observed 2026-08-07T12:01:08.685760Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:01:08.685760Z digest=sha256:91420ca6e74f3e5acf2662f4f9dd2dab63ecbb24d7f0179a28de275e0e3dc446

Observation fb09a09f-5380-400b-b2e2-df521df8918a · outbound

This paper cites Panda: A gigapixel-level human-centric video dataset.

SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers Panda: A gigapixel-level human-centric video dataset

Reference 68

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T12:01:11.058377Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-07T12:01:08.738549Z digest=sha256:c86ea786e7356527e6aaff2ad367e6a51b57d57d8d40daec322fb59fb9da1f19

Observation 67cedca9-14dc-44f2-b242-aff70eb235b5 · outbound

This paper cites AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation.

SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation

Reference 69

Resolution
unresolved
no resolver link, observed 2026-08-07T12:01:08.767656Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:01:08.767656Z digest=sha256:4753f8479501138465a9c5e614dda2afbec9357f4dc191e15eb9c8347c4200b9

Observation b0558abf-a37e-4cfd-bcad-e2474b2d8609 · outbound

This paper cites Q-Align: Teaching LMMs for Visual Scoring via Discrete Text-Defined Levels.

SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers Q-Align: Teaching LMMs for Visual Scoring via Discrete Text-Defined Levels

Reference 70

Resolution
unresolved
no resolver link, observed 2026-08-07T12:01:08.824060Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:01:08.824060Z digest=sha256:e2ab92d523a2833128a574cdf61af7090c6c92aa5fa032891c54850398da23e6

Observation 4b103765-461f-4928-83fb-877d4d0092b0 · outbound

This paper cites Codetalker: Speech-driven 3d facial animation with discrete motion prior.

SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers Codetalker: Speech-driven 3d facial animation with discrete motion prior

Reference 71

Resolution
unresolved
no resolver link, observed 2026-08-07T12:01:08.881537Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:01:08.881537Z digest=sha256:64b60a636f99bb48b399e267b451c622bc4bb922ec7d6ef6a6b153ac49385ac8

Observation baffbf9b-c211-4082-9dd4-470662f66343 · outbound

This paper cites Easyanimate: A high-performance long video generation method based on transformer architecture.arXiv preprint arXiv:2405.18991, 2024.

SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers Easyanimate: A high-performance long video generation method based on transformer architecture.arXiv preprint arXiv:2405.18991, 2024

Reference 72

Resolution
unresolved
no resolver link, observed 2026-08-07T12:01:08.918756Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:01:08.918756Z digest=sha256:48957ecc1fe37609f7489a904e0e8a189367a69dbdb6a4a9d010f55c5d9a2985

Observation 8d643f5b-4a3d-4e4a-aa01-157731aff9db · outbound

This paper cites MegActor-$\Sigma$: Unlocking Flexible Mixed-Modal Control in Portrait Animation with Diffusion Transformer.

SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers MegActor-$\Sigma$: Unlocking Flexible Mixed-Modal Control in Portrait Animation with Diffusion Transformer

Reference 73

Resolution
unresolved
no resolver link, observed 2026-08-07T12:01:08.976755Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:01:08.976755Z digest=sha256:df10d181d10981907cd27210e2f09c2ae5aa1d575c6d549b9dcda7225aa533ce

Observation 23f9d9b7-859d-4575-9660-e8b056d0648d · outbound

This paper cites Effective whole-body pose estimation with two-stages distillation.

SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers Effective whole-body pose estimation with two-stages distillation

Reference 74

Resolution
unresolved
no resolver link, observed 2026-08-07T12:01:09.030034Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:01:09.030034Z digest=sha256:39f0527944209dbaf0853700abc608e74d725845bbb751f71b6b94aac742ac4b

Observation a472f972-a72d-429c-813d-7718562ddb21 · outbound

This paper cites CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer.

SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer

Reference 75

Resolution
unresolved
no resolver link, observed 2026-08-07T12:01:09.064934Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:01:09.064934Z digest=sha256:d0bb2ae76ef88a8f98027c4c54fb84414d4c9bdc248453c60060058236f31cec

Observation f7ed62cd-0952-48cc-a2e7-53fa20bc31c0 · outbound

This paper cites Real3D-Portrait: One-shot Realistic 3D Talking Portrait Synthesis.

SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers Real3D-Portrait: One-shot Realistic 3D Talking Portrait Synthesis

Reference 76

Resolution
unresolved
no resolver link, observed 2026-08-07T12:01:09.114112Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:01:09.114112Z digest=sha256:ad365db7c4dfc88f53083188dcfa9f1bd060cb81f942b156f9e87aebd19066c3

Observation 6948a4df-cda3-4398-8093-8a432a7d9b6c · outbound

This paper cites MagicInfinite: Generating Infinite Talking Videos with Your Words and Voice.

SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers MagicInfinite: Generating Infinite Talking Videos with Your Words and Voice

Reference 77

Resolution
unresolved
no resolver link, observed 2026-08-07T12:01:09.189058Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:01:09.189058Z digest=sha256:fb9abaa49925a18647d134595c135bb049d81c4541c95ab76536f0aeb318ad89

Observation b2abdc3d-d2eb-4e01-9ac0-bdbff7effd07 · outbound

This paper cites Sadtalker: Learning realistic 3d motion coefficients for stylized audio-driven single image talking face animation.

SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers Sadtalker: Learning realistic 3d motion coefficients for stylized audio-driven single image talking face animation

Reference 78

Resolution
unresolved
no resolver link, observed 2026-08-07T12:01:09.233037Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:01:09.233037Z digest=sha256:bc285a81fb69d1034392479c568c39c6415c7923c9d1df23fd1d1a7691bb7dbe

Observation 4ebb5b4c-f4f4-439a-8f30-e00783eeb534 · outbound

This paper cites Flow-guided one-shot talking face generation with a high-resolution audio-visual dataset.

SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers Flow-guided one-shot talking face generation with a high-resolution audio-visual dataset

Reference 79

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T12:01:10.709000Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-07T12:01:09.303110Z digest=sha256:a1e912d5c35a8b2cf04beef27200cb16154a46c54a67c966d25e79a9c5f3aa9b

Observation 9c612247-a0e5-44b8-83f3-b9743f5235ed · outbound

This paper cites MEMO: Memory-Guided Diffusion for Expressive Talking Video Generation.

SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers MEMO: Memory-Guided Diffusion for Expressive Talking Video Generation

Reference 80

Resolution
unresolved
no resolver link, observed 2026-08-07T12:01:09.337775Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:01:09.337775Z digest=sha256:dd644b827b91b28089794c9163504880880b64e4f4931e9a73bc159f4dd877e4

Observation 46f733c2-0eb1-4197-9ca4-6e096bada95d · outbound

This paper cites Guided Score identity Distillation for Data-Free One-Step Text-to-Image Generation.

SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers Guided Score identity Distillation for Data-Free One-Step Text-to-Image Generation

Reference 81

Resolution
unresolved
no resolver link, observed 2026-08-07T12:01:09.387556Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:01:09.387556Z digest=sha256:f0be46b4bcc5313825e87f5f3dc7686ecf92e3cb46e99edb107eddb01dddf300

Observation 0f82b039-061e-4c9a-ab90-560cdd0c3a34 · outbound

This paper cites Allegro: Open the Black Box of Commercial-Level Video Generation Model.

SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers Allegro: Open the Black Box of Commercial-Level Video Generation Model

Reference 82

Resolution
unresolved
no resolver link, observed 2026-08-07T12:01:09.480529Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:01:09.480529Z digest=sha256:664db743bd0c754175879642a8151734658b09545e67a67912dfac3b90879706

Observation 1b6aa078-8e17-4763-873c-33eaaa507789 · outbound

This paper cites Learn2Talk: 3D Talking Face Learns from 2D Talking Face.

SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers Learn2Talk: 3D Talking Face Learns from 2D Talking Face

Reference 83

Resolution
verified exact
local_arxiv, observed 2026-08-07T12:01:09.744867Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-07T12:01:09.561127Z digest=sha256:8b642031152463471c1df05b2b712d7173ca24045dc2a2876f9b222e5de96699

Pith citing papers

Observation ab09bcec-d3a2-40f7-9f11-4c6229fdc586 · inbound

InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing cites this paper.

InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers

Reference 5

Resolution
metadata mismatch
local_arxiv, observed 2026-08-05T18:50:16.689954Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-05T18:50:16.222228Z digest=sha256:29295323e7ca12f14b757a8babe29cae5fd26a56571fee04bb0ed608c3805dcf

Observation 74bb284c-54b8-47aa-99d2-c80300e66aec · inbound

Vorch-IR: Long-Form Unified Multimodal Identity Replacement Video Generation cites this paper.

Vorch-IR: Long-Form Unified Multimodal Identity Replacement Video Generation SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers

Reference 2025

Resolution
unresolved
no resolver link, observed 2026-08-08T04:54:58.643717Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T04:54:58.643717Z digest=sha256:ec65156afc7fb0b62b9d362d951e1a840bd9e1a7cd177dbd925a924543b88507

Observation 085f7559-aa81-4101-b8b4-4d893902df8a · inbound

Vorch-Omni: Multi-Task Orchestration of Sight and Sound cites this paper.

Vorch-Omni: Multi-Task Orchestration of Sight and Sound SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-07T23:16:52.478464Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T23:16:52.478464Z digest=sha256:1812f9e6c8f07449f65f1315846f4992232fdfe882d7578cc33c6a974e7a60fa