Pith. sign in

Paper Citation Record · LEDGER

StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation

As of 16 August 2026, this Paper Citation Record lists 84 of 84 outbound references and 17 inbound Pith citation observations for arXiv:2508.08248.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2508.08248 v1

Coverage vector

measured 84 of 84 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-15T17:42:41.582183Z

measured 101 of 101 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-16T06:30:59.297886+00:00

measured 17 of 17 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-05T18:50:16.277725Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-04T10:09:44.567147Z

Reference resolution

84 of 84 outbound references displayed

  • verified exact0
  • verified fuzzy26
  • unresolved57
  • parse uncertain0
  • malformed identifier1
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation c69d9c9a-e8d8-4be0-aabd-54805ae88541 · outbound

This paper cites wav2vec 2.0: A framework for self-supervised learning of speech representations.

StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation wav2vec 2.0: A framework for self-supervised learning of speech representations

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-15T17:42:40.977975Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T17:42:40.977975Z digest=sha256:14629ad86fd675fefee3f8183b0fdba7a4875d9bd8b6f1521b52f6ee509424d0

Observation 839ed655-b625-40d3-8c84-1b09e90b6ab1 · outbound

This paper cites Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models.

StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-15T17:42:40.986932Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T17:42:40.986932Z digest=sha256:ff5ac630d59b13f74e761e1fde31dee334d608b8e4c19784e03e62a5a650cd9d

Observation 2ea6c613-1f58-41af-9fc4-8a9e08090952 · outbound

This paper cites Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets.

StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-15T17:42:40.994346Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T17:42:40.994346Z digest=sha256:855220dc3b24a65b4ee6bb0493928e518793de3893a4d086aa1120218c44dcbf

Observation 30a331b9-5a08-4b31-8ecf-63a8e2a5e77e · outbound

This paper cites Generating long videos of dynamic scenes.

StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation Generating long videos of dynamic scenes

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-15T17:42:41.000851Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T17:42:41.000851Z digest=sha256:82ee2898ef9bfa03f77ff085912d258decc1163a1a0196c8ce5afbe2fe7cc343

Observation 445ad62c-1336-4621-92b7-ae5303613afb · outbound

This paper cites Video generation models as world simulators.

StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation Video generation models as world simulators

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-15T17:42:41.009011Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T17:42:41.009011Z digest=sha256:7a0254d878d6f9036e7049da7b52037dc0276d28af7428270d82d9cffa5a01f2

Observation 0301e8b9-c0db-4444-bf66-3fabdaf38afe · outbound

This paper cites HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters.

StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-15T17:42:41.019438Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T17:42:41.019438Z digest=sha256:0a19e31d48fcc29e6e91e8c6cf04534e98fdbd4bc01edc4891ed3cd209fda438

Observation bf44ecba-104e-458e-83c4-0b6e6a565173 · outbound

This paper cites Echomimic: Lifelike audio-driven portrait animations through editable landmark conditions.

StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation Echomimic: Lifelike audio-driven portrait animations through editable landmark conditions

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-15T17:42:41.027937Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T17:42:41.027937Z digest=sha256:10eb1634183db5bf351d66d251a9550f981474fd8c7ee09bd4e699171dedd0d9

Observation c81f3aaf-6730-45c4-9239-864a998b2baa · outbound

This paper cites Videoretalking: Audio-based lip synchronization for talking head video editing in the wild.

StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation Videoretalking: Audio-based lip synchronization for talking head video editing in the wild

Reference 8

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T17:42:43.400049Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T17:42:41.038911Z digest=sha256:cc7e5e527df0e26576fe0ad8ca2d5b708fb0550bf4efef43d500bb08d1f346ee

Observation 7e04000d-896b-4062-b456-7d911fb07474 · outbound

This paper cites Out of time: auto- mated lip sync in the wild.

StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation Out of time: auto- mated lip sync in the wild

Reference 9

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T17:42:43.383022Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T17:42:41.043125Z digest=sha256:5ed8b0bc42fbfee38350cd2ccc336df3ba405aa11e3f10765ea44618405404c9

Observation cdd1946f-fe20-4967-8b3f-87f02a926cb4 · outbound

This paper cites Hallo3: Highly dynamic and realistic portrait image animation with video diffusion transformer.

StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation Hallo3: Highly dynamic and realistic portrait image animation with video diffusion transformer

Reference 10

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T17:42:43.364898Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T17:42:41.048540Z digest=sha256:f39b3158e229b7e8dc89f0b07b37b1dd2580fe0ffbf594d9720c8488ddb9790f

Observation 7ea366e1-574e-4abc-9a2d-2dc7bc378601 · outbound

This paper cites Arcface: Additive angular margin loss for deep face recognition.

StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation Arcface: Additive angular margin loss for deep face recognition

Reference 11

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T17:42:43.344353Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T17:42:41.055606Z digest=sha256:f811d001997a8c61e71e767b9ad0e97c450945930bc29fa9894af9f419cbaed2

Observation a073ec08-2b39-4528-ad1c-3ad2e510a00c · outbound

This paper cites Diffusion models beat gans on image synthesis.

StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation Diffusion models beat gans on image synthesis

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-15T17:42:41.061019Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T17:42:41.061019Z digest=sha256:dc67723364e4ed962e46e6d5fa8017419ce5afd98f8c0923768d479f14686fb2

Observation 60559ac8-fca3-4e86-bc87-26c13f473b96 · outbound

This paper cites Looking to Listen at the Cocktail Party: A Speaker-Independent Audio-Visual Model for Speech Separation.

StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation Looking to Listen at the Cocktail Party: A Speaker-Independent Audio-Visual Model for Speech Separation

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-15T17:42:41.066587Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T17:42:41.066587Z digest=sha256:d9e7dea0e7ad9fadec1f6df635d7b517029c103ecacc5b5a0bfb51b47f046f59

Observation d14334f3-82d7-4d7c-807f-ce0f470b4a1b · outbound

This paper cites OmniAvatar: Efficient Audio-Driven Avatar Video Generation with Adaptive Body Animation.

StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation OmniAvatar: Efficient Audio-Driven Avatar Video Generation with Adaptive Body Animation

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-15T17:42:41.074231Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T17:42:41.074231Z digest=sha256:a89e151872f40187a3130ec3c4873a92f3c99b54e394b5e64e6fd7696788e058

Observation 9bbeb57a-835d-40c2-87ad-61aa52dbd58c · outbound

This paper cites Toontalker: Cross-domain face reenactment.

StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation Toontalker: Cross-domain face reenactment

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T17:42:43.312956Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T17:42:41.085158Z digest=sha256:9b17246da22329bd87d9710ba1ebef6e3e11a431dfd0220ac6f3c80f0c9c09be

Observation da82443d-76c7-4a9d-8083-2525ccdffdfb · outbound

This paper cites Generative adversarial networks.

StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation Generative adversarial networks

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-15T17:42:41.093788Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T17:42:41.093788Z digest=sha256:5eb66b992ca9c2282a68dec06c052ce38874a7bc63ebc84ba3cf94d75fef9f49

Observation d28bd83a-dd02-4ebd-aeb2-c54ec80b9402 · outbound

This paper cites Stylesync: High-fidelity generalized and personalized lip sync in style-based genera- tor.

StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation Stylesync: High-fidelity generalized and personalized lip sync in style-based genera- tor

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T17:42:43.286683Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T17:42:41.100639Z digest=sha256:e28e0131f78817bba4d2c8c331414122ab860c7594d251d46ab20126ccaadd34

Observation 6c035ce8-f966-443a-8bce-d0115951af3d · outbound

This paper cites Animatediff: Animate your personalized text-to- image diffusion models without specific tuning.

StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation Animatediff: Animate your personalized text-to- image diffusion models without specific tuning

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-15T17:42:41.108850Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T17:42:41.108850Z digest=sha256:ced0e7bacc28302ecf1cf547f79638c98503fc9b71f09a3b73ca7fce6bf1b568

Observation 72d6ce37-226d-49f0-b124-a05aabce093c · outbound

This paper cites Flexible diffusion modeling of long videos.

StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation Flexible diffusion modeling of long videos

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T17:42:43.238950Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T17:42:41.118692Z digest=sha256:9efe3beb895307c4745d92199135f3dd548e664eef2ab9bf15a9bb04ba997b16

Observation 7036fcbe-ce39-4256-9ac7-6fed99f94b43 · outbound

This paper cites Streamingt2v: Con- sistent, dynamic, and extendable long video generation from text.

StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation Streamingt2v: Con- sistent, dynamic, and extendable long video generation from text

Reference 20

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T17:42:43.217461Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T17:42:41.125330Z digest=sha256:b7c7d648214e27f4a64f6124df96fb83f6d9bf2d7555b69f7df1f8d4c22fab0e

Observation 803e194a-f107-4bc8-a5f0-980f52030910 · outbound

This paper cites Prompt-to-Prompt Image Editing with Cross Attention Control.

StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation Prompt-to-Prompt Image Editing with Cross Attention Control

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-15T17:42:41.131913Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T17:42:41.131913Z digest=sha256:4d44583500c9ba6ac7101da97a5a630d729c267d101a5091c78497b8da1239c6

Observation cab46965-6aea-445a-8f6d-e25e56b2fa94 · outbound

This paper cites Gans trained by a two time-scale update rule converge to a local nash equilib- rium.

StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation Gans trained by a two time-scale update rule converge to a local nash equilib- rium

Reference 22

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T17:42:43.200218Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T17:42:41.136957Z digest=sha256:7632297983c15eadcb190af699dc002abd0b99a2d58666c80961b408ab17d2ab

Observation f8fd2980-13dc-4fcb-ab8c-33476defee4d · outbound

This paper cites Classifier-Free Diffusion Guidance.

StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation Classifier-Free Diffusion Guidance

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-15T17:42:41.142589Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T17:42:41.142589Z digest=sha256:ab55f1b20969ca6823c35892e60f2706ad53a04216c576b0c73623c3ab25f5ee

Observation 91c0c1ab-017a-4166-a72a-2f914d74ca87 · outbound

This paper cites Denoising diffu- sion probabilistic models.

StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation Denoising diffu- sion probabilistic models

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-15T17:42:41.148234Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T17:42:41.148234Z digest=sha256:d38bbb436dc80901c9048e5c132ecb46c722358012f3709719d6239d1519dcde

Observation 5a105573-43e1-4e47-b88b-cdfa8b707e0d · outbound

This paper cites Cascaded diffusion models for high fidelity image generation.

StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation Cascaded diffusion models for high fidelity image generation

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-15T17:42:41.153667Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T17:42:41.153667Z digest=sha256:ea28f5c212a0698b4ba2c665ea3476baadf3061b077c862e0d8bbe7b25b76cb8

Observation 3b2a53f8-9892-44e3-956c-e211d0b7aef3 · outbound

This paper cites CogVideo: Large-scale Pretraining for Text-to-Video Generation via Transformers.

StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation CogVideo: Large-scale Pretraining for Text-to-Video Generation via Transformers

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-15T17:42:41.158973Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T17:42:41.158973Z digest=sha256:4336dc64f77f358193c5f83f98130c7aafa7e4b86e01cb7f07e25512eeb0e1c3

Observation 3534acf8-c5ac-428a-844d-93c2408f5574 · outbound

This paper cites Sonic: Shifting focus to global audio perception in portrait animation.

StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation Sonic: Shifting focus to global audio perception in portrait animation

Reference 27

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T17:42:43.149756Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T17:42:41.164964Z digest=sha256:e0db05b3a272860c78eedc2030c9a8f9572755e1a6369161968a2e790b0a2c14

Observation d894506c-96fe-4f5a-8312-9ad9101195b8 · outbound

This paper cites Loopy: Taming Audio-Driven Portrait Avatar with Long-Term Motion Dependency.

StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation Loopy: Taming Audio-Driven Portrait Avatar with Long-Term Motion Dependency

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-15T17:42:41.170885Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T17:42:41.170885Z digest=sha256:421e8b963a2a53ab9f9fa7f98cd95da4ccf25c400e7971d5063c16f39e13b7bf

Observation 0cffeb50-3fb2-4455-a4c1-c8848a00ed8c · outbound

This paper cites HunyuanVideo: A Systematic Framework For Large Video Generative Models.

StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation HunyuanVideo: A Systematic Framework For Large Video Generative Models

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-15T17:42:41.175771Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T17:42:41.175771Z digest=sha256:c8539080f9faa4f84293ebc2c720a19a8b23ccf6ee7d18270237595f94ca02bc

Observation 9138e043-e8ec-4bc5-b3e6-77ca87adc231 · outbound

This paper cites Let Them Talk: Audio-Driven Multi-Person Conversational Video Generation.

StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation Let Them Talk: Audio-Driven Multi-Person Conversational Video Generation

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-15T17:42:41.185614Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T17:42:41.185614Z digest=sha256:1d5eaac0a2fe5af819940cf5f73dc2651bbc2b2ba685242fbd64318b2aef901e

Observation cc0d49b1-2c46-4716-99d2-147d8707d79d · outbound

This paper cites Latentsync: Audio conditioned latent diffusion models for lip sync.

StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation Latentsync: Audio conditioned latent diffusion models for lip sync

Reference 31

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T17:42:43.122274Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T17:42:41.192847Z digest=sha256:268b7bb0e4988a713ef4e5f365cebbc7bab70271029c7bc7cffd0f2fff00d08f

Observation 27ece483-d068-4a83-aa1e-e6782a867e94 · outbound

This paper cites Magicmotion: Controllable video genera- tion with dense-to-sparse trajectory guidance.

StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation Magicmotion: Controllable video genera- tion with dense-to-sparse trajectory guidance

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-15T17:42:41.199776Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T17:42:41.199776Z digest=sha256:cea38838666303d0403fc2f43342cabc59569ce88c41dbaba00545b988742441

Observation 5aac34a8-2018-454c-b74d-15b8bddc6393 · outbound

This paper cites Cyberhost: A one-stage diffusion framework for audio-driven talking body generation.

StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation Cyberhost: A one-stage diffusion framework for audio-driven talking body generation

Reference 33

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T17:42:43.104390Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T17:42:41.204451Z digest=sha256:b6d9f89aac5947ace231082410cfd6216bd7d7824554942a59d89684068c2163

Observation 3e09dfa9-6353-457d-90a2-c6c8a7e1481e · outbound

This paper cites OmniHuman-1: Rethinking the Scaling-Up of One-Stage Conditioned Human Animation Models.

StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation OmniHuman-1: Rethinking the Scaling-Up of One-Stage Conditioned Human Animation Models

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-15T17:42:41.213234Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T17:42:41.213234Z digest=sha256:c4d2c506505879a9e5fda3c0ebdecdec0bcf8d722cd3ba001ccbbded95c55f7d

Observation 8b05a0bf-5f53-4b93-a819-6fbc1823d3be · outbound

This paper cites Flow Matching for Generative Modeling.

StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation Flow Matching for Generative Modeling

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-15T17:42:41.220929Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T17:42:41.220929Z digest=sha256:9affb2f47a2112f776ab51e636e137f26d8898f020595f18370cf2df547af144

Observation f2cf013e-3fff-4eb4-9ca7-031795e4bd32 · outbound

This paper cites Phantom: Subject-consistent video generation via cross-modal alignment.

StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation Phantom: Subject-consistent video generation via cross-modal alignment

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-15T17:42:41.228859Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T17:42:41.228859Z digest=sha256:c8a47446f178d0d4ff962a3061f5e1e209e73aa34e15baf26eb65e1393e4aa39

Observation 2226dbe0-4063-43ef-951a-efe244027142 · outbound

This paper cites FreeLong++: Training-Free Long Video Generation via Multi-band SpectralFusion.

StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation FreeLong++: Training-Free Long Video Generation via Multi-band SpectralFusion

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-15T17:42:41.236296Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T17:42:41.236296Z digest=sha256:ff0a9a06a46166c9c2bc8987028abf00e6c4f932c82fa38aa51f89fda8065341

Observation b61a8e22-2179-4def-9901-440d8b9091d0 · outbound

This paper cites Free- long: Training-free long video generation with spectralblend temporal attention.

StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation Free- long: Training-free long video generation with spectralblend temporal attention

Reference 38

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T17:42:43.086814Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T17:42:41.242401Z digest=sha256:f4f7e77b18bd32a25bd6bba0c61fd7f620567612653dd4089db1c52bdf340a13

Observation a9db388b-756c-4ee9-9607-2c955c912bda · outbound

This paper cites MediaPipe: A Framework for Building Perception Pipelines.

StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation MediaPipe: A Framework for Building Perception Pipelines

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-15T17:42:41.253407Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T17:42:41.253407Z digest=sha256:892909c0bc7ab05bde08127d52ca2827b8d23005921247245d3aefec45efb57c

Observation bed4585e-a05a-4b7f-8bfe-675551417018 · outbound

This paper cites Sdedit: Guided image synthesis and editing with stochastic differential equa- tions.

StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation Sdedit: Guided image synthesis and editing with stochastic differential equa- tions

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-15T17:42:41.261434Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T17:42:41.261434Z digest=sha256:70d15ba19878b0da6f3d8252641a032fe79f068f9979510a7192765047d3af01

Observation a1f00a5f-109c-42c5-9620-489fdbe9ddfe · outbound

This paper cites Echomimicv2: Towards striking, simplified, and semi-body human animation.

StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation Echomimicv2: Towards striking, simplified, and semi-body human animation

Reference 41

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T17:42:43.058999Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T17:42:41.272599Z digest=sha256:6863304cc87c52cc594abe21fd30dbe5a3cc07d973b736e6336477a696906e06

Observation 547de582-4b04-4f7e-b6f0-1330e679cb6a · outbound

This paper cites Improved denoising diffusion probabilistic models.

StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation Improved denoising diffusion probabilistic models

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-15T17:42:41.287406Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T17:42:41.287406Z digest=sha256:8152ac44682d2fb445a31d08f50de1466470aae453ea061590e1d5eb436362bd

Observation cbeb2677-d5da-47a7-b42d-0a588335d867 · outbound

This paper cites Dpe: Disen- tanglement of pose and expression for general video portrait editing.

StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation Dpe: Disen- tanglement of pose and expression for general video portrait editing

Reference 43

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T17:42:43.029288Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T17:42:41.292896Z digest=sha256:91a55023f45fbbca715d82a796eab5c4799107ac318ab4f2afed13d876a74b1d

Observation 77036fed-9c00-4116-8d2f-118fbb7f08d0 · outbound

This paper cites Scalable diffusion models with transformers.

StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation Scalable diffusion models with transformers

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-15T17:42:41.301544Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T17:42:41.301544Z digest=sha256:db73050f984eb7e672a142e3932f61f8b7e6f37b5eb0fe2dcfaa031caf27d94d

Observation 5982f282-a473-4b47-b71c-4563fe7b585f · outbound

This paper cites FreeNoise: Tuning-Free Longer Video Diffusion via Noise Rescheduling.

StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation FreeNoise: Tuning-Free Longer Video Diffusion via Noise Rescheduling

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-15T17:42:41.307854Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T17:42:41.307854Z digest=sha256:82e340f529520e6cf5f34ba65da6b953059de928b15c88078e34381ae9029fc3

Observation f3d31eb9-738a-46fa-89f8-245afc1bfde6 · outbound

This paper cites Learn- ing transferable visual models from natural language super- vision.

StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation Learn- ing transferable visual models from natural language super- vision

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-15T17:42:41.312923Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T17:42:41.312923Z digest=sha256:9ec8adf40c2f17d83e006f7f5e7a1de7e3d0a9e2e7318883846e5ad666f9a18a

Observation 2e556a22-bd27-4978-b46e-e7ac1b40a17a · outbound

This paper cites High-resolution image syn- thesis with latent diffusion models.

StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation High-resolution image syn- thesis with latent diffusion models

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-15T17:42:41.322616Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T17:42:41.322616Z digest=sha256:f21655f4d4f4a9191c7d301879fe43cfb8cdfabda7c168b2ddd7d848e8625c3e

Observation f11d1407-3a35-46fd-abea-c6187b901027 · outbound

This paper cites The ciede2000 color-difference formula: Implementation notes, supplementary test data, and mathematical observations.

StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation The ciede2000 color-difference formula: Implementation notes, supplementary test data, and mathematical observations

Reference 48

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T17:42:42.975577Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T17:42:41.328388Z digest=sha256:e7b9f9deb26178822e17666267d4afdce5872229617b92c1fa8d8e5da65d4fa1

Observation 8db41c13-255c-4ebb-8668-6a139372ddbb · outbound

This paper cites Make-A-Video: Text-to-Video Generation without Text-Video Data.

StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation Make-A-Video: Text-to-Video Generation without Text-Video Data

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-15T17:42:41.338827Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T17:42:41.338827Z digest=sha256:3455addc339a4fae8f952e28735abc7a8ef6f146ef37a87cf86fe9249e1cdc52

Observation 4cf07a77-92dd-44ae-a749-67f9d9f99562 · outbound

This paper cites Stylegan-v: A continuous video generator with the price, image quality and perks of stylegan2.

StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation Stylegan-v: A continuous video generator with the price, image quality and perks of stylegan2

Reference 50

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T17:42:42.958485Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T17:42:41.346383Z digest=sha256:c9a8b824d91dee7a611d60400b225aa9ac03b55713029fcdc4c061144c25c874

Observation 2d8a0822-61a7-457f-829b-037d357af0b3 · outbound

This paper cites Denois- ing diffusion implicit models.

StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation Denois- ing diffusion implicit models

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-15T17:42:41.353304Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T17:42:41.353304Z digest=sha256:24c573b0e4bd5c272084deb41604254c7dc3050b72d15312f318525d005cd857

Observation 1b0ab518-e0da-4b86-a50d-cd2e61c133f6 · outbound

This paper cites an unresolved cited work.

StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation Unresolved cited work

Reference 52

Resolution
unresolved
raw_fallback, observed 2026-08-15T17:42:42.924782Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T17:42:41.359057Z digest=sha256:028da2d6a05fbd873c709a717e56151c3a09e7c7c5d67e3bd9c724344cf022d4

Observation a31dc00a-7c83-40d1-a81c-850ad50a2d8d · outbound

This paper cites Score-based generative modeling through stochastic differential equa- tions.

StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation Score-based generative modeling through stochastic differential equa- tions

Reference 53

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T17:42:42.907752Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T17:42:41.363005Z digest=sha256:9798513cdf121287fafc7680959147da8ca6d2c820086038c18d7118813628ac

Observation 26b9c185-c63c-42d8-8626-bfaef8680b1c · outbound

This paper cites Emo: Emote portrait alive generating expressive portrait videos with audio2video diffusion model under weak conditions.

StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation Emo: Emote portrait alive generating expressive portrait videos with audio2video diffusion model under weak conditions

Reference 54

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T17:42:42.890553Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T17:42:41.368359Z digest=sha256:8ff587e88e881bd42b723c4c24de097cc35d09a490f185824d1b2797fc302ba1

Observation 9bcad11c-f830-4166-bf18-e135b4ea1500 · outbound

This paper cites EMO2: End-Effector Guided Audio-Driven Avatar Video Generation.

StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation EMO2: End-Effector Guided Audio-Driven Avatar Video Generation

Reference 55

Resolution
unresolved
no resolver link, observed 2026-08-15T17:42:41.372498Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T17:42:41.372498Z digest=sha256:b59c2ddadf6fba6d88e9701087322a1cd5ab94bff929a9d128a2588555c778be

Observation 07b1d5e9-3f7f-4165-83f4-b143ddae5752 · outbound

This paper cites Nonlinear 3d face morphable model.

StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation Nonlinear 3d face morphable model

Reference 56

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T17:42:42.871456Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T17:42:41.382516Z digest=sha256:ccb43d294a68f318cd8e1457caa8fa044cde94409869df3083f87bdbde6fded5

Observation 50654bc0-6ac5-402a-870d-f4b451e28703 · outbound

This paper cites Consistent view synthesis with pose-guided diffusion models.

StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation Consistent view synthesis with pose-guided diffusion models

Reference 57

Resolution
unresolved
no resolver link, observed 2026-08-15T17:42:41.389449Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T17:42:41.389449Z digest=sha256:b5838bbeda35bd8cd74b6a558745155a620774fef786e4a9905a531a807c2248

Observation 16f1a1fe-f5b1-4144-b0fc-3c5c05ca5566 · outbound

This paper cites Implicit temporal modeling with learn- able alignment for video recognition.

StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation Implicit temporal modeling with learn- able alignment for video recognition

Reference 58

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T17:42:42.823995Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T17:42:41.394772Z digest=sha256:8d3c11d1a5b66a0ad0aee2e5dc27186ae3a087125dc5fc81977170c1b50f8d42

Observation ffba25b5-47c9-4d14-87a8-ca07947658b2 · outbound

This paper cites Motioneditor: Editing video motion via content-aware diffusion.

StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation Motioneditor: Editing video motion via content-aware diffusion

Reference 59

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T17:42:42.799720Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T17:42:41.399732Z digest=sha256:7cf72c0db43c90606c63bd92c7b8ce64f862522f08866da6f0953ee5414218f7

Observation b69dfc47-5a15-4e94-b6b0-c71bc700ad63 · outbound

This paper cites MotionFollower: Editing Video Motion via Lightweight Score-Guided Diffusion.

StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation MotionFollower: Editing Video Motion via Lightweight Score-Guided Diffusion

Reference 60

Resolution
unresolved
no resolver link, observed 2026-08-15T17:42:41.405005Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T17:42:41.405005Z digest=sha256:50704a941d8da89568591a95383c5c2e610f5f62d89079de4c6d4166863fb127

Observation a1ff18fd-b0cb-47b8-9568-6cb46e6f2aaa · outbound

This paper cites Stableanimator: High- quality identity-preserving human image animation.

StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation Stableanimator: High- quality identity-preserving human image animation

Reference 61

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T17:42:42.774818Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T17:42:41.412853Z digest=sha256:15e05033881ae7406e604f4d4baf9888516e3676021e7786b68f419c254b709f

Observation c39e102a-8d8f-46cd-b47d-ffdb66bc6924 · outbound

This paper cites StableAnimator++: Overcoming Pose Misalignment and Face Distortion for Human Image Animation.

StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation StableAnimator++: Overcoming Pose Misalignment and Face Distortion for Human Image Animation

Reference 62

Resolution
unresolved
no resolver link, observed 2026-08-15T17:42:41.421511Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T17:42:41.421511Z digest=sha256:4e24cf35366ddc95494c4a9386c6c1b2e0372be7e65f6252e71a615a5ee7a503

Observation d41c2c12-8a3a-49ac-beff-c3ca9504c309 · outbound

This paper cites Plug-and-play diffusion features for text-driven image-to-image translation.

StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation Plug-and-play diffusion features for text-driven image-to-image translation

Reference 63

Resolution
unresolved
no resolver link, observed 2026-08-15T17:42:41.429589Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T17:42:41.429589Z digest=sha256:0e6f6182588a74a30adbd6894a4913774e0f17618e1619dd88a1248d41afba91

Observation a2ce71c7-6984-4cd2-b9f6-99a20a8765a5 · outbound

This paper cites Towards Accurate Generative Models of Video: A New Metric & Challenges.

StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation Towards Accurate Generative Models of Video: A New Metric & Challenges

Reference 64

Resolution
unresolved
no resolver link, observed 2026-08-15T17:42:41.438169Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T17:42:41.438169Z digest=sha256:4aba657ac9c242cea3f20ae1724039ffbfa875bf5f628286ce5e5d93502fd1c4

Observation 7f6b674d-beb3-441d-81c4-42d8e84c8299 · outbound

This paper cites Mcvd-masked conditional video diffusion for prediction, generation, and interpolation.

StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation Mcvd-masked conditional video diffusion for prediction, generation, and interpolation

Reference 65

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T17:42:42.726162Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T17:42:41.447198Z digest=sha256:e2e1eb354ec0f7eeb7ecab88b5523c2636e1197ccece2accc325e13deae67d29

Observation 2c3792d9-8b8f-4bf9-a43e-ee69ed0b428a · outbound

This paper cites Wan: Open and Advanced Large-Scale Video Generative Models.

StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation Wan: Open and Advanced Large-Scale Video Generative Models

Reference 66

Resolution
unresolved
no resolver link, observed 2026-08-15T17:42:41.456020Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T17:42:41.456020Z digest=sha256:49469eb782dff7b2229b285cbc279566c498b35534ce254b404ca63ed5945591

Observation bd0d2812-c1c1-47d0-9891-71082cba091c · outbound

This paper cites V-Express: Conditional Dropout for Progressive Training of Portrait Video Generation.

StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation V-Express: Conditional Dropout for Progressive Training of Portrait Video Generation

Reference 67

Resolution
unresolved
no resolver link, observed 2026-08-15T17:42:41.462685Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T17:42:41.462685Z digest=sha256:c48017d06c63f827b77c489db0d4dfc3db090a27ae9b322fc20c68ac486c2794

Observation 2f87002f-248d-49e6-a418-524b8d753cb8 · outbound

This paper cites Gen-L-Video: Multi-Text to Long Video Generation via Temporal Co-Denoising.

StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation Gen-L-Video: Multi-Text to Long Video Generation via Temporal Co-Denoising

Reference 68

Resolution
unresolved
no resolver link, observed 2026-08-15T17:42:41.473093Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T17:42:41.473093Z digest=sha256:79012c5c4c8833d483b6440bafede522d600bab816ec9a41ee4250e0009a1088

Observation 44aa8c24-ece2-49ce-8ead-a57373747d9f · outbound

This paper cites FantasyTalking: Realistic Talking Portrait Generation via Coherent Motion Synthesis.

StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation FantasyTalking: Realistic Talking Portrait Generation via Coherent Motion Synthesis

Reference 69

Resolution
unresolved
no resolver link, observed 2026-08-15T17:42:41.482324Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T17:42:41.482324Z digest=sha256:5277ea1043a4b92d04c4aa326cfad9937f666ce46863f203ac9c8f37d2404055

Observation 4904f2f5-c3d1-4421-969e-d2129fac2ac6 · outbound

This paper cites MagicVideo-V2: Multi-Stage High-Aesthetic Video Generation.

StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation MagicVideo-V2: Multi-Stage High-Aesthetic Video Generation

Reference 70

Resolution
unresolved
no resolver link, observed 2026-08-15T17:42:41.488248Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T17:42:41.488248Z digest=sha256:96e24d77ebd8253566ba9e924bceaa96889b025cb3eaf9f0af7fa83733a4a068

Observation 3eb16f06-c3a9-4754-9280-3cd1f15c2b3c · outbound

This paper cites AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation.

StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation

Reference 71

Resolution
unresolved
no resolver link, observed 2026-08-15T17:42:41.497013Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T17:42:41.497013Z digest=sha256:157c9fc5ed1399fc5a5a09014edc8f8ee1e3108ec419454918f5aa7caff49960

Observation a3464d82-edd5-4f5c-b21f-a51c0721ea37 · outbound

This paper cites GenRec: Unifying Video Generation and Recognition with Diffusion Models.

StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation GenRec: Unifying Video Generation and Recognition with Diffusion Models

Reference 72

Resolution
unresolved
no resolver link, observed 2026-08-15T17:42:41.503095Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T17:42:41.503095Z digest=sha256:afab5ae3016b59a6bf17674af30f40ea1f65643bcc7b7d7ba84912deea2700e3

Observation ffb11c49-9339-4e67-8c00-cfa27a4b8669 · outbound

This paper cites Q-Align: Teaching LMMs for Visual Scoring via Discrete Text-Defined Levels.

StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation Q-Align: Teaching LMMs for Visual Scoring via Discrete Text-Defined Levels

Reference 73

Resolution
unresolved
no resolver link, observed 2026-08-15T17:42:41.509127Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T17:42:41.509127Z digest=sha256:5d18272fc76edd8ec0fafbe05a0f81ff13572092313d334f1f304109ef3d559c

Observation 8e327c62-b157-4ba9-b99f-34ecbdecf7b1 · outbound

This paper cites Tune-a-video: One-shot tuning of image diffusion models for text-to-video generation.

StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation Tune-a-video: One-shot tuning of image diffusion models for text-to-video generation

Reference 74

Resolution
unresolved
no resolver link, observed 2026-08-15T17:42:41.517365Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T17:42:41.517365Z digest=sha256:e3a3e4c1f18d521427e6aaccfc8e7d15329b585fe2d73b6a32abdc8143c1f14f

Observation 8d106cc3-614e-4854-bd3e-65617fb31f80 · outbound

This paper cites Simda: Simple diffusion adapter for efficient video generation.

StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation Simda: Simple diffusion adapter for efficient video generation

Reference 75

Resolution
unresolved
no resolver link, observed 2026-08-15T17:42:41.524102Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T17:42:41.524102Z digest=sha256:c77838ab0b0363cc101824f220c813ac8faf1a4b5e3ffd2dc5e37c00dae2b6cd

Observation d284f919-94c6-461c-b9d3-571eab5a3249 · outbound

This paper cites AID: Adapting Image2Video Diffusion Models for Instruction-guided Video Prediction.

StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation AID: Adapting Image2Video Diffusion Models for Instruction-guided Video Prediction

Reference 76

Resolution
unresolved
no resolver link, observed 2026-08-15T17:42:41.530158Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T17:42:41.530158Z digest=sha256:da56c8817cb4b37707279bfb90bdba8266f19ebef788ddd933eec80f9f1f0786

Observation f07ec46e-52d9-48ec-965e-b7092b5d942f · outbound

This paper cites A survey on video dif- fusion models.

StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation A survey on video dif- fusion models

Reference 77

Resolution
unresolved
no resolver link, observed 2026-08-15T17:42:41.534966Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T17:42:41.534966Z digest=sha256:cf097a9cc2cbff1eb5b32585dae4c0acd20a05f693a752a5fa7df6877786f334

Observation 02deb5b9-eea9-47b5-ae19-f1c4d44d3b15 · outbound

This paper cites Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation.

StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation

Reference 78

Resolution
unresolved
no resolver link, observed 2026-08-15T17:42:41.546662Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T17:42:41.546662Z digest=sha256:72b35f6e940c6e10fdcbaec23273ef026717a8c61058e12eb1b9734868914359

Observation f288fd74-31d8-49d4-b74c-ae1adaecb16f · outbound

This paper cites Styleheat: One-shot high-resolution editable talking face generation via pre-trained stylegan.

StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation Styleheat: One-shot high-resolution editable talking face generation via pre-trained stylegan

Reference 79

Resolution
unresolved
no resolver link, observed 2026-08-15T17:42:41.552940Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T17:42:41.552940Z digest=sha256:7dd02fc3e7e56ea63f41cf3d6f005254ff3f30ddcd4bc26fc9305fcdf3c33582

Observation 79648eae-37e2-4909-a2ad-c67d51290553 · outbound

This paper cites NUWA-XL: Diffusion over Diffusion for eXtremely Long Video Generation.

StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation NUWA-XL: Diffusion over Diffusion for eXtremely Long Video Generation

Reference 80

Resolution
unresolved
no resolver link, observed 2026-08-15T17:42:41.557669Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T17:42:41.557669Z digest=sha256:11a897bcbee6ecaae57ef09993fba580020b0fcc65e2fbb28da3b4b3dec8dbf9

Observation 8689081b-384b-4425-bebb-6b28001a4854 · outbound

This paper cites Sadtalker: Learning realistic 3d motion coefficients for stylized audio- driven single image talking face animation.

StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation Sadtalker: Learning realistic 3d motion coefficients for stylized audio- driven single image talking face animation

Reference 81

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T17:42:42.624372Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T17:42:41.562763Z digest=sha256:745303344106d56059f046b38f62716f1a0ea61a2ea8106a696ff3f7172275af

Observation ff19d0d5-0d32-4afa-bc7a-9c384a3ee816 · outbound

This paper cites Flow-guided one-shot talking face generation with a high- resolution audio-visual dataset.

StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation Flow-guided one-shot talking face generation with a high- resolution audio-visual dataset

Reference 82

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T17:42:42.602316Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T17:42:41.569709Z digest=sha256:cf452b81cf2db0c4446d4fd3fcee02849cef61e89dfc3aaf068ef3590bac4109

Observation e8e94383-fe78-4bc8-bd01-740988c66392 · outbound

This paper cites CelebV- HQ: A large-scale video facial attributes dataset.

StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation CelebV- HQ: A large-scale video facial attributes dataset

Reference 83

Resolution
unresolved
no resolver link, observed 2026-08-15T17:42:41.574634Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T17:42:41.574634Z digest=sha256:c0142244ad7590eef3328194fa8dc79a6961ed3ab5a0af57719846969a2f7f00

Observation 104a45ee-66df-4cce-90a9-e66aa390890b · outbound

This paper cites The pipeline of our DWSW.

StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation The pipeline of our DWSW

Reference 2022

Resolution
malformed identifier
raw_fallback, observed 2026-08-15T17:42:42.562975Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T17:42:41.582183Z digest=sha256:94d028ac06c8fc652ca74cf435514952cd5e30cce3033c7098f168604ffc3b8b

Pith citing papers

Observation 3867d22b-ded7-46e9-8995-d25f4a2a5c66 · inbound

InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing cites this paper.

InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-05T18:50:16.277725Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T18:50:16.277725Z digest=sha256:18d4735b49406844ec1ee34b79098de45ca474108f83f6047db1ca3d075b1a34

Observation 95b1e05f-eddc-4452-abb5-874588786b7c · inbound

Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length cites this paper.

Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation

Reference 38

Resolution
verified exact
arxiv_id, observed 2026-05-17T01:58:51.431375Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-05-17T01:56:44.123092Z digest=sha256:04d88eaf2158d989f6a3d55eda5b5223367cd56898c9656f714e26d7dc176871

Observation 8ec5b113-bb5e-47f2-8bf6-efac56ea9c95 · inbound

Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length cites this paper.

Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-03T18:39:42.827965Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T18:39:42.827965Z digest=sha256:e15362eeb8f883ebee46c6d55812d98b4b99ea5c794f16c233b688743ca3d12e

Observation 97f45688-6707-4187-a32c-b9c874fd9b36 · inbound

EchoTorrent: Towards Swift, Sustained, and Streaming Multi-Modal Video Generation cites this paper.

EchoTorrent: Towards Swift, Sustained, and Streaming Multi-Modal Video Generation StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation

Reference 67

Resolution
verified exact
arxiv_id, observed 2026-05-15T22:20:22.337035Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-05-15T22:20:16.320171Z digest=sha256:a93ab937e8cb6b96de614af4018bb1ca45f31c1da5b72cd77ad621f6d3a3dbd9

Observation 0dca01a7-ebba-41ad-80c9-80227c101f9a · inbound

LPM 1.0: Video-based Character Performance Model cites this paper.

LPM 1.0: Video-based Character Performance Model StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation

Reference 42

Resolution
verified exact
arxiv_id, observed 2026-05-11T07:30:59.745520Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-05-10T17:09:17.360697Z digest=sha256:536c522711c06397e685786be22afcc0c690ca46d18a2835c37a5d22be79fe7f

Observation a7811afd-0fe4-4b0d-b4b6-474076ee2096 · inbound

Beyond Monologue: Interactive Talking-Listening Avatar Generation with Conversational Audio Context-Aware Kernels cites this paper.

Beyond Monologue: Interactive Talking-Listening Avatar Generation with Conversational Audio Context-Aware Kernels StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation

Reference 37

Resolution
verified exact
arxiv_id, observed 2026-05-11T10:56:01.789969Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-05-10T15:16:53.603971Z digest=sha256:6bee5890915e48347b9e71766d14837b659e31347582a2a662f80092e60b5cd8

Observation 5a6660e7-8455-412e-89ec-95778ab559f1 · inbound

Generate Your Talking Avatar from Video Reference cites this paper.

Generate Your Talking Avatar from Video Reference StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation

Reference 40

Resolution
verified exact
arxiv_id, observed 2026-05-12T10:36:29.782699Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-05-07T05:32:04.519820Z digest=sha256:1e42cd3fe2a5e5a297634e5586cc6107e629920afe4031d3d7d70ff183ad80e5

Observation 17b4dcd5-78dc-4c14-8a80-fa2c44e27751 · inbound

AsymTalker: Identity-Consistent Long-Term Talking Head Generation via Asymmetric Distillation cites this paper.

AsymTalker: Identity-Consistent Long-Term Talking Head Generation via Asymmetric Distillation StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation

Reference 15

Resolution
verified exact
arxiv_id, observed 2026-05-11T15:16:11.280276Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-05-09T20:19:39.565157Z digest=sha256:6668b40d2a4fb62c91dd4ae1f8e561026dcaa4585428162bc06300efb24fabca

Observation d8a846bd-998e-44ee-adaa-e18a85700ebd · inbound

AsymTalker: Identity-Consistent Long-Term Talking Head Generation via Asymmetric Distillation cites this paper.

AsymTalker: Identity-Consistent Long-Term Talking Head Generation via Asymmetric Distillation StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation

Reference 37

Resolution
verified exact
arxiv_id, observed 2026-05-11T03:45:57.481774Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-05-11T02:18:58.996355Z digest=sha256:1ee8167a0723a9d520b39daab2ebedb5f252252ef2c3711fcb720d1e3ea13ab4

Observation 0a3db86e-b4d9-4a68-af6a-e10d66743f1b · inbound

Image-to-Video Diffusion: From Foundations to Open Frontiers cites this paper.

Image-to-Video Diffusion: From Foundations to Open Frontiers StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation

Reference 78

Resolution
verified exact
arxiv_id, observed 2026-05-20T15:08:24.856783Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-05-20T15:06:02.084336Z digest=sha256:1bd4ad800bcc7dff56ad783c9954ec1e8d87aaf32bd7887c3f3478370fb0c48b

Observation 53551e67-339a-4fc9-bed6-9674e8388422 · inbound

InteractiveAvatar: Real-Time Streaming Video Generation for Consistent and Intent-Aware Avatars cites this paper.

InteractiveAvatar: Real-Time Streaming Video Generation for Consistent and Intent-Aware Avatars StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation

Reference 28

Resolution
verified exact
arxiv_id, observed 2026-07-04T10:09:44.568665Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-06-26T09:09:06.925645Z digest=sha256:66eda9f135a4d43acf93400cc80f18ef20d817daa3c86bbe86e923d0239816b9

Observation 9a9792b3-173e-4831-91b2-a9640321a30f · inbound

InteractiveAvatar: Real-Time Streaming Video Generation for Consistent and Intent-Aware Avatars cites this paper.

InteractiveAvatar: Real-Time Streaming Video Generation for Consistent and Intent-Aware Avatars StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation

Reference 29

Resolution
verified exact
arxiv_id, observed 2026-07-01T07:05:29.169879Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-07-01T07:00:53.496569Z digest=sha256:1a0f662cf9cd9e461bae8f67e139d4911ce0c20e312dcd2ef8deb61e6101548c

Observation 882b8048-118f-4e4d-b328-edbcce86fe21 · inbound

Ink3D: Sculpting 3D Assets with Extremely Complex Textures via Video Generative Models cites this paper.

Ink3D: Sculpting 3D Assets with Extremely Complex Textures via Video Generative Models StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation

Reference 48

Resolution
metadata mismatch
arxiv_id, observed 2026-07-02T13:16:58.053509Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-07-02T13:16:16.676244Z digest=sha256:296c6d21a5aa32528e08e55429122b808be0a8177d481a7dbd27ed5fcd5fe433

Observation a78fb0de-f7ef-4e3a-939b-6d205f4d7b00 · inbound

Vidu S1: A Real-Time Interactive Video Generation Model cites this paper.

Vidu S1: A Real-Time Interactive Video Generation Model StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation

Reference 58

Resolution
unresolved
no resolver link, observed 2026-07-12T04:46:57.581402Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T04:46:57.581402Z digest=sha256:fde2dd6d8936e705f6ad171e125f5f95b21f1d993a83865dbe06340cebdbd9b8

Observation 62419ab1-da7b-4530-bc99-fb8a4f8b7e7d · inbound

Vidu S1: A Real-Time Interactive Video Generation Model cites this paper.

Vidu S1: A Real-Time Interactive Video Generation Model StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation

Reference 57

Resolution
unresolved
no resolver link, observed 2026-08-02T08:56:31.619017Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T08:56:31.619017Z digest=sha256:6d8e882af0980ab489cfb2ca9b172420d17fcee49780bc89f27c5777b55b62dd

Observation 94d852de-3e98-4137-a7e8-b664b39ce114 · inbound

TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation cites this paper.

TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation

Reference 13

Resolution
unresolved
no resolver link, observed 2026-07-31T17:08:11.848419Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-07-31T17:08:11.848419Z digest=sha256:a7baec3de6bce56eb834783cef3fd13f4e1addf1c8006d6f748d9d762646bde0

Observation 2e8ea637-0565-4ec6-8a97-7e2bd55c7ba1 · inbound

LeapTalk: Breaking the Latency-Quality Trade-off in Talking Head Generation cites this paper.

LeapTalk: Breaking the Latency-Quality Trade-off in Talking Head Generation StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation

Reference 121

Resolution
unresolved
no resolver link, observed 2026-08-04T01:32:13.172496Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T01:32:13.172496Z digest=sha256:d95a4adb3de58b54b833ec51c07e67f20c0b2e24a67301a6db0bbd9a78c852ef