Pith. sign in

Paper Citation Record · LEDGER

JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1

As of 15 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 0 inbound Pith citation observations for arXiv:2507.20987.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2507.20987 v2

Coverage vector

measured 46 of 46 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-06T13:07:28.484954Z

measured 46 of 46 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-15T06:32:42.880941+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

46 of 46 outbound references displayed

  • verified exact0
  • verified fuzzy12
  • unresolved33
  • parse uncertain1
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 9f8eb8eb-c408-4fb3-bb91-927714cba40b · outbound

This paper cites Better speech synthesis through scaling.

JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1 Better speech synthesis through scaling

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-06T13:07:28.255179Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:07:28.255179Z digest=sha256:954e2427611c81eea6336aa196a9d124b9a64cd292796ac2dbf68eec04e38ad2

Observation cd26a3e6-2448-4370-a2b4-b2a57e88ba75 · outbound

This paper cites Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets.

JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1 Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-06T13:07:28.260898Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:07:28.260898Z digest=sha256:b088fe949f232e0ede0eb72a1cfd26d2b253f7f481fe2fb51066c1a9703f0ceb

Observation aec1f845-f6cc-4662-82f3-f749f6d011ae · outbound

This paper cites Caron, H.

JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1 Caron, H

Reference 3

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T13:07:29.518833Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T13:07:28.266713Z digest=sha256:9f40e2d837940dc1e8a04121caefde1f30319a7104dff03adcf53c949313ece5

Observation 9ba859d9-ee81-4060-baff-24242d4ea042 · outbound

This paper cites Hallo2: Long-Duration and High-Resolution Audio-Driven Portrait Image Animation.

JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1 Hallo2: Long-Duration and High-Resolution Audio-Driven Portrait Image Animation

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-06T13:07:28.271561Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:07:28.271561Z digest=sha256:16e2e5fb2bdddf026e745ab72f78477517fcb61093fa46fbc3d4db527a070180

Observation 46495ded-d986-48ff-b43c-3b6fce0f7863 · outbound

This paper cites Hallo3: Highly Dynamic and Realistic Portrait Image Animation with Video Diffusion Transformer.

JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1 Hallo3: Highly Dynamic and Realistic Portrait Image Animation with Video Diffusion Transformer

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-06T13:07:28.276988Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:07:28.276988Z digest=sha256:7e55242e9036e89e4ef0271e928d54f2cdbb9c925668bbc453f0697631a85dea

Observation dc3a77a5-34c6-4bfa-8977-54a8de14198f · outbound

This paper cites DeepMind.

JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1 DeepMind

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T13:07:29.501595Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T13:07:28.282867Z digest=sha256:9d0e7e74218d4e5a90c5ab8d67027ce784250ba86c7847cbccf7c35600158653

Observation 90e4fa50-9a9a-4a34-b8f1-b5d945e5cd43 · outbound

This paper cites Eleven Multilingual v2: A foundational multi- lingual text-to-speech model supporting 29 languages.

JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1 Eleven Multilingual v2: A foundational multi- lingual text-to-speech model supporting 29 languages

Reference 7

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T13:07:29.483611Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T13:07:28.288087Z digest=sha256:d529894ec713f6d346dd01694d25c06e1c48a47484d3bf5cd0f4a3bac50c0aed

Observation 0d58c0c6-b868-4e86-a62e-335215e975b1 · outbound

This paper cites an unresolved cited work.

JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1 Unresolved cited work

Reference 8

Resolution
unresolved
raw_fallback, observed 2026-08-06T13:07:29.464930Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T13:07:28.293808Z digest=sha256:dd454316cb80d4bb3dd364cb6ab2e734d29253f02280122724a762d5e8983c90

Observation 8e0641f0-7e13-4a3d-92ce-7959a053128d · outbound

This paper cites an unresolved cited work.

JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1 Unresolved cited work

Reference 9

Resolution
unresolved
raw_fallback, observed 2026-08-06T13:07:29.447808Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T13:07:28.298680Z digest=sha256:d616fbf14f6b58d8407d69f077531a42d26d18f03094dfa910638a81982380ad

Observation bb966614-8d46-43d4-8541-a0b8d25470cc · outbound

This paper cites MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies.

JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1 MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-06T13:07:28.303813Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:07:28.303813Z digest=sha256:4817dd6046ecf559b2326dcefda7f963ec6ddde843f3514b6818c5f91018c22e

Observation 5b8e0228-cbc8-4122-ac5a-358bf6dfcf9c · outbound

This paper cites Step-Video-TI2V Technical Report: A State-of-the-Art Text-Driven Image-to-Video Generation Model.

JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1 Step-Video-TI2V Technical Report: A State-of-the-Art Text-Driven Image-to-Video Generation Model

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-06T13:07:28.308903Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:07:28.308903Z digest=sha256:62b0bde20788b3a7894835d5d6307beb5ab553be06893304caa78b27e8d2b256

Observation c62460bc-87fe-4d26-96fc-13a071ce6405 · outbound

This paper cites Huynh-Thu and M.

JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1 Huynh-Thu and M

Reference 12

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T13:07:29.430380Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T13:07:28.314402Z digest=sha256:c3de767c1881c33002fbf7eef105f48bd77764235bdc82ccc563da213651539b

Observation d7897926-fa51-4621-b3e6-b33f79123df8 · outbound

This paper cites Sonic: Shifting Focus to Global Audio Perception in Portrait Animation.

JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1 Sonic: Shifting Focus to Global Audio Perception in Portrait Animation

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-06T13:07:28.320448Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:07:28.320448Z digest=sha256:42a182f89e7e34b7514d906e4d4ed7024149deee16d472c5f066ed614f508c9a

Observation 466c15f3-68e5-430a-a523-6f0b68f7208f · outbound

This paper cites Loopy: Taming Audio-Driven Portrait Avatar with Long-Term Motion Dependency.

JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1 Loopy: Taming Audio-Driven Portrait Avatar with Long-Term Motion Dependency

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-06T13:07:28.328153Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:07:28.328153Z digest=sha256:7c5927a08496f80b56dc9605a5234a536dd5e757f5aeef3dae73558f0e27c313

Observation 21564f20-7b37-41e5-a88a-01c967b8ac72 · outbound

This paper cites an unresolved cited work.

JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1 Unresolved cited work

Reference 15

Resolution
unresolved
raw_fallback, observed 2026-08-06T13:07:29.413034Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T13:07:28.336008Z digest=sha256:4af82b182c0db6b3491e56d74b13078c7a21a6221db1dac27a2f4aab0c684d6f

Observation 9aad734f-4aa9-49d6-b058-f8c508a0b8d1 · outbound

This paper cites HunyuanVideo: A Systematic Framework For Large Video Generative Models.

JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1 HunyuanVideo: A Systematic Framework For Large Video Generative Models

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-06T13:07:28.341053Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:07:28.341053Z digest=sha256:db07475700b3c0eadd1ccda754b06269fbc371974f442bba41508c8d5c9dcd1e

Observation 1a359396-9b3a-4e95-887c-2bf2ba39097f · outbound

This paper cites Laion aesthetic predictor.https : / / github.com/LAION-AI/aesthetic-predictor,.

JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1 Laion aesthetic predictor.https : / / github.com/LAION-AI/aesthetic-predictor,

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-06T13:07:28.346244Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:07:28.346244Z digest=sha256:306c9c789e627b9a148f6daae582f8046290a55e3090e64e0b7c85887cf034cf

Observation 00912a17-7a4f-48c1-b26c-328ee3e8e517 · outbound

This paper cites LatentSync: Taming Audio-Conditioned Latent Diffusion Models for Lip Sync with SyncNet Supervision.

JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1 LatentSync: Taming Audio-Conditioned Latent Diffusion Models for Lip Sync with SyncNet Supervision

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-06T13:07:28.356402Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:07:28.356402Z digest=sha256:32ac8dcf333baf8c567e3ca4d373fca93092b7aafa95a164f8ec5086e2977a60

Observation c6c8752d-af4f-44c6-848d-8be9cc31a660 · outbound

This paper cites VideoGen: A Reference-Guided Latent Diffusion Approach for High Definition Text-to-Video Generation.

JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1 VideoGen: A Reference-Guided Latent Diffusion Approach for High Definition Text-to-Video Generation

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-06T13:07:28.361100Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:07:28.361100Z digest=sha256:6db32de9eaa32a55d10401352ca435483212c55f7c182c896238e4c9c03a9ff3

Observation 6d7bc63b-cc26-415a-8776-22e95544bb13 · outbound

This paper cites Li, Z.-L.

JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1 Li, Z.-L

Reference 20

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T13:07:29.365371Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T13:07:28.366070Z digest=sha256:09838d06284ce237f85a27f617a67c1cba0f2376063b63928acd19c41cbb5332

Observation 5071510a-7b7c-4f9b-ae7e-6bffc5a1d227 · outbound

This paper cites an unresolved cited work.

JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1 Unresolved cited work

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-06T13:07:28.370814Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:07:28.370814Z digest=sha256:be77ac6cca4a893d06bda103cf8c99d38a6a505a5402a8fbd90c1d0a4dee46dc

Observation 493cbbe6-407d-4264-9cb9-17e1b0a7a46d · outbound

This paper cites EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge.

JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1 EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-06T13:07:28.375424Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:07:28.375424Z digest=sha256:52ddaf7ee5a387e3d2f09d35ca362f074b05bdda96c9d3d17c19c03ef4e8042b

Observation 249acc42-76b7-431f-9846-9f602c448da1 · outbound

This paper cites an unresolved cited work.

JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1 Unresolved cited work

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-06T13:07:28.384776Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:07:28.384776Z digest=sha256:9b6734d1e3cdecd3944b73bb166897e2e778a72b8bacf48bbd2bb3cf5d46b98f

Observation d65ff508-4c87-4cf0-bbb2-a3828f0ab2e5 · outbound

This paper cites StyleTalker: One-shot Style-based Audio-driven Talking Head Video Generation.

JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1 StyleTalker: One-shot Style-based Audio-driven Talking Head Video Generation

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-06T13:07:28.389538Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:07:28.389538Z digest=sha256:e81e9c43744166aed4263e7362d1c8d83879e84f82b80e31ae8ca0cd3a5733c0

Observation 4b24eed8-d9d4-4bcd-9af6-f624f2a4b329 · outbound

This paper cites GPT-4o-Mini- Audio-Preview: A compact, cost-efficient audio-capable 5 multimodal model.

JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1 GPT-4o-Mini- Audio-Preview: A compact, cost-efficient audio-capable 5 multimodal model

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T13:07:29.332694Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T13:07:28.394030Z digest=sha256:89d6fca612ba8c5b312a721b22f052d40fc51f53b23bcce189ea1e582e018bdc

Observation c36f0941-a34f-487b-9951-f4a20911b540 · outbound

This paper cites Open-Sora 2.0: Training a Commercial-Level Video Generation Model in $200k.

JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1 Open-Sora 2.0: Training a Commercial-Level Video Generation Model in $200k

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-06T13:07:28.398657Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:07:28.398657Z digest=sha256:cfebe1f24406a52afbbbc0586197d4b5aed1a68ebc20cd746c9b39c09b758f00

Observation 5625fff3-0bf1-40cd-92e9-1fc6ebba0e6f · outbound

This paper cites Prajwal, R.

JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1 Prajwal, R

Reference 27

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T13:07:29.316252Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T13:07:28.403719Z digest=sha256:90dfc9895f47e7ca0ed509eefea62e7fe0e4c5fbd0a174820a13cc8fc1584937

Observation 08efa263-aea2-490e-922e-01498341bd55 · outbound

This paper cites Versatile Multimodal Controls for Expressive Talking Human Animation.

JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1 Versatile Multimodal Controls for Expressive Talking Human Animation

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-06T13:07:28.408107Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:07:28.408107Z digest=sha256:ba99fbfde8fb6bd0e56762acc28af967493e9746bdee55ea4fc6ae0a1de6bf1d

Observation 012c4635-443b-4b3d-a756-32c02e46e51c · outbound

This paper cites SkyReels-A1: Expressive Portrait Animation in Video Diffusion Transformers.

JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1 SkyReels-A1: Expressive Portrait Animation in Video Diffusion Transformers

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-06T13:07:28.413224Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:07:28.413224Z digest=sha256:9bb295f0504517e98444e093882ff7a9ba4ee35289dac875ac47671729ad2f0c

Observation 5c9c5499-7162-41be-8e14-9bfc4b43b05a · outbound

This paper cites Radford, J.

JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1 Radford, J

Reference 30

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T13:07:29.299281Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T13:07:28.418061Z digest=sha256:f33d2201370306c21b7752f8d4675262e0c32f8bc829a4dc32c726616b568c08

Observation 1d1b5d94-8103-4b62-a707-d8b6ac5e2323 · outbound

This paper cites Make-A-Video: Text-to-Video Generation without Text-Video Data.

JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1 Make-A-Video: Text-to-Video Generation without Text-Video Data

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-06T13:07:28.422653Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:07:28.422653Z digest=sha256:f7c1178e0cdba75d207d752e0b92e86bfd5146e28f8df43d4dc1d19f932a0605

Observation f891e8f8-1f30-426a-85e8-3b82099ddc4f · outbound

This paper cites Bark: Text-prompted generative audio model.

JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1 Bark: Text-prompted generative audio model

Reference 32

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T13:07:29.281309Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T13:07:28.427315Z digest=sha256:861d34008479443df43ebf554c241099d698d47c3e67fd3ba280008cfd83c471

Observation fafa85cc-e0c0-4ce5-850c-464e45134edd · outbound

This paper cites Teed and J.

JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1 Teed and J

Reference 33

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T13:07:29.263605Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T13:07:28.431928Z digest=sha256:03611350a660f3dba4b71857c4cb3d3423d3581097aea62e91ed3c4acbd6b963

Observation 4494dd48-0f1b-4b3c-bb72-5b9b09201c56 · outbound

This paper cites Google introduces stable gemini 2.5 flash and pro, previews gemini 2.5 flash-lite.The Economic Times (India).

JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1 Google introduces stable gemini 2.5 flash and pro, previews gemini 2.5 flash-lite.The Economic Times (India)

Reference 34

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T13:07:29.247728Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T13:07:28.436864Z digest=sha256:d070ad2fe416ea07fa331eef6f2058dcab2273639f3d10c51935316c16dc9b8d

Observation 17262ae0-cc5e-4735-ba82-327d2cc7e50b · outbound

This paper cites StableAnimator: High-Quality Identity-Preserving Human Image Animation.

JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1 StableAnimator: High-Quality Identity-Preserving Human Image Animation

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-06T13:07:28.441776Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:07:28.441776Z digest=sha256:0aa90a5e2be382431e271a713e03f62aa63ba3e1dd0207e2fedec40b014a39c2

Observation 911f72e8-e992-464b-a06f-98a3a7828c36 · outbound

This paper cites Towards Accurate Generative Models of Video: A New Metric & Challenges.

JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1 Towards Accurate Generative Models of Video: A New Metric & Challenges

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-06T13:07:28.446461Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:07:28.446461Z digest=sha256:c9e1f441e9ac87f909c0331bf7a268390208f5a5839f45b130672c241ea51ca0

Observation b96490e4-aa69-40c6-bacf-c7c7a17f4b8f · outbound

This paper cites Wan: Open and Advanced Large-Scale Video Generative Models.

JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1 Wan: Open and Advanced Large-Scale Video Generative Models

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-06T13:07:28.451541Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:07:28.451541Z digest=sha256:320cb035aaadf1ddb738442f2369de594445d3f6572a00054d0f90c0de15f9b5

Observation f05d9c9e-8209-40d0-92dd-2439c2c20af3 · outbound

This paper cites an unresolved cited work.

JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1 Unresolved cited work

Reference 38

Resolution
unresolved
raw_fallback, observed 2026-08-06T13:07:29.231260Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T13:07:28.455985Z digest=sha256:ccef7fd275118d679ed2bbb01ee460a5a69d929887d189294f918739921ed0fa

Observation 5f57e324-f84c-4947-9944-0fa4a996ba26 · outbound

This paper cites an unresolved cited work.

JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1 Unresolved cited work

Reference 39

Resolution
unresolved
raw_fallback, observed 2026-08-06T13:07:29.215323Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T13:07:28.460499Z digest=sha256:26f4b516b4c05833a4f90e2970a046a62d188b205f94dfb9700004d88da3772c

Observation e2a42bc8-8de1-48c5-86fa-931fa8aea62a · outbound

This paper cites Qwen2.5-Omni Technical Report.

JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1 Qwen2.5-Omni Technical Report

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-06T13:07:28.465203Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:07:28.465203Z digest=sha256:822697b782cc24797a9cd921dc6a887ac72dd28951a92d9ddea24c053e921d9a

Observation 58d16370-0f4a-40c3-99fb-33a481335cdd · outbound

This paper cites CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer.

JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1 CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-06T13:07:28.470675Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:07:28.470675Z digest=sha256:d3ecdd82cf77ee2b4399992f871650abacccc75b2a5930277d2abe3d758c53d0

Observation f0e7c99b-5778-404a-9df4-1a142fa9dfc4 · outbound

This paper cites I2VGen-XL: High-Quality Image-to-Video Synthesis via Cascaded Diffusion Models.

JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1 I2VGen-XL: High-Quality Image-to-Video Synthesis via Cascaded Diffusion Models

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-06T13:07:28.475660Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:07:28.475660Z digest=sha256:87bcaeec12364c5f41bec966823650551ff8fecf9eed9663e2997cb51ae6048d

Observation a65d3b03-373a-4102-baa0-0f2224156e3b · outbound

This paper cites UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation.

JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1 UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-06T13:07:28.480478Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:07:28.480478Z digest=sha256:7bfd9ef2f47bff8a6b4c5e086fb8e65bdac9929fc30eb75996b49c827992ec43

Observation 6d3e204d-6399-4076-b7db-fb482bc4b46a · outbound

This paper cites an unresolved cited work.

JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1 Unresolved cited work

Reference 44

Resolution
unresolved
raw_fallback, observed 2026-08-06T13:07:29.199169Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T13:07:28.484954Z digest=sha256:ad20590568c7976e06bc509045751dbfa57e93348b3ec8d0f64a890e28aff6eb

Observation 49282654-e179-469a-b54b-936a4e4ae31d · outbound

This paper cites an unresolved cited work.

JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1 Unresolved cited work

Reference 2022

Resolution
parse uncertain
raw_fallback, observed 2026-08-06T13:07:29.382684Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T13:07:28.351198Z digest=sha256:166561dfdb3010ef59483f033e7ac0a07bf2480b7a4c3e8520d40f0e6751fa32

Observation bbd571e3-6e76-491f-80dc-fdf992197bc7 · outbound

This paper cites org / abs / 2505.

JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1 org / abs / 2505

Reference 2025

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T13:07:29.349083Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-06T13:07:28.380312Z digest=sha256:99aed6253c04f4f86535d9522c1c021667afb810b8caab5d33769f7aee128090

Pith citing papers

No inbound Pith citation observations are available.