{"as_of":"2026-08-15T13:21:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5210752c4e3fdbe6a1b7a907f6f1f69fcc04842a0986bd4d42d3f206a9d84b01","coverage":[{"denominator":112,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T13:10:19.735725Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.20953/citation-record","integrity":"/paper/2507.20953/integrity","json":"/paper/2507.20953/citation-record.json","paper":"/paper/2507.20953"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:18.321025Z","title":"Deep audio-visual speech recognition","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-13T11:52:28.198939Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:18.321025Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:ef9a2ceea0e81ad88102e74a1694d22d7ecbb4dce70383a531c2b0a87b1314f1","observation_id":"c9836d1c-40de-4247-93fa-1901ad46d875","resolution":{"observed_at":"2026-08-06T13:10:18.321025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:18.394341Z","title":"Self-supervised learning of audio- visual objects from video","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-13T11:52:28.198939Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:18.394341Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:19a2e7f3974c3593c04d0fce722787a57ca158bfdaba163f9b7abd8a5bdc3327","observation_id":"e44250eb-0e52-4ba4-9828-3f35e7705e3a","resolution":{"observed_at":"2026-08-06T13:10:18.394341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:18.435036Z","title":"A morphable model for the synthesis of 3d faces","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-13T11:52:28.198939Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:18.435036Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:87b2c7b6bf3bf261760247e93f30e1e613b13a263aa240c9b256e458ce504d74","observation_id":"a26a3b85-3e13-4604-9d4e-300a40fe3a18","resolution":{"observed_at":"2026-08-06T13:10:18.435036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:18.457608Z","title":"Large scale 3d mor- phable models","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-13T11:52:28.198939Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:18.457608Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:582fbc5c5090e9a08a7b7368c373869809a01beed0330da835d1a338034e638f","observation_id":"47cec664-b9c1-47b1-8ea0-2516f105dff5","resolution":{"observed_at":"2026-08-06T13:10:18.457608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:18.673658Z","title":"V oice puppetry","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-13T11:52:28.198939Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:18.673658Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:a22898811b0a0ae33659337952ca879f521382760b6310cf16a504f3de9d5547","observation_id":"aa7ec033-a8cd-4eb7-9a73-a9b8dc04ff0c","resolution":{"observed_at":"2026-08-06T13:10:18.673658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:18.825656Z","title":"How far are we from solving the 2d & 3d face alignment problem? (and a dataset of 230,000 3d facial landmarks)","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-13T11:52:28.198939Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:18.825656Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:50aa8a0c4d3bae77219d30bf7ebaba04f5db159f3a044a202035ac8bf5be5f94","observation_id":"1247365f-f787-4d8f-ad42-c20fb3f75153","resolution":{"observed_at":"2026-08-06T13:10:18.825656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12156","last_updated":"2024-09-18T17:18:13Z","snapshot_observed_at":"2026-08-14T21:28:36.381395Z","submitted_at":"2024-09-18T17:18:13Z","title":"JEAN: Joint Expression and Audio-guided NeRF-based Talking Face Generation","version":1},"cited_work":{"arxiv_id":"2409.12156","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.12156","snapshot_observed_at":"2026-08-06T13:10:19.963454Z","title":"JEAN: Joint Expression and Audio-guided NeRF-based Talking Face Generation","venue":"cs.CV","work_id":"e5fad298-9863-40ae-981f-5680a6443447","year":2024},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-13T11:52:28.198939Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:18.912385Z"},"links":{"cited_paper":"/paper/2409.12156","citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:0809e2c7cf5268a07dd9d8ccdeadde1590a4835726fe443d4d524d010d79a81f","observation_id":"48638b90-8a57-4852-ad8b-26736454c962","resolution":{"observed_at":"2026-08-06T13:10:19.966755Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16666","last_updated":"2024-09-25T06:51:57Z","snapshot_observed_at":"2026-08-12T22:38:03.963508Z","submitted_at":"2024-09-25T06:51:57Z","title":"TalkinNeRF: Animatable Neural Fields for Full-Body Talking Humans","version":1},"cited_work":{"arxiv_id":"2409.16666","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.16666","snapshot_observed_at":"2026-08-06T13:10:19.951384Z","title":"TalkinNeRF: Animatable Neural Fields for Full-Body Talking Humans","venue":"cs.CV","work_id":"1671b17f-b1d6-4ff5-9880-74500014b415","year":2024},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-13T11:52:28.198939Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:18.981498Z"},"links":{"cited_paper":"/paper/2409.16666","citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:a2e250a884cef53755d74d8bf8961b1d5f615c88180b5abce5c119d9728a16ed","observation_id":"a2f7b28a-1a6f-4e2e-a351-f81ad5ff73ed","resolution":{"observed_at":"2026-08-06T13:10:19.954691Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:19.010196Z","title":"Implicit neural head synthesis via controllable lo- cal deformation fields","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-13T11:52:28.198939Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.010196Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:f740ba4b8de34126422f279704125e8f657cc22a4a66c86b094bf8a88ff9a285","observation_id":"2295c8f3-91b3-4243-955b-983ef24f91a1","resolution":{"observed_at":"2026-08-06T13:10:19.010196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.04432","last_updated":"2021-12-08T17:50:26Z","snapshot_observed_at":"2026-08-09T17:52:57.920993Z","submitted_at":"2021-12-08T17:50:26Z","title":"Audio-Visual Synchronisation in the wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.04432","snapshot_observed_at":"2026-08-06T13:10:19.013378Z","title":"Audio-visual synchronisation in the wild","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-13T11:52:28.198939Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.013378Z"},"links":{"cited_paper":"/paper/2112.04432","citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:12e03e391d75f5a7104f3eb9478032035374ba4cc02d63c13e56daf3f534999a","observation_id":"73213bc5-db62-49a3-96f6-7311a9ae1884","resolution":{"observed_at":"2026-08-06T13:10:19.013378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:19.016638Z","title":"Hierarchical cross-modal talking face generation with dynamic pixel-wise loss","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-13T11:52:28.198939Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.016638Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:7f502b4e52b14ed30964929020fde0b56b71c13bd0fd179e515119483e2844a4","observation_id":"3a41c1df-a95c-4af2-b709-2002971afbc2","resolution":{"observed_at":"2026-08-06T13:10:19.016638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:19.039371Z","title":"Videoretalking: Audio-based lip synchronization for talking head video editing in the wild","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-13T11:52:28.198939Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.039371Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:2cbf9b73cd33cfc1fbf2790f6ca00a8a7fe50b038691380bc1b5a79b1b40968b","observation_id":"64367a9b-4d71-4470-8663-8f071082d597","resolution":{"observed_at":"2026-08-06T13:10:19.039371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10215","last_updated":"2024-01-18T18:56:34Z","snapshot_observed_at":"2026-08-13T04:39:37.026967Z","submitted_at":"2024-01-18T18:56:34Z","title":"GPAvatar: Generalizable and Precise Head Avatar from Image(s)","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10215","snapshot_observed_at":"2026-08-06T13:10:19.117914Z","title":"Gpavatar: Generaliz- able and precise head avatar from image (s)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-13T11:52:28.198939Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.117914Z"},"links":{"cited_paper":"/paper/2401.10215","citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:89422b2113e97ead60cdd66a48b71580832040d44ade9e4b8a7a1ff009a325ef","observation_id":"bff3e6aa-a911-44ba-a68b-1396f64f1d27","resolution":{"observed_at":"2026-08-06T13:10:19.117914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:19.197057Z","title":"Lip reading in the wild","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-13T11:52:28.198939Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.197057Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:d3071c8378f71b79eabfef5ad19cea63ee555b93ca10f9f5eb25be47535d176d","observation_id":"ee007793-6166-4ab5-9bfc-17b23c410ea5","resolution":{"observed_at":"2026-08-06T13:10:19.197057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:19.251086Z","title":"Out of time: auto- mated lip sync in the wild","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-13T11:52:28.198939Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.251086Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:efe63bc37b8850c41287f016d73b3458a87dbdfb3f6d1b8b37068dbe4b1ae7cf","observation_id":"de5759f6-daf1-4d47-ba93-af9702d9fe3b","resolution":{"observed_at":"2026-08-06T13:10:19.251086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:19.326692Z","title":"Perfect match: Improved cross-modal embeddings for audio-visual synchronisation","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-13T11:52:28.198939Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.326692Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:d978b835e3d1e1aba1d780401e29fc4ddf6b34ebcc0303d30477c04efbb8a6a0","observation_id":"d7077656-b694-4b0e-a0b6-485bdf88205b","resolution":{"observed_at":"2026-08-06T13:10:19.326692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:19.385049Z","title":"Speech-driven facial animation us- ing cascaded gans for learning of motion and texture","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-13T11:52:28.198939Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.385049Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:8da205152bcbe8abdc3a557c95880cd7cb4bfcdfe38d6886939b7c249c6c666d","observation_id":"7e629fbd-0271-4e8c-b7ea-2228696613d8","resolution":{"observed_at":"2026-08-06T13:10:19.385049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:19.459990Z","title":"Imagenet: A large-scale hierarchical im- age database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-13T11:52:28.198939Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.459990Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:ec5911fb19af07f6ab6d2ff1d6426a8b29be01198c493981d5e3e6b317b0dc51","observation_id":"c63e7167-c726-4d70-b92c-2039a471566e","resolution":{"observed_at":"2026-08-06T13:10:19.459990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:19.502108Z","title":"Arcface: Additive angular margin loss for deep face recognition","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-13T11:52:28.198939Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.502108Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:7cf8e7ca599e7b7e49360ff83907983cb4e34bf623ba5bc19e73ad7e0a54e744","observation_id":"947f87c2-5421-482a-8e89-119d03e4e5b5","resolution":{"observed_at":"2026-08-06T13:10:19.502108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:19.508637Z","title":"End-to-end generation of talking faces from noisy speech","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-13T11:52:28.198939Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.508637Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:c20277d9fad939f10ccd95ac7c863849dde583fd7a241744adebb8cd71a07c31","observation_id":"8c0b5163-0e1f-4848-9af1-704a4430b9f4","resolution":{"observed_at":"2026-08-06T13:10:19.508637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:19.511638Z","title":"Efficient emotional adaptation for audio- driven talking-head generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-13T11:52:28.198939Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.511638Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:27db0e71995943eaa6135e08c0e4d59021a1875aa1faafb1626614bd2e801558","observation_id":"b4dce184-be8c-4a22-89d1-ff2bb1490e0d","resolution":{"observed_at":"2026-08-06T13:10:19.511638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:19.514379Z","title":"Generative adversarial nets","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-13T11:52:28.198939Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.514379Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:bb35f9a564687092aa796a488b861b415d23622dc6b3e91e0d6e492c5af89309","observation_id":"1b9b07f6-4d3c-4ce0-859b-12423c898c07","resolution":{"observed_at":"2026-08-06T13:10:19.514379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:19.517398Z","title":"Stylesync: High-fidelity generalized and personalized lip sync in style-based gener- ator","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-13T11:52:28.198939Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.517398Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:fe35b29bc2c6702fce08d728bab3229ab1fe795e4567ee4ddef24fe8cd9415c5","observation_id":"9595d764-85bd-42be-9a1e-da5ec0d9a827","resolution":{"observed_at":"2026-08-06T13:10:19.517398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:19.520614Z","title":"Ad-nerf: Audio driven neural radiance fields for talking head synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-13T11:52:28.198939Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.520614Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:0400dc414aedc627a075889496e8b4fbaf2c72e93e447f7e5768c9a287ee9b20","observation_id":"7908e6e8-4050-4c77-9977-7b8a4c4f7175","resolution":{"observed_at":"2026-08-06T13:10:19.520614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:19.523372Z","title":"Audio vision: Using 9 audio-visual synchrony to locate sounds","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-13T11:52:28.198939Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.523372Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:98f57d87ac37baa640f3f4a2f6038b99386b22b4ef730440a2c06122cfe03eac","observation_id":"93ac78b8-73f8-4c80-b831-ffbf666981d6","resolution":{"observed_at":"2026-08-06T13:10:19.523372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:19.525963Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilib- rium","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-13T11:52:28.198939Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.525963Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:ba614ddfb08e1039e179a0ba320c01c2437bb3b072d284b0f040cff70bdf2835","observation_id":"7b289745-c745-4903-9d2d-1fbc51f4e216","resolution":{"observed_at":"2026-08-06T13:10:19.525963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:19.528609Z","title":"Diffted: One-shot audio-driven ted talk video generation with diffusion-based co-speech gestures","venue":null,"work_id":null,"year":1922},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-13T11:52:28.198939Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.528609Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:edc6680d9ecafdba39ae08d15dc98129bc18fe4279022dbdb072746b5109d33d","observation_id":"d8848ea0-459e-4dc8-b06b-cf5cf66b28ee","resolution":{"observed_at":"2026-08-06T13:10:19.528609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:19.531664Z","title":"Arbitrary style transfer in real-time with adaptive instance normalization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-13T11:52:28.198939Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.531664Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:d8d91d14ffe961b26c2d4d10d13cf8a1b5269cd559be8f3f47231adb4c51b1ec","observation_id":"c59b91eb-fd0a-40c5-abaf-ef8fbfac12ae","resolution":{"observed_at":"2026-08-06T13:10:19.531664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:19.534433Z","title":"Discohead: audio-and- video-driven talking head generation by disentangled con- trol of head pose and facial expressions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-13T11:52:28.198939Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.534433Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:3b4e5687f0a222ac24f0f2d28a6fc5d1aa040bec982531cf656da68c3adb2fb4","observation_id":"04ca43ee-d2a3-4adf-b2d8-13e0320596ca","resolution":{"observed_at":"2026-08-06T13:10:19.534433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07055","last_updated":"2022-10-13T14:25:37Z","snapshot_observed_at":"2026-08-14T06:51:58.576006Z","submitted_at":"2022-10-13T14:25:37Z","title":"Sparse in Space and Time: Audio-visual Synchronisation with Trainable Selectors","version":1},"cited_work":{"arxiv_id":"2210.07055","doi":null,"metadata_source":"pith","pith_arxiv_id":"2210.07055","snapshot_observed_at":"2026-08-06T13:10:19.923901Z","title":"Sparse in Space and Time: Audio-visual Synchronisation with Trainable Selectors","venue":"cs.CV","work_id":"a44fabcb-6844-4ce6-ad10-1c6d647c49fe","year":2022},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-13T11:52:28.198939Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.536817Z"},"links":{"cited_paper":"/paper/2210.07055","citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:d8890eda69e54836a0b0a54d423d51f25bf534d65ab5ac842b0d36f2089cfedc","observation_id":"96076c35-38b5-4dcd-b088-ec50f6f83c1c","resolution":{"observed_at":"2026-08-06T13:10:19.927064Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:19.539510Z","title":"Batch normalization: Accelerating deep network training by reducing internal co- variate shift","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-13T11:52:28.198939Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.539510Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:9e423fae932bf44d01606b4abee28aafa6541c09621dcedeea77697036525354","observation_id":"2ac0bac6-07cc-42c9-b2b6-78c4779ac027","resolution":{"observed_at":"2026-08-06T13:10:19.539510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:19.542094Z","title":"You said that?: Synthesising talking faces from audio","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-13T11:52:28.198939Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.542094Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:b45c1c058224800c2ff91fdffd5b0c20b321a0c397660a1a217b4a414aee0d44","observation_id":"bf1738ef-787b-4d2b-9561-0d3ae75af01b","resolution":{"observed_at":"2026-08-06T13:10:19.542094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:19.544758Z","title":"Audio-driven emotional video portraits","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-13T11:52:28.198939Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.544758Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:651ef8801eb76ba53c69a0b930a89d4ab20c5d17206bfd7e0691023be5eb3c67","observation_id":"f0bb7da1-c2ff-4dd5-afa3-d1d15ebcb4ea","resolution":{"observed_at":"2026-08-06T13:10:19.544758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:19.547228Z","title":"Eamm: One-shot emotional talking face via audio-based emotion-aware motion model","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-13T11:52:28.198939Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.547228Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:692f1f73caaaa45490481601e020620fc65c61a573f14811eb8752be6db9845e","observation_id":"54b7fb74-5b2d-4f1e-bdc7-1389719fc14a","resolution":{"observed_at":"2026-08-06T13:10:19.547228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:19.549789Z","title":"Audio-driven facial an- imation with deep learning: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-13T11:52:28.198939Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.549789Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:0df1963c3166025ebe7ec35e20875c7445ffa33dc5d8440201f0e49bd3c463df","observation_id":"50611682-95c7-4edc-a162-fca7cf7d985a","resolution":{"observed_at":"2026-08-06T13:10:19.549789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:19.552282Z","title":"Percep- tual losses for real-time style transfer and super-resolution","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-13T11:52:28.198939Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.552282Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:6f85a5e1e3cad9e935558e332382848ab3b6c53da2c262559560a3e8678193d6","observation_id":"74a4bae3-77ca-42db-85e4-5f3bc5a3a944","resolution":{"observed_at":"2026-08-06T13:10:19.552282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.02090","last_updated":"2022-06-30T11:46:24Z","snapshot_observed_at":"2026-08-13T16:08:26.734786Z","submitted_at":"2022-04-05T10:02:39Z","title":"VocaLiST: An Audio-Visual Synchronisation Model for Lips and Voices","version":2},"cited_work":{"arxiv_id":"2204.02090","doi":null,"metadata_source":"pith","pith_arxiv_id":"2204.02090","snapshot_observed_at":"2026-08-06T13:10:19.912830Z","title":"VocaLiST: An Audio-Visual Synchronisation Model for Lips and Voices","venue":"cs.CV","work_id":"66a461b0-ef0b-4831-8fda-1d773cc01e71","year":2022},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-13T11:52:28.198939Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.554988Z"},"links":{"cited_paper":"/paper/2204.02090","citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:17f5f65397bfe988cb3138e3b15d2bac43366a78cf58fc411fddc55d2ef439d2","observation_id":"603d623b-998b-49fd-91cd-1f36294bb2f4","resolution":{"observed_at":"2026-08-06T13:10:19.916020Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05749","last_updated":"2024-05-10T14:13:10Z","snapshot_observed_at":"2026-08-15T03:30:33.457174Z","submitted_at":"2024-05-09T13:14:06Z","title":"NeRFFaceSpeech: One-shot Audio-driven 3D Talking Head Synthesis via Generative Prior","version":2},"cited_work":{"arxiv_id":"2405.05749","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.05749","snapshot_observed_at":"2026-08-06T13:10:19.901497Z","title":"NeRFFaceSpeech: One-shot Audio-driven 3D Talking Head Synthesis via Generative Prior","venue":"cs.CV","work_id":"d31b7141-8378-4495-a83e-abfdb4b9cdf7","year":2024},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-13T11:52:28.198939Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.557924Z"},"links":{"cited_paper":"/paper/2405.05749","citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:2fa0c517ba16a30cfddd84c3ad674650fc2d97bdd3ad6874d6b90dc5f3461781","observation_id":"63d3afe6-400e-415d-9453-343bf0cd2f9c","resolution":{"observed_at":"2026-08-06T13:10:19.904549Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:19.561409Z","title":"End-to-end lip synchronisation based on pattern classification","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-13T11:52:28.198939Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.561409Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:32a19c41510c240180316d8f20ece27f1cdb1b70dfcd64f11cbb13d41522a64b","observation_id":"7d5ff702-a208-41f0-982e-a75fda6385cf","resolution":{"observed_at":"2026-08-06T13:10:19.561409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.458183Z","title":"Towards automatic face-to-face translation","venue":null,"work_id":"3a95aad4-79a6-45ca-a550-dcd5e5fce5a6","year":2019},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-13T11:52:28.198939Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.564369Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:10879fa420df3074271267a7375ab9753fdcb566573e0fe1b5268f3bca0bfcaf","observation_id":"4fda48fa-ff56-435a-8872-805a678b6d6b","resolution":{"observed_at":"2026-08-06T13:10:20.461263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.450567Z","title":"Imagenet classification with deep convolutional neural net- works","venue":null,"work_id":"c02b520f-d745-4a08-b548-a05c7ce1383e","year":2012},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-13T11:52:28.198939Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.566904Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:a9a1f16b6cbafabca540442c1acd1c5dd0fa1a9e7590191d8dad700456f0c249","observation_id":"13883951-8b0d-44a1-9327-244bf9e0391e","resolution":{"observed_at":"2026-08-06T13:10:20.453293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.442300Z","title":"Layer normalization","venue":null,"work_id":"7b0f5476-ea4e-442d-8a9d-2797014fca78","year":null},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-13T11:52:28.198939Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.569647Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:c8d588ffe40047eca4a5e4525996b294cd43b9e9aa38e39c8afc52d84df807c5","observation_id":"1d741386-e3a3-445c-960f-b667e71f8da9","resolution":{"observed_at":"2026-08-06T13:10:20.445443Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.434453Z","title":"Efficient region-aware neural radiance fields for high- fidelity talking portrait synthesis","venue":null,"work_id":"7012091d-e6d7-4e77-af92-0b328cf98f4e","year":2023},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-13T11:52:28.198939Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.572738Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:7085bd7f23326b7e484eddf64cde15dd6aa87900dcabcab1b6035893a08f1542","observation_id":"707b5b6f-89ec-46c4-8d69-dea8ab395aed","resolution":{"observed_at":"2026-08-06T13:10:20.437092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.426300Z","title":"One-shot high- fidelity talking-head synthesis with deformable neural ra- diance field","venue":null,"work_id":"778e5c55-1f7c-42ad-a9bd-5f2867a19898","year":2023},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-13T11:52:28.198939Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.575782Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:c199d8e3756823cc4c02bf84688e4d86985444331dba9317ab3011eeb612b834","observation_id":"cadf50fa-9c70-4cc5-a319-565e6e90dc60","resolution":{"observed_at":"2026-08-06T13:10:20.429530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.418078Z","title":"Expressive talking head generation with granular audio-visual control","venue":null,"work_id":"7b54f40b-ab1a-45d4-996d-be858d6a310d","year":2022},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-13T11:52:28.198939Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.578661Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:aa53f7aa1ad88c287e48540355d22f1059887e5f830bfaff699465df5f7e23e7","observation_id":"b0690c38-67e4-4175-99a8-2eb20b746046","resolution":{"observed_at":"2026-08-06T13:10:20.420942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.409978Z","title":"Font: Flow-guided one-shot talking head generation with natural head motions","venue":null,"work_id":"04c7d752-b2c3-47a7-8438-1a42a645ab7f","year":2023},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-13T11:52:28.198939Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.581524Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:0535c6b7b6422c3f30ef67b66f0165fcf8148e0be7bbd7c84e63bbdfe449b901","observation_id":"54f85be3-39e3-498a-930b-e85474827d81","resolution":{"observed_at":"2026-08-06T13:10:20.412736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.401460Z","title":"Opt: One-shot pose- controllable talking head generation","venue":null,"work_id":"e5cc651c-985f-49d8-969d-ea45065b1b94","year":2023},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-13T11:52:28.198939Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.585066Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:7ee3ee35cb399cfb52e6d792ceb5d42e0514a7250d3f262d5554582c2cd4a90c","observation_id":"9320ef49-2fa4-4e36-a7b6-dfa1cd2b1997","resolution":{"observed_at":"2026-08-06T13:10:20.404441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.393759Z","title":"Semantic-aware implicit neural audio- driven video portrait generation","venue":null,"work_id":"f1c1e81b-779f-4be7-8d5f-4484998adff4","year":2022},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-13T11:52:28.198939Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.587601Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:94b6ba54f7c7a5539df083b2d42589aa5521ac6f7815f62f6eaa1e8a2c1f6903","observation_id":"34290a6a-be79-4b19-ac6f-e795ca15481a","resolution":{"observed_at":"2026-08-06T13:10:20.396341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.385864Z","title":"Moda: Mapping-once audio-driven portrait animation with dual attentions","venue":null,"work_id":"9b4c6d2e-89e9-40d7-9708-e304a12ed912","year":2023},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-13T11:52:28.198939Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.590321Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:60059a83b324c071e46be36992ac0d7a715f47f8a963ee1a78269631aba28b7b","observation_id":"926e99f2-d6c7-4f41-81ca-136480043d3d","resolution":{"observed_at":"2026-08-06T13:10:20.389007Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.08172","last_updated":"2019-06-14T05:49:22Z","snapshot_observed_at":"2026-08-05T19:15:35.517082Z","submitted_at":"2019-06-14T05:49:22Z","title":"MediaPipe: A Framework for Building Perception Pipelines","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.08172","snapshot_observed_at":"2026-08-06T13:10:19.592928Z","title":"Me- diapipe: A framework for building perception pipelines","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-13T11:52:28.198939Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.592928Z"},"links":{"cited_paper":"/paper/1906.08172","citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:aedd914ed110e96f5cf0c4f07dc4c9ed9b183e345fba3dac0b8e0d4c0cf862f3","observation_id":"94b78c77-e869-430a-a66f-388a4e2f3f1d","resolution":{"observed_at":"2026-08-06T13:10:19.592928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.377345Z","title":"Cvthead: One-shot controllable head avatar with vertex-feature transformer","venue":null,"work_id":"41ce1f34-aaa3-448f-a7cc-52eaee47fe0a","year":2024},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-13T11:52:28.198939Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.596067Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:c70f72986cd7fbd08cb67294da6d1cd504325b021f82054e7ce0895226c4e964","observation_id":"884beea5-1ed5-4ba5-8f21-4e6dd446f871","resolution":{"observed_at":"2026-08-06T13:10:20.380403Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.368636Z","title":"Styletalk: One-shot talking head generation with controllable speak- ing styles","venue":null,"work_id":"6147bd2b-0bec-41c0-9992-36d9554ef64f","year":1904},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-13T11:52:28.198939Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.598971Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:fe7d4d2a5f0407c1c621e53a1e3753acc38f3cb840f45af32a8ef0a9b4dfe534","observation_id":"ba0a46d6-2ca8-4a44-85cf-0847073d3a51","resolution":{"observed_at":"2026-08-06T13:10:20.372221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09767","last_updated":"2024-08-10T09:37:55Z","snapshot_observed_at":"2026-08-13T05:01:00.463111Z","submitted_at":"2023-12-15T13:15:42Z","title":"DreamTalk: When Emotional Talking Head Generation Meets Diffusion Probabilistic Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.09767","snapshot_observed_at":"2026-08-06T13:10:19.601406Z","title":"Dreamtalk: When ex- pressive talking head generation meets diffusion probabilis- tic models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-13T11:52:28.198939Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.601406Z"},"links":{"cited_paper":"/paper/2312.09767","citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:26ed946963b376b506ab5a30a4ff0627907fcb453e137c1f26e9dce8987dafd7","observation_id":"288b8791-b9ae-48dd-b171-d59d1f9503f7","resolution":{"observed_at":"2026-08-06T13:10:19.601406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.360266Z","title":"Otavatar: One-shot talking face avatar with control- lable tri-plane rendering","venue":null,"work_id":"564633ed-1d63-47e2-bd3b-9a8de4f7fa8b","year":2023},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-13T11:52:28.198939Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.604026Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:1033d66d11e1eaf7fcc0a3b9b612e0ab4f7324b0007ba5f423e13b94297273db","observation_id":"523113b3-b116-4e6e-9da3-443bf7f20502","resolution":{"observed_at":"2026-08-06T13:10:20.363238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.352472Z","title":"Sidgan: High-resolution dubbed video generation via shift-invariant learning","venue":null,"work_id":"6fce83f8-b0ac-4800-8692-b70cf5e90aae","year":2023},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-13T11:52:28.198939Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.607458Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:1ad6e9b2080ac108e9afaf7630bbc815387189cfba97e1f614c7874679275470","observation_id":"f4e159a3-aadf-4dd3-8212-a8334a1fd1c0","resolution":{"observed_at":"2026-08-06T13:10:20.355365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.344956Z","title":"Diff2lip: Audio conditioned dif- fusion models for lip-synchronization","venue":null,"work_id":"e725e65c-5c33-4e9c-8be0-46604b8949d3","year":2024},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-13T11:52:28.198939Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.609925Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:820942ffd38ad312e01bc3f83d7cfead752a4de837e9a0304d583028e3ecbafe","observation_id":"97f21d94-2da1-4794-be23-23bb058d756f","resolution":{"observed_at":"2026-08-06T13:10:20.347539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.336786Z","title":"Rectified linear units improve restricted boltzmann machines","venue":null,"work_id":"0bac3777-04dc-4515-a191-4e479404283f","year":2010},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-13T11:52:28.198939Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.612889Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:ae8fc9893925f930eb8d47a1de7ad952d0b98dbbf8aafa675ed4685f26dea310","observation_id":"e2764bf5-eb83-40be-88ca-e845cc200340","resolution":{"observed_at":"2026-08-06T13:10:20.339828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.329216Z","title":"Audio-visual scene analysis with self-supervised multisensory features","venue":null,"work_id":"0ca3c0d9-9489-4e9e-8fb6-ef4bd68b9e0d","year":2018},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-13T11:52:28.198939Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.615652Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:49ec0bbac77b9dc91cff0e8f57fe8c15bfe13edda13f27499f292e26c529fe43","observation_id":"dd662cb7-fed5-4e7c-a4bf-d28150096b28","resolution":{"observed_at":"2026-08-06T13:10:20.332060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.321350Z","title":"in-the-wild","venue":null,"work_id":"e0a83c97-caa9-4a70-a80d-94cef6ecde4e","year":2022},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-13T11:52:28.198939Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.619193Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:c80232e0285ea5698d606e77df6125723bbd08533fa7958ce9cf0ddfe65368a2","observation_id":"ef00998f-538b-4937-add0-0ec3cf2e446e","resolution":{"observed_at":"2026-08-06T13:10:20.324159Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.313360Z","title":"Synctalkface: Talking face generation with precise lip-syncing via audio-lip memory","venue":null,"work_id":"9fcfd8c8-49c4-4003-9882-a4eab94b4ac0","year":2022},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-13T11:52:28.198939Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.621947Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:0453bb097c6375fa0cfa7cc778809f1d7e6e3cad738268008f94b772bf4d204c","observation_id":"2f85de8b-b5c0-4c33-9255-2a73ed77ca1d","resolution":{"observed_at":"2026-08-06T13:10:20.315937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.305686Z","title":"Semantic image synthesis with spatially-adaptive normalization","venue":null,"work_id":"acadd36c-609e-42d6-b310-78052ae1947f","year":2019},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-13T11:52:28.198939Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.624656Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:24a77539e71f385575e9aae35554b5fac6b1f11f15d629e849ab553cd2f46824","observation_id":"fd35efd7-792e-44ca-9eba-57fd936d6b3b","resolution":{"observed_at":"2026-08-06T13:10:20.308577Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.297733Z","title":"Synctalk: The devil is in the synchronization for talking head synthesis","venue":null,"work_id":"d9fbc3cb-db25-4a02-b2c7-dcf4516ec804","year":2024},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-13T11:52:28.198939Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.627651Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:987dcd6fd2d12247a94bd4a1ca5fe14432c3076319fc014ce50e6f921fe0c14c","observation_id":"ade94ba0-b672-461c-b057-199276a2257f","resolution":{"observed_at":"2026-08-06T13:10:20.300514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.289082Z","title":"A lip sync expert is all you need for speech to lip generation in the wild","venue":null,"work_id":"871b4fb1-9137-4600-83f4-aa2c0d5ea9ea","year":2020},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-13T11:52:28.198939Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.630189Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:acfc40edc05080309d252728763f3c5998a0622fed27406838e837bb782ad477","observation_id":"9cadb96b-feec-4e4b-b72f-224f52d8bfae","resolution":{"observed_at":"2026-08-06T13:10:20.292496Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.281337Z","title":"U- net: Convolutional networks for biomedical image seg- mentation","venue":null,"work_id":"e9e80097-ae77-4002-8da5-6bfa8bf87318","year":2015},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-13T11:52:28.198939Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.632941Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:6001c03df32a690fb38ca30b911117be75bb6f35289542b77b2da2b0054c8c08","observation_id":"2da4e927-122b-47b4-b155-b6c22f891c9b","resolution":{"observed_at":"2026-08-06T13:10:20.284326Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.273376Z","title":"Learning dynamic facial radiance fields for few-shot talking head synthesis","venue":null,"work_id":"b6f8b7d2-505e-4440-829d-a5050858c273","year":2022},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-13T11:52:28.198939Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.635850Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:6e30cc9a5b8807bf88cd4ffb20dd3734db3c06c54db45781c360b8f77418c4c3","observation_id":"ad693093-af0d-40a4-bfb5-f85717dbeadc","resolution":{"observed_at":"2026-08-06T13:10:20.275948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.265579Z","title":"Difftalk: Crafting dif- fusion models for generalized audio-driven portraits anima- tion","venue":null,"work_id":"5b3007d6-0594-48ce-8983-18cbab95bebc","year":1982},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-13T11:52:28.198939Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.639035Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:b489d5f873c5766ed60f04e06cf02156c0cc2f410efcce64b38426da7f0ab8e1","observation_id":"a28a1ad9-22f4-44ef-8aae-b48360df52ce","resolution":{"observed_at":"2026-08-06T13:10:20.268356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.257611Z","title":"Real-time single image and video super-resolution using an efficient sub-pixel convolutional neural network","venue":null,"work_id":"73557a24-916f-4c75-ab4c-36ff1d66e260","year":2016},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-13T11:52:28.198939Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.642120Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:afd79c2fb6303c8184d6999b424985d53bec6648723c49a94c918ed75dc18c77","observation_id":"31a4aa87-2b76-4f62-ae70-d3c3653e449b","resolution":{"observed_at":"2026-08-06T13:10:20.260481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1409.1556","last_updated":"2015-04-10T16:25:04Z","snapshot_observed_at":"2026-08-14T23:20:42.336514Z","submitted_at":"2014-09-04T19:48:04Z","title":"Very Deep Convolutional Networks for Large-Scale Image Recognition","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1409.1556","snapshot_observed_at":"2026-08-06T13:10:19.645004Z","title":"Very deep convo- lutional networks for large-scale image recognition","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-13T11:52:28.198939Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.645004Z"},"links":{"cited_paper":"/paper/1409.1556","citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:52ecbf058fe7fa44632e1ea410dbe178a4836f17a40f091c79518645c3733298","observation_id":"fcc24d0e-7f31-4adc-8fb3-e90e3d0b7940","resolution":{"observed_at":"2026-08-06T13:10:19.645004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.249400Z","title":"Facesync: A linear operator for measuring synchronization of video facial im- ages and audio tracks","venue":null,"work_id":"173baf2a-5649-4c1c-b94b-6c68c3632b54","year":2000},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-13T11:52:28.198939Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.647521Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:7e4405d72b596e408630bfa2606d9fda36f7d1f7a4b8a8f96d5796c013c5f082","observation_id":"4f7efac3-601e-40f6-be5a-1d29a0daefba","resolution":{"observed_at":"2026-08-06T13:10:20.252056Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.241487Z","title":"Audio-driven dubbing for user generated contents via style-aware semi-parametric synthesis","venue":null,"work_id":"436eaefc-0ed8-4f33-ab85-4ee2dc51aafc","year":2022},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-13T11:52:28.198939Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.650253Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:2e1aadb49e60c907649ef20f48e7d7aaaeeca2d273969525166e6ebf7528237a","observation_id":"56d1ce50-6a9a-4143-9da0-33072d0e0c4e","resolution":{"observed_at":"2026-08-06T13:10:20.244244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.232924Z","title":"Everybody’s talkin’: Let me talk as you want","venue":null,"work_id":"73985ee6-c412-4d0f-80dd-d50546e0a11a","year":2022},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-13T11:52:28.198939Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.653102Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:1670c7ebcc502e92a927228670d703f7b9f0d91d758f6bb8948a6fd681fcea55","observation_id":"13db41f6-5ae3-4c5c-986f-d5b61442860f","resolution":{"observed_at":"2026-08-06T13:10:20.236266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1804.04786","last_updated":"2019-07-25T20:40:22Z","snapshot_observed_at":"2026-08-14T19:26:25.442241Z","submitted_at":"2018-04-13T04:19:52Z","title":"Talking Face Generation by Conditional Recurrent Adversarial Network","version":3},"cited_work":{"arxiv_id":"1804.04786","doi":null,"metadata_source":"pith","pith_arxiv_id":"1804.04786","snapshot_observed_at":"2026-08-06T13:10:19.865644Z","title":"Talking Face Generation by Conditional Recurrent Adversarial Network","venue":"cs.CV","work_id":"ec38b856-edaf-4944-b151-1f76a4b16fc8","year":2018},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-13T11:52:28.198939Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.656203Z"},"links":{"cited_paper":"/paper/1804.04786","citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:2bbeffd532a0a8d29237b36afc586d2c2f40814ce8d526fe38e6ed6e8c4091ae","observation_id":"3a95139c-8a27-4893-82b8-0682e13e607a","resolution":{"observed_at":"2026-08-06T13:10:19.869488Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.224571Z","title":"Diffused 11 heads: Diffusion models beat gans on talking-face gen- eration","venue":null,"work_id":"62ea2e97-4685-48c7-873a-d3ba9563088f","year":2024},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-13T11:52:28.198939Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.659807Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:b8f7337afbce1d616550c093570b6ef2a94d9b8ebbfb907299c04b21b572dabf","observation_id":"9c298006-4cc7-430b-9dd0-4d3cf4ff1767","resolution":{"observed_at":"2026-08-06T13:10:20.227469Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.01841","last_updated":"2023-12-07T03:14:22Z","snapshot_observed_at":"2026-08-14T23:21:55.980013Z","submitted_at":"2023-12-04T12:25:37Z","title":"VividTalk: One-Shot Audio-Driven Talking Head Generation Based on 3D Hybrid Prior","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.01841","snapshot_observed_at":"2026-08-06T13:10:19.662786Z","title":"Vividtalk: One-shot audio-driven talking head generation based on 3d hybrid prior","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-13T11:52:28.198939Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.662786Z"},"links":{"cited_paper":"/paper/2312.01841","citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:fbf7961a1e20f8950ebb774fceddb962b40955f6148f2d42402d10e1a8f26d2e","observation_id":"fa57b284-95aa-4720-8122-48f2245aff9c","resolution":{"observed_at":"2026-08-06T13:10:19.662786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.215881Z","title":"Masked lip-sync predic- tion by audio-visual contextual exploitation in transform- ers","venue":null,"work_id":"2f70db96-b869-47b4-bccf-247fdddb58c5","year":2022},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-13T11:52:28.198939Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.666211Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:82397ba9821ac52763587e7cd4dbd748b68e136649ff9c66d1aacf52baed622f","observation_id":"0af2d784-07f0-4183-afb5-af0fa7269a19","resolution":{"observed_at":"2026-08-06T13:10:20.218728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.206626Z","title":"Synthesizing obama: learning lip sync from audio","venue":null,"work_id":"0b977010-57c6-469b-8018-6b2ef3c4fc40","year":2017},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-13T11:52:28.198939Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.668698Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:c2c6318a9f9108ce9b6bb658988fb018dc99402fc792b6cbc504c471a80f56c4","observation_id":"71220db6-5298-4d11-b709-face2ee95da0","resolution":{"observed_at":"2026-08-06T13:10:20.210090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.197808Z","title":"Rethinking the inception architecture for computer vision","venue":null,"work_id":"ad7a4105-ffbc-479f-a7c1-a27eff75c3b0","year":2016},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-13T11:52:28.198939Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.671548Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:474538ac8930652b0674a3a9e9dcb7e98876c88ea7f58ae973789c2bfa248378","observation_id":"89baec36-0a0d-465a-9ae3-b5a4fbc037db","resolution":{"observed_at":"2026-08-06T13:10:20.200831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.189658Z","title":"Emmn: Emotional mo- tion memory network for audio-driven emotional talking face generation","venue":null,"work_id":"17dbd5b0-3769-4b2d-ba8d-9e1e998bed46","year":2023},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-13T11:52:28.198939Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.674028Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:7f66ae5a61954718b59725b914a0235898ab3c3aa4a4ddc5d7a832defceb574e","observation_id":"43a03a3b-b351-4e10-a744-7273bc44ee51","resolution":{"observed_at":"2026-08-06T13:10:20.192518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.12368","last_updated":"2022-11-22T16:03:11Z","snapshot_observed_at":"2026-08-13T15:00:51.699760Z","submitted_at":"2022-11-22T16:03:11Z","title":"Real-time Neural Radiance Talking Portrait Synthesis via Audio-spatial Decomposition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.12368","snapshot_observed_at":"2026-08-06T13:10:19.676863Z","title":"Real-time neural radiance talking portrait synthesis via audio-spatial decomposition","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-13T11:52:28.198939Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.676863Z"},"links":{"cited_paper":"/paper/2211.12368","citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:6b959221a4e72f9a5df7aa3c457425b14ce133c1e4666898b95758bb5f79e0ad","observation_id":"77cbb8cc-050a-41ed-9803-552063712921","resolution":{"observed_at":"2026-08-06T13:10:19.676863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.181328Z","title":"Neural voice puppetry: Audio-driven facial reenactment","venue":null,"work_id":"0fa31c08-25c8-400b-80e8-2ceae8d97c4d","year":2020},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-13T11:52:28.198939Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.679847Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:c22fddf06d2eef02ea252fc14e95f680b6cff0f6f29318a953c0249d2d4b7a9e","observation_id":"ce345719-f4e4-4368-ab1e-eaafe44a5c34","resolution":{"observed_at":"2026-08-06T13:10:20.184100Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17485","last_updated":"2024-08-08T03:48:38Z","snapshot_observed_at":"2026-08-13T04:09:10.236494Z","submitted_at":"2024-02-27T13:10:11Z","title":"EMO: Emote Portrait Alive -- Generating Expressive Portrait Videos with Audio2Video Diffusion Model under Weak Conditions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17485","snapshot_observed_at":"2026-08-06T13:10:19.683024Z","title":"Emo: Emote portrait alive-generating expressive portrait videos with audio2video diffusion model under weak conditions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-13T11:52:28.198939Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.683024Z"},"links":{"cited_paper":"/paper/2402.17485","citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:a4cef8ef7a2404e4b85f70a9ab33020bd3a8b5f93be9e97412b441091b775b13","observation_id":"ffec64f7-ca81-4640-bf4b-13c69139ce6f","resolution":{"observed_at":"2026-08-06T13:10:19.683024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:19.686259Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-13T11:52:28.198939Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.686259Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:cd8b861257089a8206d0dd79988fd55f7ae669232e4fe287d2103948662de998","observation_id":"5390878b-824a-4c0a-9588-953d1edbec11","resolution":{"observed_at":"2026-08-06T13:10:19.686259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.167670Z","title":"Realistic speech-driven facial animation with gans","venue":null,"work_id":"99ff3cad-d267-4232-b5d8-f7939659e2b2","year":2020},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-13T11:52:28.198939Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.688989Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:14b4ee3e78b29153243bf7e80f1df2361ed5899777f54dc0fb1f9bc9927806c5","observation_id":"2c1cdc65-6158-44dc-8663-cc88fc4c5d81","resolution":{"observed_at":"2026-08-06T13:10:20.170908Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.159678Z","title":"Progressive disentangled representa- tion learning for fine-grained controllable talking head syn- thesis","venue":null,"work_id":"dea92ec1-16c3-4315-ad1b-7913941cadd8","year":2023},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-13T11:52:28.198939Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.691728Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:f1f4ffc248f290a358ad8e849eaf613ef4b8120755eea81143332977fc516bbf","observation_id":"67bbe2e9-9fd3-4856-b015-21f45598c9ab","resolution":{"observed_at":"2026-08-06T13:10:20.162335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.151570Z","title":"Seeing what you said: Talking face gen- eration guided by a lip reading expert","venue":null,"work_id":"edf849a0-d090-4fc5-8073-255c019a8527","year":2023},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-13T11:52:28.198939Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.694660Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:ddce7d556fa7968696f1273c341cd0478b1ef71d4eecdedf4a67276d784ab35b","observation_id":"e85864e7-bb3a-437a-8389-fef662dabc56","resolution":{"observed_at":"2026-08-06T13:10:20.154256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.143372Z","title":"Lipformer: High- fidelity and generalizable talking face generation with a pre- learned facial codebook","venue":null,"work_id":"a7e8df4a-06f4-4946-9367-9d11d887d903","year":2023},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-13T11:52:28.198939Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.697320Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:ae2a2d417ccc6b50ca290a4c5a29c29ea2c0ec0cd439abc0de421694cac3a221","observation_id":"65ea565c-68cf-404b-a3ef-15deae8292cb","resolution":{"observed_at":"2026-08-06T13:10:20.146253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.136112Z","title":"Styletalk++: A unified framework for controlling the speaking styles of talking heads","venue":null,"work_id":"adb0ed4a-5080-421c-9344-9b5e5d87475e","year":2024},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-13T11:52:28.198939Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.699987Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:6d4ae0877d82e2cef18ce341fb48074edf6937ad8a9f72515e971af01d2d0340","observation_id":"8bdd2035-f607-4f0a-a3be-173ac2636cab","resolution":{"observed_at":"2026-08-06T13:10:20.138768Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.128385Z","title":"High-resolution image synthesis and semantic manipulation with conditional gans","venue":null,"work_id":"a451a6c8-a761-4e2b-bbb5-e1f67f98ac78","year":2018},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-13T11:52:28.198939Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.702818Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:4407938d2f7ab3ebc1de7857d5ef5be58f8da5454b8641547843a212b03d2c91","observation_id":"0a3835a7-da50-4a24-8ade-78355e5da511","resolution":{"observed_at":"2026-08-06T13:10:20.131528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.120736Z","title":"Image quality assessment: from error visibility to structural similarity","venue":null,"work_id":"24358c0a-11a0-4961-a17e-d1f45f0326dd","year":2004},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-13T11:52:28.198939Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.706016Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:4230978654dfd591238080c254275b2da9ef78e9a6a1cc647a13ce03e9d4b212","observation_id":"4aba5721-85e4-468a-b946-2292b91a0e6b","resolution":{"observed_at":"2026-08-06T13:10:20.123405Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.112869Z","title":"Imitating arbitrary talking style for realistic audio-driven talking face synthesis","venue":null,"work_id":"59a54085-4f45-4443-adb8-c9f3fc111f01","year":2021},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-13T11:52:28.198939Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.708385Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:07c3e46f71dde5a606f03001097e9316e7d7f8bedfe22ea59aaeebc7dcd21e39","observation_id":"5c688292-ed0f-45b3-8365-a39e22ecab81","resolution":{"observed_at":"2026-08-06T13:10:20.115487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.104301Z","title":"Ganhead: Towards generative animatable neural head avatars","venue":null,"work_id":"fe618e6d-8b0b-4c48-9ec8-8552e5f9b924","year":2023},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-13T11:52:28.198939Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.711283Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:01b13967c7fe46c7821b8e001a8bf508a603e889d97abcb084132a26820440d5","observation_id":"e2f6bcc4-c996-4de0-894e-64a8dfd382c9","resolution":{"observed_at":"2026-08-06T13:10:20.107368Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.096951Z","title":"High-fidelity generalized emotional talking face generation with multi-modal emotion space learning","venue":null,"work_id":"4bc1dd08-359e-4653-a2bb-bdf173747b25","year":2023},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-13T11:52:28.198939Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.713845Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:7d3e8fbb8e9fa3ffdcdb49b22299b0e765985d040a097be5612502dca0115c02","observation_id":"29b07864-bf89-421b-b1bb-15f1d78bcb0d","resolution":{"observed_at":"2026-08-06T13:10:20.099524Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.089007Z","title":"Audio-visual speech representation expert for enhanced talking face video generation and evaluation","venue":null,"work_id":"0005ec4b-d321-45b0-a945-c87318cdf6f2","year":2024},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-13T11:52:28.198939Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.716184Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:895d9efce517efe3ca264006d040fe34544ede69a6db0e97a319ebb3efcd0589","observation_id":"ad5563d8-07ce-40b8-a753-308cf54b5653","resolution":{"observed_at":"2026-08-06T13:10:20.092115Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09368","last_updated":"2024-07-18T10:51:27Z","snapshot_observed_at":"2026-08-13T10:53:15.788830Z","submitted_at":"2023-07-18T15:50:04Z","title":"Audio-driven Talking Face Generation with Stabilized Synchronization Loss","version":3},"cited_work":{"arxiv_id":"2307.09368","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.09368","snapshot_observed_at":"2026-08-06T13:10:19.827627Z","title":"Audio-driven Talking Face Generation with Stabilized Synchronization Loss","venue":"cs.CV","work_id":"8f400035-b104-44c7-b7fb-4ea7225a9611","year":2023},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-13T11:52:28.198939Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.718719Z"},"links":{"cited_paper":"/paper/2307.09368","citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:9cdce03806755e5610e18d4a3582ba2ac14242ecfae5a22b692b4d3a96f0552b","observation_id":"2342329e-7e22-4ced-8090-c566a2e7bfde","resolution":{"observed_at":"2026-08-06T13:10:19.832891Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.00791","last_updated":"2022-01-03T18:23:38Z","snapshot_observed_at":"2026-08-14T22:09:26.918389Z","submitted_at":"2022-01-03T18:23:38Z","title":"DFA-NeRF: Personalized Talking Head Generation via Disentangled Face Attributes Neural Rendering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.00791","snapshot_observed_at":"2026-08-06T13:10:19.721450Z","title":"Dfa-nerf: Personalized talking head generation via disentangled face attributes neural rendering","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-13T11:52:28.198939Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.721450Z"},"links":{"cited_paper":"/paper/2201.00791","citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:42507132c8aeac667a449abe9ef48875bd4cd882eecf8e057fae6dc29411f23f","observation_id":"354d3f85-f09d-4b74-8eef-cf5b8850e70e","resolution":{"observed_at":"2026-08-06T13:10:19.721450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.13430","last_updated":"2023-01-31T05:56:06Z","snapshot_observed_at":"2026-08-13T12:54:37.957774Z","submitted_at":"2023-01-31T05:56:06Z","title":"GeneFace: Generalized and High-Fidelity Audio-Driven 3D Talking Face Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.13430","snapshot_observed_at":"2026-08-06T13:10:19.724040Z","title":"Geneface: Generalized and high-fidelity audio-driven 3d talking face synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-13T11:52:28.198939Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.724040Z"},"links":{"cited_paper":"/paper/2301.13430","citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:a215401bd3132bf067dffcfa229f4b6c7859c2eddb92eca4dd4ccf8723a4983c","observation_id":"47656887-e25c-4bb2-be3e-a6f50dc87109","resolution":{"observed_at":"2026-08-06T13:10:19.724040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08503","last_updated":"2024-03-23T06:40:22Z","snapshot_observed_at":"2026-08-13T04:41:53.034723Z","submitted_at":"2024-01-16T17:04:30Z","title":"Real3D-Portrait: One-shot Realistic 3D Talking Portrait Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08503","snapshot_observed_at":"2026-08-06T13:10:19.726995Z","title":"Real3d-portrait: One- shot realistic 3d talking portrait synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-13T11:52:28.198939Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.726995Z"},"links":{"cited_paper":"/paper/2401.08503","citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:2c73dc5d94bdfa22031b28005f81343f4c594fa5735c6c5f091f752896ba932f","observation_id":"06b9f2ff-c777-4e0c-b011-a9a0bec6255e","resolution":{"observed_at":"2026-08-06T13:10:19.726995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.081262Z","title":"Quantitative association of vocal-tract and facial behavior","venue":null,"work_id":"4f29f906-dde7-42a2-95d6-5e4011b0f19b","year":1998},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-13T11:52:28.198939Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.729858Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:0da2ed48bee476724a6125e883974ccf85503fa893289ea5e94c25bde07f9968","observation_id":"d27549de-85a5-4933-be4e-b151ba5d8dcd","resolution":{"observed_at":"2026-08-06T13:10:20.083847Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.073190Z","title":"Styleheat: One-shot high-resolution editable talking face generation via pre-trained stylegan","venue":null,"work_id":"72092cb3-2622-44bc-8846-2e063b894ee1","year":2022},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-13T11:52:28.198939Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.732934Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:e5862c2406ea44486a8b9404311c4633eaf5d41576749463e88d8b4289f86fb3","observation_id":"16907925-7056-447c-990a-e7fc25da1dee","resolution":{"observed_at":"2026-08-06T13:10:20.076042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.065697Z","title":"Multimodal image synthesis and editing: A survey and taxonomy","venue":null,"work_id":"1c8b6e79-4df3-4611-a4ea-a2149959dde1","year":2023},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-13T11:52:28.198939Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.735725Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:81a9e30bdf137a4a9dd7adb4e20b1ed5213e8325ece6e457348ffed77a871d72","observation_id":"cdd47e1d-af3e-44e5-bc7b-6df6cbaf5e97","resolution":{"observed_at":"2026-08-06T13:10:20.068461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T11:52:28.198939Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":44,"verified_exact":7,"verified_fuzzy":49},"total_outbound_references":112},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 100 of 112 outbound references and 0 inbound Pith citation observations for arXiv:2507.20953."}