{"as_of":"2026-08-10T05:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1e725a6763369a172d81609bf94bf3c3a899f0bc6fed513aa7c92770c221b6b0","coverage":[{"denominator":92,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":92,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T00:18:43.298489Z","state":"measured"},{"denominator":92,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":92,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.01605/citation-record","integrity":"/paper/2608.01605/integrity","json":"/paper/2608.01605/citation-record.json","paper":"/paper/2608.01605"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:18:32.597917Z","title":"Emotalk: Speech-driven emotional disentanglement for 3d face animation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.01605","last_updated":"2026-08-03T02:24:23Z","snapshot_observed_at":"2026-08-07T13:15:08.040478Z","submitted_at":"2026-08-03T02:24:23Z","title":"ETHead: Generating Expressive 3D Facial Animation and Head Movement from Speech","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T00:18:32.597917Z"},"links":{"citing_paper":"/paper/2608.01605"},"observation_digest":"sha256:f9ab8d39c65df42ba4b39c8e055a9a372a85e85d2c792de9f86f6a66e93da2b5","observation_id":"46025707-a5c4-4bc4-b128-efa28da705ec","resolution":{"observed_at":"2026-08-05T00:18:32.597917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:18:32.773630Z","title":"Emotional speech-driven animation with content-emotion disentangle- ment,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.01605","last_updated":"2026-08-03T02:24:23Z","snapshot_observed_at":"2026-08-07T13:15:08.040478Z","submitted_at":"2026-08-03T02:24:23Z","title":"ETHead: Generating Expressive 3D Facial Animation and Head Movement from Speech","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T00:18:32.773630Z"},"links":{"citing_paper":"/paper/2608.01605"},"observation_digest":"sha256:3f4ebe36cfbd356f3d16c0491e5a777dc9549acba83c0ad2f489983ca96e4d85","observation_id":"cb8ad602-94d9-4d4c-ab27-009d07f1d0ad","resolution":{"observed_at":"2026-08-05T00:18:32.773630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:18:32.904854Z","title":"DiffPoseTalk: Speech-driven stylistic 3d facial animation and head pose generation via diffusion models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01605","last_updated":"2026-08-03T02:24:23Z","snapshot_observed_at":"2026-08-07T13:15:08.040478Z","submitted_at":"2026-08-03T02:24:23Z","title":"ETHead: Generating Expressive 3D Facial Animation and Head Movement from Speech","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T00:18:32.904854Z"},"links":{"citing_paper":"/paper/2608.01605"},"observation_digest":"sha256:db59f42065bb91af17a0c71717e84672bab858cb29a43a10ac718f1ef82cb555","observation_id":"31762a41-7211-45fc-96e4-0174b47ea5eb","resolution":{"observed_at":"2026-08-05T00:18:32.904854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:18:32.977875Z","title":"Adamesh: Personalized facial expressions and head poses for adaptive speech-driven 3d facial animation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01605","last_updated":"2026-08-03T02:24:23Z","snapshot_observed_at":"2026-08-07T13:15:08.040478Z","submitted_at":"2026-08-03T02:24:23Z","title":"ETHead: Generating Expressive 3D Facial Animation and Head Movement from Speech","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T00:18:32.977875Z"},"links":{"citing_paper":"/paper/2608.01605"},"observation_digest":"sha256:2a56705c3f409579556ad00fea1e12735f05b0f1453e0401877f22f7a3455268","observation_id":"0d5a19e8-a6df-41eb-a6c5-c7ca5bf7e00c","resolution":{"observed_at":"2026-08-05T00:18:32.977875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:18:33.053384Z","title":"Imitator: Personalized speech-driven 3d facial animation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.01605","last_updated":"2026-08-03T02:24:23Z","snapshot_observed_at":"2026-08-07T13:15:08.040478Z","submitted_at":"2026-08-03T02:24:23Z","title":"ETHead: Generating Expressive 3D Facial Animation and Head Movement from Speech","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T00:18:33.053384Z"},"links":{"citing_paper":"/paper/2608.01605"},"observation_digest":"sha256:3b8e05531c03664beaaf232f5be42b18fa9acda3bbaa7212dc938f2ffa671e36","observation_id":"f34375ea-0b2d-4a5f-9631-d990476d1f12","resolution":{"observed_at":"2026-08-05T00:18:33.053384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19209","last_updated":"2025-08-26T17:15:26Z","snapshot_observed_at":"2026-08-05T15:45:54.034746Z","submitted_at":"2025-08-26T17:15:26Z","title":"OmniHuman-1.5: Instilling an Active Mind in Avatars via Cognitive Simulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.19209","snapshot_observed_at":"2026-08-05T00:18:33.160356Z","title":"Omnihuman-1.5: Instilling an active mind in avatars via cognitive simulation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01605","last_updated":"2026-08-03T02:24:23Z","snapshot_observed_at":"2026-08-07T13:15:08.040478Z","submitted_at":"2026-08-03T02:24:23Z","title":"ETHead: Generating Expressive 3D Facial Animation and Head Movement from Speech","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T00:18:33.160356Z"},"links":{"cited_paper":"/paper/2508.19209","citing_paper":"/paper/2608.01605"},"observation_digest":"sha256:d5209297d2381c37dc0723dd9af5ee3a47a89c6cd3eb8486a64b87246563472f","observation_id":"5fcd8d53-8c92-4f85-b11f-c132c0b17509","resolution":{"observed_at":"2026-08-05T00:18:33.160356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:18:33.271450Z","title":"Supervising 3d talking head avatars with analysis-by-audio-synthesis,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01605","last_updated":"2026-08-03T02:24:23Z","snapshot_observed_at":"2026-08-07T13:15:08.040478Z","submitted_at":"2026-08-03T02:24:23Z","title":"ETHead: Generating Expressive 3D Facial Animation and Head Movement from Speech","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T00:18:33.271450Z"},"links":{"citing_paper":"/paper/2608.01605"},"observation_digest":"sha256:1f3b6444ed53ca903f9adf7f99588a3abf4380d38b5bcbf99b524c956134a2d5","observation_id":"a3843461-def4-444f-a0f0-dbe7d13090c0","resolution":{"observed_at":"2026-08-05T00:18:33.271450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:18:33.321621Z","title":"JALI: an animator- centric viseme model for expressive lip synchronization,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.01605","last_updated":"2026-08-03T02:24:23Z","snapshot_observed_at":"2026-08-07T13:15:08.040478Z","submitted_at":"2026-08-03T02:24:23Z","title":"ETHead: Generating Expressive 3D Facial Animation and Head Movement from Speech","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T00:18:33.321621Z"},"links":{"citing_paper":"/paper/2608.01605"},"observation_digest":"sha256:3234a26d381be3ada88ff50bad517e846fae28a06a4acdf89f93b8d5eed95dbd","observation_id":"c7258605-fdf6-45a9-bc50-2b7040068db3","resolution":{"observed_at":"2026-08-05T00:18:33.321621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:18:33.409223Z","title":"Massaro, M","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2608.01605","last_updated":"2026-08-03T02:24:23Z","snapshot_observed_at":"2026-08-07T13:15:08.040478Z","submitted_at":"2026-08-03T02:24:23Z","title":"ETHead: Generating Expressive 3D Facial Animation and Head Movement from Speech","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T00:18:33.409223Z"},"links":{"citing_paper":"/paper/2608.01605"},"observation_digest":"sha256:d584e16412b265781d3139993486d1dcd0c2d6f95c04dd620906c7cbfc59a4aa","observation_id":"80456774-646d-4dba-aa69-da6d94d70b12","resolution":{"observed_at":"2026-08-05T00:18:33.409223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:18:33.501692Z","title":"Dynamic units of visual speech,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2608.01605","last_updated":"2026-08-03T02:24:23Z","snapshot_observed_at":"2026-08-07T13:15:08.040478Z","submitted_at":"2026-08-03T02:24:23Z","title":"ETHead: Generating Expressive 3D Facial Animation and Head Movement from Speech","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T00:18:33.501692Z"},"links":{"citing_paper":"/paper/2608.01605"},"observation_digest":"sha256:c1a15363348e47a935da319f64b7c796878a465f36307b6ca65f9d03e336feb7","observation_id":"507ba4d0-30f0-471d-8874-3421f9d7af70","resolution":{"observed_at":"2026-08-05T00:18:33.501692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2628.25229","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:18:43.843848Z","title":"A practical and configurable lip sync method for games,","venue":null,"work_id":"9ce1aafc-0472-4476-ba9d-bc7d824e33b6","year":2013},"citing_paper":{"arxiv_id":"2608.01605","last_updated":"2026-08-03T02:24:23Z","snapshot_observed_at":"2026-08-07T13:15:08.040478Z","submitted_at":"2026-08-03T02:24:23Z","title":"ETHead: Generating Expressive 3D Facial Animation and Head Movement from Speech","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T00:18:33.583654Z"},"links":{"citing_paper":"/paper/2608.01605"},"observation_digest":"sha256:89be8c91402f1d7fe40e8737b9daa61d76164e8deb439b21a300805d515a26e1","observation_id":"772139f6-cde7-4974-885b-d3137445274c","resolution":{"observed_at":"2026-08-05T00:18:44.012264Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:18:33.649543Z","title":"Speech-driven 3d face animation with composite and regional facial movements,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.01605","last_updated":"2026-08-03T02:24:23Z","snapshot_observed_at":"2026-08-07T13:15:08.040478Z","submitted_at":"2026-08-03T02:24:23Z","title":"ETHead: Generating Expressive 3D Facial Animation and Head Movement from Speech","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T00:18:33.649543Z"},"links":{"citing_paper":"/paper/2608.01605"},"observation_digest":"sha256:c835038cb248c6ceaa389bdf65a5370316de32a40a7869eee99cb8d35e6e7a00","observation_id":"7f650d98-2c41-4b55-9185-d5897b98bc99","resolution":{"observed_at":"2026-08-05T00:18:33.649543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:18:33.718770Z","title":"Ecavatar: 3d avatar facial animation with controllable identity and emotion,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01605","last_updated":"2026-08-03T02:24:23Z","snapshot_observed_at":"2026-08-07T13:15:08.040478Z","submitted_at":"2026-08-03T02:24:23Z","title":"ETHead: Generating Expressive 3D Facial Animation and Head Movement from Speech","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T00:18:33.718770Z"},"links":{"citing_paper":"/paper/2608.01605"},"observation_digest":"sha256:053bd07b8fd2b3409c5b03b32ac8651448fa31b1518828bf11be5f39ae734d18","observation_id":"d5f5e9ef-0e06-4156-b7e7-d1476e033961","resolution":{"observed_at":"2026-08-05T00:18:33.718770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:18:33.780560Z","title":"S3: speech, script and scene driven head and eye animation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01605","last_updated":"2026-08-03T02:24:23Z","snapshot_observed_at":"2026-08-07T13:15:08.040478Z","submitted_at":"2026-08-03T02:24:23Z","title":"ETHead: Generating Expressive 3D Facial Animation and Head Movement from Speech","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T00:18:33.780560Z"},"links":{"citing_paper":"/paper/2608.01605"},"observation_digest":"sha256:c91048482b29b702def7f4d1380a526b36a7ae45219b2290f0c37b047a4bd540","observation_id":"622e25dc-3b6a-433d-9262-e1ec7302ce1a","resolution":{"observed_at":"2026-08-05T00:18:33.780560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:18:33.854360Z","title":"Expressive 3d facial animation generation based on local-to-global latent diffusion,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01605","last_updated":"2026-08-03T02:24:23Z","snapshot_observed_at":"2026-08-07T13:15:08.040478Z","submitted_at":"2026-08-03T02:24:23Z","title":"ETHead: Generating Expressive 3D Facial Animation and Head Movement from Speech","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T00:18:33.854360Z"},"links":{"citing_paper":"/paper/2608.01605"},"observation_digest":"sha256:514d5895a4b4dba34bc92a412a8c75c55b131f27f560208bde3c4fcd5e9ee150","observation_id":"651105a2-8c5c-4e54-889f-d0057035140f","resolution":{"observed_at":"2026-08-05T00:18:33.854360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:18:57.780626Z","title":"Learn2talk: 3d talking face learns from 2d talking face,","venue":null,"work_id":"6070dc8a-9e4d-4782-95fa-dccdae02450d","year":2025},"citing_paper":{"arxiv_id":"2608.01605","last_updated":"2026-08-03T02:24:23Z","snapshot_observed_at":"2026-08-07T13:15:08.040478Z","submitted_at":"2026-08-03T02:24:23Z","title":"ETHead: Generating Expressive 3D Facial Animation and Head Movement from Speech","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T00:18:33.906828Z"},"links":{"citing_paper":"/paper/2608.01605"},"observation_digest":"sha256:289107635ff03899a7aa458e58d2be6eb472dfb413ac48e44d94f44e4ecb9900","observation_id":"3c0343b5-3d79-495f-9010-6c298c3f3cc3","resolution":{"observed_at":"2026-08-05T00:18:57.827465Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:18:57.618106Z","title":"Talkingstyle: Personalized speech-driven 3d facial animation with style preservation,","venue":null,"work_id":"d0731597-bf5c-43b9-b4ce-97d5f635478a","year":2025},"citing_paper":{"arxiv_id":"2608.01605","last_updated":"2026-08-03T02:24:23Z","snapshot_observed_at":"2026-08-07T13:15:08.040478Z","submitted_at":"2026-08-03T02:24:23Z","title":"ETHead: Generating Expressive 3D Facial Animation and Head Movement from Speech","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T00:18:34.009731Z"},"links":{"citing_paper":"/paper/2608.01605"},"observation_digest":"sha256:494c0bf990c95ba5b1bbf510c4058d969d4093d077845d3cddfea1a5db8206f6","observation_id":"403bd45b-8350-45c8-9208-e8e581f2f69d","resolution":{"observed_at":"2026-08-05T00:18:57.688584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:18:57.428269Z","title":"Emoface: Audio-driven emotional 3d face animation,","venue":null,"work_id":"6eebd008-3b2b-4557-bb57-750f4bd22c7c","year":2024},"citing_paper":{"arxiv_id":"2608.01605","last_updated":"2026-08-03T02:24:23Z","snapshot_observed_at":"2026-08-07T13:15:08.040478Z","submitted_at":"2026-08-03T02:24:23Z","title":"ETHead: Generating Expressive 3D Facial Animation and Head Movement from Speech","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T00:18:34.094650Z"},"links":{"citing_paper":"/paper/2608.01605"},"observation_digest":"sha256:95f2d66cb2de4fffb90eb6660d7b55c33aabf2163cc64d163be2af7fb8c0d96c","observation_id":"a0289e55-2ab3-41fc-aa55-f49849216aa6","resolution":{"observed_at":"2026-08-05T00:18:57.536561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:18:57.272859Z","title":"Perceptually accurate 3d talking head generation: New definitions, speech-mesh representation, and evaluation metrics,","venue":null,"work_id":"f13854fe-fe5d-42bd-904a-e75acead7343","year":2025},"citing_paper":{"arxiv_id":"2608.01605","last_updated":"2026-08-03T02:24:23Z","snapshot_observed_at":"2026-08-07T13:15:08.040478Z","submitted_at":"2026-08-03T02:24:23Z","title":"ETHead: Generating Expressive 3D Facial Animation and Head Movement from Speech","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T00:18:34.186493Z"},"links":{"citing_paper":"/paper/2608.01605"},"observation_digest":"sha256:76677ece99a8c2841819428298ee7c9c703b5d779cda9e257a9f8c1013804bd2","observation_id":"7019446e-0bbb-47e1-8daf-3dc71029b8c8","resolution":{"observed_at":"2026-08-05T00:18:57.353387Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:18:57.056552Z","title":"Wav2sem: Plug-and- play audio semantic decoupling for 3d speech-driven facial animation,","venue":null,"work_id":"952bca4d-482d-4d2c-b0ee-ca3727182531","year":2025},"citing_paper":{"arxiv_id":"2608.01605","last_updated":"2026-08-03T02:24:23Z","snapshot_observed_at":"2026-08-07T13:15:08.040478Z","submitted_at":"2026-08-03T02:24:23Z","title":"ETHead: Generating Expressive 3D Facial Animation and Head Movement from Speech","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T00:18:34.290231Z"},"links":{"citing_paper":"/paper/2608.01605"},"observation_digest":"sha256:52a46077b62d701b055f77428312f6cbb69bc61b6ef8e1ae15a5ba6a4e6bc510","observation_id":"ce07f3f3-fecd-4fd9-9cac-43dcbb30e296","resolution":{"observed_at":"2026-08-05T00:18:57.165079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:18:56.870657Z","title":"Ot-talk: Animating 3d talking head with optimal transportation,","venue":null,"work_id":"a2e2dfff-acb7-43b5-a7dd-8f36e14c9def","year":2025},"citing_paper":{"arxiv_id":"2608.01605","last_updated":"2026-08-03T02:24:23Z","snapshot_observed_at":"2026-08-07T13:15:08.040478Z","submitted_at":"2026-08-03T02:24:23Z","title":"ETHead: Generating Expressive 3D Facial Animation and Head Movement from Speech","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T00:18:34.375364Z"},"links":{"citing_paper":"/paper/2608.01605"},"observation_digest":"sha256:d7a2851f71cbf8e36cc9688435a60679e46df3226708e11d2496104c1d837d3e","observation_id":"168539c1-523f-4616-a26f-647e685bc0da","resolution":{"observed_at":"2026-08-05T00:18:56.935446Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:18:56.687601Z","title":"Medtalk: Mul- timodal controlled 3d facial animation with dynamic emotions by disentangled embedding,","venue":null,"work_id":"16ee4346-1527-40aa-8f21-49b18020adb1","year":2025},"citing_paper":{"arxiv_id":"2608.01605","last_updated":"2026-08-03T02:24:23Z","snapshot_observed_at":"2026-08-07T13:15:08.040478Z","submitted_at":"2026-08-03T02:24:23Z","title":"ETHead: Generating Expressive 3D Facial Animation and Head Movement from Speech","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T00:18:34.431755Z"},"links":{"citing_paper":"/paper/2608.01605"},"observation_digest":"sha256:ba05a00eb86f0d6924151ff70f26c188759eb8b9c96fad8be757b6f830863fba","observation_id":"0a05123a-c899-4e0c-9aca-677d9166c1ba","resolution":{"observed_at":"2026-08-05T00:18:56.773984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:18:56.563583Z","title":"Ptalker: Personal- ized speech-driven 3d talking head animation via style disentanglement and modality alignment,","venue":null,"work_id":"7b3ec472-2893-4873-809b-df2ee3f9e29f","year":2025},"citing_paper":{"arxiv_id":"2608.01605","last_updated":"2026-08-03T02:24:23Z","snapshot_observed_at":"2026-08-07T13:15:08.040478Z","submitted_at":"2026-08-03T02:24:23Z","title":"ETHead: Generating Expressive 3D Facial Animation and Head Movement from Speech","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T00:18:34.578766Z"},"links":{"citing_paper":"/paper/2608.01605"},"observation_digest":"sha256:b44752c5147c4429344b50772a4d51bd601bd5f401514682e335d379e954267c","observation_id":"32cb8dba-6387-4ad7-a8b0-b8fbdf6ff196","resolution":{"observed_at":"2026-08-05T00:18:56.626417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:18:56.399615Z","title":"Artalk: Speech- driven 3d head animation via autoregressive model,","venue":null,"work_id":"c34a1573-b748-4e14-9a7e-b340f93cbfe7","year":2025},"citing_paper":{"arxiv_id":"2608.01605","last_updated":"2026-08-03T02:24:23Z","snapshot_observed_at":"2026-08-07T13:15:08.040478Z","submitted_at":"2026-08-03T02:24:23Z","title":"ETHead: Generating Expressive 3D Facial Animation and Head Movement from Speech","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T00:18:34.686942Z"},"links":{"citing_paper":"/paper/2608.01605"},"observation_digest":"sha256:76905a47f9ea5b7d11311d0acfc8730e8d540b8bf6777ee448767c2cd7c1397f","observation_id":"01fd8f6d-32e8-4514-9ead-eb7142420c16","resolution":{"observed_at":"2026-08-05T00:18:56.481255Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:18:56.247397Z","title":"Emovoca: Speech-driven emotional 3d talking heads,","venue":null,"work_id":"5eb21c2b-fbcf-416a-a1aa-4a7e280462f8","year":2025},"citing_paper":{"arxiv_id":"2608.01605","last_updated":"2026-08-03T02:24:23Z","snapshot_observed_at":"2026-08-07T13:15:08.040478Z","submitted_at":"2026-08-03T02:24:23Z","title":"ETHead: Generating Expressive 3D Facial Animation and Head Movement from Speech","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T00:18:34.805095Z"},"links":{"citing_paper":"/paper/2608.01605"},"observation_digest":"sha256:8276af201a51a9f6e38cdb76dc4bc1cc19a0401ecaf88d45e36dd75c2ce7c81a","observation_id":"5f4b5eab-faad-40aa-8055-7ff4c41de63c","resolution":{"observed_at":"2026-08-05T00:18:56.314685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:18:56.075618Z","title":"A semantic talking style space for speech-driven facial animation,","venue":null,"work_id":"602d3cfd-853d-4774-b38d-71f4ac01cfa7","year":2025},"citing_paper":{"arxiv_id":"2608.01605","last_updated":"2026-08-03T02:24:23Z","snapshot_observed_at":"2026-08-07T13:15:08.040478Z","submitted_at":"2026-08-03T02:24:23Z","title":"ETHead: Generating Expressive 3D Facial Animation and Head Movement from Speech","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T00:18:34.938455Z"},"links":{"citing_paper":"/paper/2608.01605"},"observation_digest":"sha256:a06304444875227390f3e23bf88f21fc3a455be458f0fe80af103143b993b1e1","observation_id":"041eb142-621d-41c9-a534-91689d20e83b","resolution":{"observed_at":"2026-08-05T00:18:56.172830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:18:55.904257Z","title":"Facexhubert: Text-less speech-driven e(x)pressive 3d facial animation synthesis using self-supervised speech representation learning,","venue":null,"work_id":"b11e3e76-edcb-4792-9ce5-9634dbf578d9","year":2023},"citing_paper":{"arxiv_id":"2608.01605","last_updated":"2026-08-03T02:24:23Z","snapshot_observed_at":"2026-08-07T13:15:08.040478Z","submitted_at":"2026-08-03T02:24:23Z","title":"ETHead: Generating Expressive 3D Facial Animation and Head Movement from Speech","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T00:18:35.087776Z"},"links":{"citing_paper":"/paper/2608.01605"},"observation_digest":"sha256:b5b86746f943573ef1c384054dcecbb84ad9218eabec57d042babbe7b17b889a","observation_id":"3677bef0-fe05-4eeb-b42e-a410876bc327","resolution":{"observed_at":"2026-08-05T00:18:56.006706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:18:55.739672Z","title":"Capture, learning, and synthesis of 3d speaking styles,","venue":null,"work_id":"517cdc45-0635-4ddb-bb29-18520b6f409c","year":2019},"citing_paper":{"arxiv_id":"2608.01605","last_updated":"2026-08-03T02:24:23Z","snapshot_observed_at":"2026-08-07T13:15:08.040478Z","submitted_at":"2026-08-03T02:24:23Z","title":"ETHead: Generating Expressive 3D Facial Animation and Head Movement from Speech","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T00:18:35.200099Z"},"links":{"citing_paper":"/paper/2608.01605"},"observation_digest":"sha256:82afbba83b11c5a935109f71a630ad4385f1939063d83f720292dfe512ae34d4","observation_id":"b9fb4379-bec6-487c-8f34-a0aa7e3d1ed9","resolution":{"observed_at":"2026-08-05T00:18:55.826495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:18:55.573801Z","title":"Meshtalk: 3d face animation from speech using cross-modality disen- tanglement,","venue":null,"work_id":"780cebbd-b63f-4952-a873-a8adcaeb752c","year":2021},"citing_paper":{"arxiv_id":"2608.01605","last_updated":"2026-08-03T02:24:23Z","snapshot_observed_at":"2026-08-07T13:15:08.040478Z","submitted_at":"2026-08-03T02:24:23Z","title":"ETHead: Generating Expressive 3D Facial Animation and Head Movement from Speech","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T00:18:35.287170Z"},"links":{"citing_paper":"/paper/2608.01605"},"observation_digest":"sha256:8b8fbed61832737a7c2d85fef558e7842e43d9a07a35e210258ff8d9515cc2af","observation_id":"f383d3b7-6bd2-4b43-a777-0f4f312a6f30","resolution":{"observed_at":"2026-08-05T00:18:55.641464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:18:55.391066Z","title":"Unitalker: Scaling up audio- driven 3d facial animation through A unified model,","venue":null,"work_id":"9561cfa4-45d0-4582-9089-aa04c01d9203","year":2024},"citing_paper":{"arxiv_id":"2608.01605","last_updated":"2026-08-03T02:24:23Z","snapshot_observed_at":"2026-08-07T13:15:08.040478Z","submitted_at":"2026-08-03T02:24:23Z","title":"ETHead: Generating Expressive 3D Facial Animation and Head Movement from Speech","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T00:18:35.443591Z"},"links":{"citing_paper":"/paper/2608.01605"},"observation_digest":"sha256:867bb1a35b653675a16b20ebb2e0322cf5d7c6fe184bafd8d985572e874d80b8","observation_id":"605b0612-a393-45e3-9287-836f11eaafa5","resolution":{"observed_at":"2026-08-05T00:18:55.467591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:18:55.212668Z","title":"Faceformer: Speech- driven 3d facial animation with transformers,","venue":null,"work_id":"5b68426b-0315-426e-89ad-3a87a7e7d50b","year":2022},"citing_paper":{"arxiv_id":"2608.01605","last_updated":"2026-08-03T02:24:23Z","snapshot_observed_at":"2026-08-07T13:15:08.040478Z","submitted_at":"2026-08-03T02:24:23Z","title":"ETHead: Generating Expressive 3D Facial Animation and Head Movement from Speech","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T00:18:35.611063Z"},"links":{"citing_paper":"/paper/2608.01605"},"observation_digest":"sha256:16b9d15a5335f07006980a59e22748f7dd42bb6ea8150ad2cf51247d4d1a0ec6","observation_id":"0c8d6f46-499c-4da7-af27-d1da40db306d","resolution":{"observed_at":"2026-08-05T00:18:55.305360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:18:55.066772Z","title":"Selftalk: A self-supervised commutative training diagram to compre- hend 3d talking faces,","venue":null,"work_id":"7ef9b653-381a-4962-8f2f-701994262e1a","year":2023},"citing_paper":{"arxiv_id":"2608.01605","last_updated":"2026-08-03T02:24:23Z","snapshot_observed_at":"2026-08-07T13:15:08.040478Z","submitted_at":"2026-08-03T02:24:23Z","title":"ETHead: Generating Expressive 3D Facial Animation and Head Movement from Speech","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T00:18:35.772220Z"},"links":{"citing_paper":"/paper/2608.01605"},"observation_digest":"sha256:31b8ce131feda2e12c67854f6a21a73c96a855763e40175fc0ddaa01b7c93589","observation_id":"ba245495-cfc7-496b-a6a8-e0a391acd1b6","resolution":{"observed_at":"2026-08-05T00:18:55.128113Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:18:54.913723Z","title":"Pmmtalk: Speech-driven 3d facial animation from complementary pseudo multi-modal features,","venue":null,"work_id":"193a2f18-f0d7-4a1e-bd14-4155b3e422e9","year":2025},"citing_paper":{"arxiv_id":"2608.01605","last_updated":"2026-08-03T02:24:23Z","snapshot_observed_at":"2026-08-07T13:15:08.040478Z","submitted_at":"2026-08-03T02:24:23Z","title":"ETHead: Generating Expressive 3D Facial Animation and Head Movement from Speech","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T00:18:35.883364Z"},"links":{"citing_paper":"/paper/2608.01605"},"observation_digest":"sha256:a87002cff389a5afb414ce58dfa33fdeae9e58faf7356873cf36ab6417881333","observation_id":"ea676d1d-837d-4723-a608-0df9e6b6253b","resolution":{"observed_at":"2026-08-05T00:18:54.980237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:18:54.728923Z","title":"Expclip: Bridging text and facial expressions via semantic alignment,","venue":null,"work_id":"164849c9-12a4-4e3c-b4fb-f89e480c9fa8","year":2024},"citing_paper":{"arxiv_id":"2608.01605","last_updated":"2026-08-03T02:24:23Z","snapshot_observed_at":"2026-08-07T13:15:08.040478Z","submitted_at":"2026-08-03T02:24:23Z","title":"ETHead: Generating Expressive 3D Facial Animation and Head Movement from Speech","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T00:18:36.011456Z"},"links":{"citing_paper":"/paper/2608.01605"},"observation_digest":"sha256:66217f1ed3582ffc0be99896b4d55c64ab81ebd060f10b406c586bec2c3feabc","observation_id":"0c80b671-9333-4329-8c58-15195b936cbc","resolution":{"observed_at":"2026-08-05T00:18:54.830932Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:18:54.519140Z","title":"Mimic: Speaking style disentanglement for speech-driven 3d facial animation,","venue":null,"work_id":"69f31591-c8f5-4fd9-94cf-4c9ee3401d5c","year":2024},"citing_paper":{"arxiv_id":"2608.01605","last_updated":"2026-08-03T02:24:23Z","snapshot_observed_at":"2026-08-07T13:15:08.040478Z","submitted_at":"2026-08-03T02:24:23Z","title":"ETHead: Generating Expressive 3D Facial Animation and Head Movement from Speech","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T00:18:36.102810Z"},"links":{"citing_paper":"/paper/2608.01605"},"observation_digest":"sha256:58ee4ef97cf903db201e2cd8505106f027e305750566411ba3a40eb7e4b2f8ad","observation_id":"d40250a3-4641-4937-a51c-e33402163d2a","resolution":{"observed_at":"2026-08-05T00:18:54.623073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:18:54.329941Z","title":"Kmtalk: Speech-driven 3d facial animation with key motion embed- ding,","venue":null,"work_id":"4fae56d3-49d0-4849-88a5-550478c4e011","year":2024},"citing_paper":{"arxiv_id":"2608.01605","last_updated":"2026-08-03T02:24:23Z","snapshot_observed_at":"2026-08-07T13:15:08.040478Z","submitted_at":"2026-08-03T02:24:23Z","title":"ETHead: Generating Expressive 3D Facial Animation and Head Movement from Speech","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T00:18:36.208793Z"},"links":{"citing_paper":"/paper/2608.01605"},"observation_digest":"sha256:40cdf2bb6b824a433551ae1a1cd6da2f7d5d1d5882258236fbe3e1f21f2d5576","observation_id":"cd70264a-9da0-4a09-aaf0-49924af5fc01","resolution":{"observed_at":"2026-08-05T00:18:54.401809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:18:54.148442Z","title":"ScanTalk: 3d talking heads from unregistered scans,","venue":null,"work_id":"736dbad1-f980-4183-a3d3-3873cb92adbe","year":2024},"citing_paper":{"arxiv_id":"2608.01605","last_updated":"2026-08-03T02:24:23Z","snapshot_observed_at":"2026-08-07T13:15:08.040478Z","submitted_at":"2026-08-03T02:24:23Z","title":"ETHead: Generating Expressive 3D Facial Animation and Head Movement from Speech","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T00:18:36.323664Z"},"links":{"citing_paper":"/paper/2608.01605"},"observation_digest":"sha256:746c632f4c24d2d8ab561c3fdaf126835f42b41c4407f8dd257ad2589da5eaf5","observation_id":"e3d0e375-75b5-4f5e-91ba-f8444750b82d","resolution":{"observed_at":"2026-08-05T00:18:54.227914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:18:53.953059Z","title":"Deitalk: Speech-driven 3d facial animation with dynamic emotional intensity modeling,","venue":null,"work_id":"d454dfc0-a432-48b6-a117-2334e091da30","year":2024},"citing_paper":{"arxiv_id":"2608.01605","last_updated":"2026-08-03T02:24:23Z","snapshot_observed_at":"2026-08-07T13:15:08.040478Z","submitted_at":"2026-08-03T02:24:23Z","title":"ETHead: Generating Expressive 3D Facial Animation and Head Movement from Speech","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T00:18:36.419316Z"},"links":{"citing_paper":"/paper/2608.01605"},"observation_digest":"sha256:fd64324e96ff4edc2394ff53d1ccbaf1d319cdb4c612a2842c29108762258df4","observation_id":"3e56e41a-e1a2-4bb7-9699-73c8fec4f0be","resolution":{"observed_at":"2026-08-05T00:18:54.041470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:18:53.777682Z","title":"Audio-driven speech animation with text-guided expression,","venue":null,"work_id":"378afe6d-1ef6-4178-bfb2-467a1a30e239","year":2024},"citing_paper":{"arxiv_id":"2608.01605","last_updated":"2026-08-03T02:24:23Z","snapshot_observed_at":"2026-08-07T13:15:08.040478Z","submitted_at":"2026-08-03T02:24:23Z","title":"ETHead: Generating Expressive 3D Facial Animation and Head Movement from Speech","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T00:18:36.525141Z"},"links":{"citing_paper":"/paper/2608.01605"},"observation_digest":"sha256:b18d9bc9e4312cdf7872c0427231ee764fae8fc247ad15236623789c34db86c4","observation_id":"8c2b2e65-e7a0-4122-aa8c-743bdf614145","resolution":{"observed_at":"2026-08-05T00:18:53.843629Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:18:53.612163Z","title":"Memorytalker: Personalized speech- driven 3d facial animation via audio-guided stylization,","venue":null,"work_id":"ebb4fc01-82d6-4ba0-9fc2-da3524b75c79","year":2025},"citing_paper":{"arxiv_id":"2608.01605","last_updated":"2026-08-03T02:24:23Z","snapshot_observed_at":"2026-08-07T13:15:08.040478Z","submitted_at":"2026-08-03T02:24:23Z","title":"ETHead: Generating Expressive 3D Facial Animation and Head Movement from Speech","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T00:18:36.695611Z"},"links":{"citing_paper":"/paper/2608.01605"},"observation_digest":"sha256:65d020580468d13465e5bfa0e326414954c57d369fb0a7443ecf549c6171d062","observation_id":"e0885e40-f8d2-446a-80d0-5836b23c7fcf","resolution":{"observed_at":"2026-08-05T00:18:53.686844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09852","last_updated":"2025-03-12T21:18:20Z","snapshot_observed_at":"2026-08-07T17:08:52.833450Z","submitted_at":"2025-03-12T21:18:20Z","title":"StyleSpeaker: Audio-Enhanced Fine-Grained Style Modeling for Speech-Driven 3D Facial Animation","version":1},"cited_work":{"arxiv_id":"2503.09852","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.09852","snapshot_observed_at":"2026-08-05T00:18:43.476870Z","title":"StyleSpeaker: Audio-Enhanced Fine-Grained Style Modeling for Speech-Driven 3D Facial Animation","venue":"cs.MM","work_id":"4febb3b2-b97f-478a-8335-ec48279132f6","year":2025},"citing_paper":{"arxiv_id":"2608.01605","last_updated":"2026-08-03T02:24:23Z","snapshot_observed_at":"2026-08-07T13:15:08.040478Z","submitted_at":"2026-08-03T02:24:23Z","title":"ETHead: Generating Expressive 3D Facial Animation and Head Movement from Speech","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T00:18:36.827897Z"},"links":{"cited_paper":"/paper/2503.09852","citing_paper":"/paper/2608.01605"},"observation_digest":"sha256:06d7788e6f586e92127bae9f915d673f1630d4f26aaeaddc35491a1058b74491","observation_id":"3eff0c3c-a4b8-4745-be99-50483da00996","resolution":{"observed_at":"2026-08-05T00:18:43.590933Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:18:53.461799Z","title":"Pestalk: Speech-driven 3d facial animation with personalized emotional styles,","venue":null,"work_id":"ef0c4cfb-39e3-491c-bdab-acf44e20d9d0","year":2025},"citing_paper":{"arxiv_id":"2608.01605","last_updated":"2026-08-03T02:24:23Z","snapshot_observed_at":"2026-08-07T13:15:08.040478Z","submitted_at":"2026-08-03T02:24:23Z","title":"ETHead: Generating Expressive 3D Facial Animation and Head Movement from Speech","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T00:18:36.932286Z"},"links":{"citing_paper":"/paper/2608.01605"},"observation_digest":"sha256:7385dd0fe1a5f0a9e8ff49c74b71ce1168652a3e0aaf98b9126b4f9e88f93e66","observation_id":"967ef983-61cf-4849-b08d-bfcaaac9848c","resolution":{"observed_at":"2026-08-05T00:18:53.538807Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:18:53.274723Z","title":"Codetalker: Speech-driven 3d facial animation with discrete motion prior,","venue":null,"work_id":"0e1e7195-f354-4409-9e6e-b3b018a62700","year":2023},"citing_paper":{"arxiv_id":"2608.01605","last_updated":"2026-08-03T02:24:23Z","snapshot_observed_at":"2026-08-07T13:15:08.040478Z","submitted_at":"2026-08-03T02:24:23Z","title":"ETHead: Generating Expressive 3D Facial Animation and Head Movement from Speech","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T00:18:37.007980Z"},"links":{"citing_paper":"/paper/2608.01605"},"observation_digest":"sha256:11a6cce6559e64e3b65693254bac44bcfa6e6c96d0cd1a1be4c7171258066b1d","observation_id":"d21ca762-3b8a-4e08-99f4-34a07be7a8ed","resolution":{"observed_at":"2026-08-05T00:18:53.370103Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:18:53.108710Z","title":"Probabilistic speech-driven 3d facial motion synthesis: New bench- marks, methods, and applications,","venue":null,"work_id":"5172cbdd-1c91-4b6c-b43d-fcfc1fa77a90","year":2024},"citing_paper":{"arxiv_id":"2608.01605","last_updated":"2026-08-03T02:24:23Z","snapshot_observed_at":"2026-08-07T13:15:08.040478Z","submitted_at":"2026-08-03T02:24:23Z","title":"ETHead: Generating Expressive 3D Facial Animation and Head Movement from Speech","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T00:18:37.196130Z"},"links":{"citing_paper":"/paper/2608.01605"},"observation_digest":"sha256:963f9ead5c345a0557055faccaa5e938055f5767b7d3a273b14d1a94725da987","observation_id":"0a9daaba-ecdd-4549-801e-a255e003d5e7","resolution":{"observed_at":"2026-08-05T00:18:53.192901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:18:52.968739Z","title":"Multitalk: Enhancing 3d talking head generation across languages with multilingual video dataset,","venue":null,"work_id":"f39de21a-4009-4601-9a4f-5626f93e276f","year":2024},"citing_paper":{"arxiv_id":"2608.01605","last_updated":"2026-08-03T02:24:23Z","snapshot_observed_at":"2026-08-07T13:15:08.040478Z","submitted_at":"2026-08-03T02:24:23Z","title":"ETHead: Generating Expressive 3D Facial Animation and Head Movement from Speech","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T00:18:37.332606Z"},"links":{"citing_paper":"/paper/2608.01605"},"observation_digest":"sha256:49a43494a046a63cc49021721bee16b62eb7f19c533ca0c3084b107bcf046876","observation_id":"42ed041a-6200-4e9d-b614-cb67b81d3ef6","resolution":{"observed_at":"2026-08-05T00:18:53.039715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:18:52.778370Z","title":"Probtalk3d: Non-deterministic emotion controllable speech-driven 3d facial animation synthesis using VQ-V AE,","venue":null,"work_id":"0aa90234-9c0b-488b-8f8e-d6fde3c21077","year":2024},"citing_paper":{"arxiv_id":"2608.01605","last_updated":"2026-08-03T02:24:23Z","snapshot_observed_at":"2026-08-07T13:15:08.040478Z","submitted_at":"2026-08-03T02:24:23Z","title":"ETHead: Generating Expressive 3D Facial Animation and Head Movement from Speech","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-05T00:18:37.504532Z"},"links":{"citing_paper":"/paper/2608.01605"},"observation_digest":"sha256:109aef8dac1a67185f78d717d26bcc99927cde0f07d01a3476380c4ccec0ef8d","observation_id":"123f66ee-8bd8-4aba-967a-b8a03a5e5733","resolution":{"observed_at":"2026-08-05T00:18:52.876955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:18:52.616621Z","title":"Mmhead: Towards fine-grained multi-modal 3d facial animation,","venue":null,"work_id":"8ee2b2b6-5811-4a01-b941-4d0f05461c22","year":2024},"citing_paper":{"arxiv_id":"2608.01605","last_updated":"2026-08-03T02:24:23Z","snapshot_observed_at":"2026-08-07T13:15:08.040478Z","submitted_at":"2026-08-03T02:24:23Z","title":"ETHead: Generating Expressive 3D Facial Animation and Head Movement from Speech","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T00:18:37.594603Z"},"links":{"citing_paper":"/paper/2608.01605"},"observation_digest":"sha256:ed41d7797e5becd84791d66cfc2d45db38e3a6653bd6e3ca8e673460aa6b998f","observation_id":"dd1b4140-363e-4834-8103-c197258b4d88","resolution":{"observed_at":"2026-08-05T00:18:52.685123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:18:52.414320Z","title":"Deeptalk: Dynamic emotion embedding for probabilistic speech-driven 3d face animation,","venue":null,"work_id":"e4e235bd-8b53-42b3-8014-e7a16199f5c0","year":2025},"citing_paper":{"arxiv_id":"2608.01605","last_updated":"2026-08-03T02:24:23Z","snapshot_observed_at":"2026-08-07T13:15:08.040478Z","submitted_at":"2026-08-03T02:24:23Z","title":"ETHead: Generating Expressive 3D Facial Animation and Head Movement from Speech","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-05T00:18:37.670334Z"},"links":{"citing_paper":"/paper/2608.01605"},"observation_digest":"sha256:ab747a3285166f7f00d78eb03d60b501d454acc89063d2fffcc35fa082f5a0de","observation_id":"54bcfee6-0062-4bfd-9048-24a8948f3cf8","resolution":{"observed_at":"2026-08-05T00:18:52.521899Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:18:52.262330Z","title":"Prosodytalker: 3d visual speech animation via prosody decomposition,","venue":null,"work_id":"53779372-7dd5-4ae6-a6dd-63d367d4db79","year":2025},"citing_paper":{"arxiv_id":"2608.01605","last_updated":"2026-08-03T02:24:23Z","snapshot_observed_at":"2026-08-07T13:15:08.040478Z","submitted_at":"2026-08-03T02:24:23Z","title":"ETHead: Generating Expressive 3D Facial Animation and Head Movement from Speech","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-05T00:18:37.779015Z"},"links":{"citing_paper":"/paper/2608.01605"},"observation_digest":"sha256:4ce53bb02ac5e822dfdb16a64067ce6752ab99b375d4b0d402f178573458f29b","observation_id":"795171b9-6ff3-4d62-823d-dccf5d3ceba6","resolution":{"observed_at":"2026-08-05T00:18:52.359917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:18:52.088312Z","title":"Let’s chorus: Partner-aware hybrid song-driven 3d head animation,","venue":null,"work_id":"0c26a40c-3b23-4f40-9632-dacbdfbb0932","year":2025},"citing_paper":{"arxiv_id":"2608.01605","last_updated":"2026-08-03T02:24:23Z","snapshot_observed_at":"2026-08-07T13:15:08.040478Z","submitted_at":"2026-08-03T02:24:23Z","title":"ETHead: Generating Expressive 3D Facial Animation and Head Movement from Speech","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-05T00:18:37.879865Z"},"links":{"citing_paper":"/paper/2608.01605"},"observation_digest":"sha256:2973b21ddfb13985b6ffbb08673c38769dc3e430e3c969f71017f99f20d7e38e","observation_id":"87ce9e96-dbe7-4f5f-a1db-e1432a8498bd","resolution":{"observed_at":"2026-08-05T00:18:52.188270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:18:51.936385Z","title":"Facediffuser: Speech-driven 3d facial animation synthesis using diffusion,","venue":null,"work_id":"85dde6f8-2e20-4537-a4d7-07f4bd8f3ccc","year":2023},"citing_paper":{"arxiv_id":"2608.01605","last_updated":"2026-08-03T02:24:23Z","snapshot_observed_at":"2026-08-07T13:15:08.040478Z","submitted_at":"2026-08-03T02:24:23Z","title":"ETHead: Generating Expressive 3D Facial Animation and Head Movement from Speech","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-05T00:18:37.980078Z"},"links":{"citing_paper":"/paper/2608.01605"},"observation_digest":"sha256:7a9739cb7d55af3211b6177504dfa18bc31f6c911af5949046e7cc5751a2cff7","observation_id":"06d638d2-2102-4810-913f-17b5ad43a6ad","resolution":{"observed_at":"2026-08-05T00:18:52.000556Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:18:51.757718Z","title":"3diface: Synthesizing and editing holistic 3d facial animation,","venue":null,"work_id":"a6122224-5102-40f4-9d4f-3e022a07bfc3","year":2025},"citing_paper":{"arxiv_id":"2608.01605","last_updated":"2026-08-03T02:24:23Z","snapshot_observed_at":"2026-08-07T13:15:08.040478Z","submitted_at":"2026-08-03T02:24:23Z","title":"ETHead: Generating Expressive 3D Facial Animation and Head Movement from Speech","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-05T00:18:38.084049Z"},"links":{"citing_paper":"/paper/2608.01605"},"observation_digest":"sha256:58af1ed0af445582674945251373044d1d23b622673e65ecc349bff39718b03c","observation_id":"c49b4df0-f01a-438b-9337-5b87dee9cd79","resolution":{"observed_at":"2026-08-05T00:18:51.840073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05712","last_updated":"2024-02-08T14:39:16Z","snapshot_observed_at":"2026-08-04T13:02:13.622096Z","submitted_at":"2024-02-08T14:39:16Z","title":"DiffSpeaker: Speech-Driven 3D Facial Animation with Diffusion Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05712","snapshot_observed_at":"2026-08-05T00:18:38.203449Z","title":"Diffspeaker: Speech-driven 3d facial animation with diffusion transformer,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01605","last_updated":"2026-08-03T02:24:23Z","snapshot_observed_at":"2026-08-07T13:15:08.040478Z","submitted_at":"2026-08-03T02:24:23Z","title":"ETHead: Generating Expressive 3D Facial Animation and Head Movement from Speech","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-05T00:18:38.203449Z"},"links":{"cited_paper":"/paper/2402.05712","citing_paper":"/paper/2608.01605"},"observation_digest":"sha256:ed5bee6962426fdda26411bd485e30a1388489e31cacf85d5d3569e27f82dcdc","observation_id":"c6d9f09c-45dc-49af-8b6b-1fcd988ad88b","resolution":{"observed_at":"2026-08-05T00:18:38.203449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:18:51.480644Z","title":"Diffusiontalker: Efficient and compact speech-driven 3d talking head via personalizer-guided distillation,","venue":null,"work_id":"f2b930e7-e0d4-4b60-b046-3af8e74077b2","year":2025},"citing_paper":{"arxiv_id":"2608.01605","last_updated":"2026-08-03T02:24:23Z","snapshot_observed_at":"2026-08-07T13:15:08.040478Z","submitted_at":"2026-08-03T02:24:23Z","title":"ETHead: Generating Expressive 3D Facial Animation and Head Movement from Speech","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-05T00:18:38.327954Z"},"links":{"citing_paper":"/paper/2608.01605"},"observation_digest":"sha256:30f64557a5f1745b5a1e2411f2d4d7e87012d176a8449d0508f5c0bbb1ec9098","observation_id":"be42c5b2-1df0-4f02-aec2-ea9142e2990d","resolution":{"observed_at":"2026-08-05T00:18:51.662713Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:18:51.257980Z","title":"Facetalk: Audio-driven motion diffusion for neural parametric head models,","venue":null,"work_id":"8fdcf06e-4817-41a9-bcaa-14b54981db98","year":2024},"citing_paper":{"arxiv_id":"2608.01605","last_updated":"2026-08-03T02:24:23Z","snapshot_observed_at":"2026-08-07T13:15:08.040478Z","submitted_at":"2026-08-03T02:24:23Z","title":"ETHead: Generating Expressive 3D Facial Animation and Head Movement from Speech","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-05T00:18:38.443947Z"},"links":{"citing_paper":"/paper/2608.01605"},"observation_digest":"sha256:bdd90b6731b61ccc7dfdb50d8bc41d7c8a13bd9931b4e333890c635953a146d5","observation_id":"fe8830a9-e7cf-4e4b-98c6-d534c5e4301e","resolution":{"observed_at":"2026-08-05T00:18:51.372170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:18:51.121424Z","title":"Media2face: Co-speech facial animation generation with multi-modality guidance,","venue":null,"work_id":"6a95092f-4268-4f73-8262-e66959c5b49b","year":2024},"citing_paper":{"arxiv_id":"2608.01605","last_updated":"2026-08-03T02:24:23Z","snapshot_observed_at":"2026-08-07T13:15:08.040478Z","submitted_at":"2026-08-03T02:24:23Z","title":"ETHead: Generating Expressive 3D Facial Animation and Head Movement from Speech","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-05T00:18:38.587424Z"},"links":{"citing_paper":"/paper/2608.01605"},"observation_digest":"sha256:902f1e626d37a028ebd69320208b68647abc6c65702d73a632760bf77f78bfe8","observation_id":"1802d0df-257b-4522-acaa-5a9098b236b5","resolution":{"observed_at":"2026-08-05T00:18:51.185945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:18:50.896311Z","title":"Glditalker: Speech-driven 3d facial animation with graph latent diffusion transformer,","venue":null,"work_id":"cd289d5c-2f64-4cbc-b697-62e629279fe9","year":2025},"citing_paper":{"arxiv_id":"2608.01605","last_updated":"2026-08-03T02:24:23Z","snapshot_observed_at":"2026-08-07T13:15:08.040478Z","submitted_at":"2026-08-03T02:24:23Z","title":"ETHead: Generating Expressive 3D Facial Animation and Head Movement from Speech","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-05T00:18:38.757945Z"},"links":{"citing_paper":"/paper/2608.01605"},"observation_digest":"sha256:8aba318662731b73b9d59f1369fc9bebe9d6fef6861664c9b2183ccf8bc9f563","observation_id":"90e741ab-a3cc-4dbe-862b-fb0f9f96a1d8","resolution":{"observed_at":"2026-08-05T00:18:50.997673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:18:50.694858Z","title":"Towards high-fidelity 3d talking avatar with personalized dynamic texture,","venue":null,"work_id":"8664f41f-3180-463e-adf6-63287f952d37","year":2025},"citing_paper":{"arxiv_id":"2608.01605","last_updated":"2026-08-03T02:24:23Z","snapshot_observed_at":"2026-08-07T13:15:08.040478Z","submitted_at":"2026-08-03T02:24:23Z","title":"ETHead: Generating Expressive 3D Facial Animation and Head Movement from Speech","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-05T00:18:38.883939Z"},"links":{"citing_paper":"/paper/2608.01605"},"observation_digest":"sha256:8528d5bde1e34c667460590f86ba20b437746c341ee884faed0e9113df1b0cdb","observation_id":"e3ae79f9-268b-4851-9112-cc14949580dc","resolution":{"observed_at":"2026-08-05T00:18:50.786155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:18:50.527841Z","title":"Model see model do: Speech- driven facial animation with style control,","venue":null,"work_id":"e25f300c-e676-438b-974d-c786bd5ef4bd","year":2025},"citing_paper":{"arxiv_id":"2608.01605","last_updated":"2026-08-03T02:24:23Z","snapshot_observed_at":"2026-08-07T13:15:08.040478Z","submitted_at":"2026-08-03T02:24:23Z","title":"ETHead: Generating Expressive 3D Facial Animation and Head Movement from Speech","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-05T00:18:38.982774Z"},"links":{"citing_paper":"/paper/2608.01605"},"observation_digest":"sha256:f51cab6204ee1b9c7fb6bb47e74a64aa18309cfb15d90bc97acd51b1a8c4d94d","observation_id":"b04d6f79-66e1-4a4c-9149-79af448175dc","resolution":{"observed_at":"2026-08-05T00:18:50.605921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:18:50.346561Z","title":"V ASA-Rig: Audio-driven 3d facial animation with ’live’ mood dynamics in virtual reality,","venue":null,"work_id":"1679bf0b-dea3-4b5a-9623-8fd4a138257d","year":2025},"citing_paper":{"arxiv_id":"2608.01605","last_updated":"2026-08-03T02:24:23Z","snapshot_observed_at":"2026-08-07T13:15:08.040478Z","submitted_at":"2026-08-03T02:24:23Z","title":"ETHead: Generating Expressive 3D Facial Animation and Head Movement from Speech","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-05T00:18:39.072942Z"},"links":{"citing_paper":"/paper/2608.01605"},"observation_digest":"sha256:6769bbe1fe5e936f5020f40c2c0ec84dc0f34a9e53ce8d7b3baa167d33ab8e55","observation_id":"8271a977-24f0-4ba7-bc7a-8a7f7e4f4d7c","resolution":{"observed_at":"2026-08-05T00:18:50.449616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:18:50.103043Z","title":"Ecoface: Audio-visual emotional co-disentanglement speech-driven 3d talking face generation,","venue":null,"work_id":"76f5347f-2c4d-45b6-92bb-754458f98535","year":2025},"citing_paper":{"arxiv_id":"2608.01605","last_updated":"2026-08-03T02:24:23Z","snapshot_observed_at":"2026-08-07T13:15:08.040478Z","submitted_at":"2026-08-03T02:24:23Z","title":"ETHead: Generating Expressive 3D Facial Animation and Head Movement from Speech","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-05T00:18:39.187492Z"},"links":{"citing_paper":"/paper/2608.01605"},"observation_digest":"sha256:d86d061322863ee87c912bcb0fb73fd9fb7fa002733cabdc867d7ec4a0ff4f39","observation_id":"3467509f-0c39-44fa-a79f-6a0af9006b81","resolution":{"observed_at":"2026-08-05T00:18:50.221884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:18:49.896981Z","title":"Lsf- animation: Label-free speech-driven facial animation via implicit feature representation,","venue":null,"work_id":"3fa98c77-320b-47eb-99de-f7c0b919aa4f","year":2025},"citing_paper":{"arxiv_id":"2608.01605","last_updated":"2026-08-03T02:24:23Z","snapshot_observed_at":"2026-08-07T13:15:08.040478Z","submitted_at":"2026-08-03T02:24:23Z","title":"ETHead: Generating Expressive 3D Facial Animation and Head Movement from Speech","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-05T00:18:39.254551Z"},"links":{"citing_paper":"/paper/2608.01605"},"observation_digest":"sha256:8b8289271b18b3c98a742a3bc39dfb5c10246e55821dbb52d648af1444887cb5","observation_id":"c17d85b4-4dfb-4980-a239-976647895d26","resolution":{"observed_at":"2026-08-05T00:18:49.982294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:18:49.708124Z","title":"xada: Controllable and expressive audio-driven animation,","venue":null,"work_id":"eaaa160e-d726-4ab0-b9a2-ab5e05c940a0","year":2025},"citing_paper":{"arxiv_id":"2608.01605","last_updated":"2026-08-03T02:24:23Z","snapshot_observed_at":"2026-08-07T13:15:08.040478Z","submitted_at":"2026-08-03T02:24:23Z","title":"ETHead: Generating Expressive 3D Facial Animation and Head Movement from Speech","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-05T00:18:39.393111Z"},"links":{"citing_paper":"/paper/2608.01605"},"observation_digest":"sha256:80290e594a96a9610c280d555ae4920855669b66b4f4b843ebb11a5c089cf40c","observation_id":"d630e237-59c5-40cb-8d00-308ae2bdca54","resolution":{"observed_at":"2026-08-05T00:18:49.781424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:18:49.436969Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representations,","venue":null,"work_id":"810c4d89-1c78-4f7b-b26c-c3792cc419fd","year":2020},"citing_paper":{"arxiv_id":"2608.01605","last_updated":"2026-08-03T02:24:23Z","snapshot_observed_at":"2026-08-07T13:15:08.040478Z","submitted_at":"2026-08-03T02:24:23Z","title":"ETHead: Generating Expressive 3D Facial Animation and Head Movement from Speech","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-05T00:18:39.547795Z"},"links":{"citing_paper":"/paper/2608.01605"},"observation_digest":"sha256:6103fe5eaa4882326809e6923244936d23b39e545be69ed73dc9bef8f5309ae6","observation_id":"3c8fcf68-5c52-4407-a19e-914db1543060","resolution":{"observed_at":"2026-08-05T00:18:49.588313Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:18:49.206747Z","title":"Hubert: Self-supervised speech representation learning by masked prediction of hidden units,","venue":null,"work_id":"bf5589e3-19af-4d0a-b0fb-a8c68eebb243","year":2021},"citing_paper":{"arxiv_id":"2608.01605","last_updated":"2026-08-03T02:24:23Z","snapshot_observed_at":"2026-08-07T13:15:08.040478Z","submitted_at":"2026-08-03T02:24:23Z","title":"ETHead: Generating Expressive 3D Facial Animation and Head Movement from Speech","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-05T00:18:39.663224Z"},"links":{"citing_paper":"/paper/2608.01605"},"observation_digest":"sha256:3fd8d98462ba55a89ae2a52ffddfaa19f5151cd686571ca1d614b4f1310c5966","observation_id":"2b827f79-077c-459d-a0e9-4b2205898478","resolution":{"observed_at":"2026-08-05T00:18:49.326130Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:18:48.983168Z","title":"Masked autoencoders that listen,","venue":null,"work_id":"d6ad4cbb-84f4-4a29-8f93-babb0a2caa62","year":2022},"citing_paper":{"arxiv_id":"2608.01605","last_updated":"2026-08-03T02:24:23Z","snapshot_observed_at":"2026-08-07T13:15:08.040478Z","submitted_at":"2026-08-03T02:24:23Z","title":"ETHead: Generating Expressive 3D Facial Animation and Head Movement from Speech","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-05T00:18:39.843270Z"},"links":{"citing_paper":"/paper/2608.01605"},"observation_digest":"sha256:824172cb6097d28b8ab80a53070321b6fedd067040880fec2ffceddaf326b1af","observation_id":"0da7e946-a0d9-4318-90b5-957dd7ceae33","resolution":{"observed_at":"2026-08-05T00:18:49.100563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:18:48.766446Z","title":"data2vec: A general framework for self-supervised learning in speech, vision and language,","venue":null,"work_id":"eafdfc53-fe61-44ea-a5be-c124643c1004","year":2022},"citing_paper":{"arxiv_id":"2608.01605","last_updated":"2026-08-03T02:24:23Z","snapshot_observed_at":"2026-08-07T13:15:08.040478Z","submitted_at":"2026-08-03T02:24:23Z","title":"ETHead: Generating Expressive 3D Facial Animation and Head Movement from Speech","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-05T00:18:39.931194Z"},"links":{"citing_paper":"/paper/2608.01605"},"observation_digest":"sha256:37d02a1de5065f76165ceb3fc76cef123d4075200276ae57d9222161b1f51228","observation_id":"de0b66b7-be00-4627-b8c1-10eb5cbd83b1","resolution":{"observed_at":"2026-08-05T00:18:48.876116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:18:48.558582Z","title":"emotion2vec: Self-supervised pre-training for speech emotion rep- resentation,","venue":null,"work_id":"5ad79c3c-4c34-4a80-b51a-c2e725659a8b","year":2024},"citing_paper":{"arxiv_id":"2608.01605","last_updated":"2026-08-03T02:24:23Z","snapshot_observed_at":"2026-08-07T13:15:08.040478Z","submitted_at":"2026-08-03T02:24:23Z","title":"ETHead: Generating Expressive 3D Facial Animation and Head Movement from Speech","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-05T00:18:40.089485Z"},"links":{"citing_paper":"/paper/2608.01605"},"observation_digest":"sha256:9731d278d1d3520a639b28e0848df6c7dfa5aa2036697ffbd051eaf1b40e7cd6","observation_id":"a263c534-10bd-4b8a-bd42-291e7904af55","resolution":{"observed_at":"2026-08-05T00:18:48.661061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:18:48.345418Z","title":"Learning audio- visual speech representation by masked multimodal cluster prediction,","venue":null,"work_id":"3096280a-c968-4fed-87a7-c7a4f3d9d179","year":2022},"citing_paper":{"arxiv_id":"2608.01605","last_updated":"2026-08-03T02:24:23Z","snapshot_observed_at":"2026-08-07T13:15:08.040478Z","submitted_at":"2026-08-03T02:24:23Z","title":"ETHead: Generating Expressive 3D Facial Animation and Head Movement from Speech","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-05T00:18:40.203839Z"},"links":{"citing_paper":"/paper/2608.01605"},"observation_digest":"sha256:e95e46382d69c8160ea8a8f3115cc492dd893fbc212dd51b1a1cb15581933b96","observation_id":"6bd5a840-1678-45e5-9369-6f97882b92a3","resolution":{"observed_at":"2026-08-05T00:18:48.447079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:18:48.187759Z","title":"Self- supervised audio-visual speech representations learning by multimodal self-distillation,","venue":null,"work_id":"aba64c80-e330-4015-8bf5-800a56ba7405","year":2023},"citing_paper":{"arxiv_id":"2608.01605","last_updated":"2026-08-03T02:24:23Z","snapshot_observed_at":"2026-08-07T13:15:08.040478Z","submitted_at":"2026-08-03T02:24:23Z","title":"ETHead: Generating Expressive 3D Facial Animation and Head Movement from Speech","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-05T00:18:40.259882Z"},"links":{"citing_paper":"/paper/2608.01605"},"observation_digest":"sha256:f1ba53a301c897e47e428b92a8d55be0eaed65204b4a801ee53bc9651be20860","observation_id":"7cc776d3-22c3-4937-907d-7965dc2730cd","resolution":{"observed_at":"2026-08-05T00:18:48.272178Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:18:47.931217Z","title":"Head movements encode emotions during speech and song,","venue":null,"work_id":"5d6e7bf0-51f9-4541-99c4-08c5b95797ef","year":2016},"citing_paper":{"arxiv_id":"2608.01605","last_updated":"2026-08-03T02:24:23Z","snapshot_observed_at":"2026-08-07T13:15:08.040478Z","submitted_at":"2026-08-03T02:24:23Z","title":"ETHead: Generating Expressive 3D Facial Animation and Head Movement from Speech","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-05T00:18:40.341495Z"},"links":{"citing_paper":"/paper/2608.01605"},"observation_digest":"sha256:0b3279b8fed67e89c54882a95b7670a0715cd50b96a9432b898a10ad361c0c4f","observation_id":"b512ce43-2103-4533-8683-7d3a5ae8cc0f","resolution":{"observed_at":"2026-08-05T00:18:48.060518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:18:47.724426Z","title":"The effects of visual beats on prosodic prominence: Acoustic analyses, auditory perception and visual percep- tion,","venue":null,"work_id":"a0eea9ec-b85a-408f-b839-68973ad29749","year":2007},"citing_paper":{"arxiv_id":"2608.01605","last_updated":"2026-08-03T02:24:23Z","snapshot_observed_at":"2026-08-07T13:15:08.040478Z","submitted_at":"2026-08-03T02:24:23Z","title":"ETHead: Generating Expressive 3D Facial Animation and Head Movement from Speech","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-05T00:18:40.449634Z"},"links":{"citing_paper":"/paper/2608.01605"},"observation_digest":"sha256:bfabd14dbfe1a8ec7a7b68b06c15e4352d74fb63437e4ea546a7611110b0b84e","observation_id":"80858306-3816-4f15-b6a7-a70f0f0f4b99","resolution":{"observed_at":"2026-08-05T00:18:47.816471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:18:47.548448Z","title":"Emerging properties in self-supervised vision transformers,","venue":null,"work_id":"3ae5fd41-3b27-4b4c-96de-b9a627f01c25","year":2021},"citing_paper":{"arxiv_id":"2608.01605","last_updated":"2026-08-03T02:24:23Z","snapshot_observed_at":"2026-08-07T13:15:08.040478Z","submitted_at":"2026-08-03T02:24:23Z","title":"ETHead: Generating Expressive 3D Facial Animation and Head Movement from Speech","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-05T00:18:40.613413Z"},"links":{"citing_paper":"/paper/2608.01605"},"observation_digest":"sha256:854a3bf0f6d2a11f7d09a360c1128b3b0e9314d6f2060a74d2556455f7d13463","observation_id":"c90551f3-824d-4293-87b1-9837d51d94ec","resolution":{"observed_at":"2026-08-05T00:18:47.636654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:18:47.360243Z","title":"Image BERT pre-training with online tokenizer,","venue":null,"work_id":"03ec04a3-3d6c-457f-b2c6-1fb4c112bd55","year":2022},"citing_paper":{"arxiv_id":"2608.01605","last_updated":"2026-08-03T02:24:23Z","snapshot_observed_at":"2026-08-07T13:15:08.040478Z","submitted_at":"2026-08-03T02:24:23Z","title":"ETHead: Generating Expressive 3D Facial Animation and Head Movement from Speech","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-05T00:18:40.686646Z"},"links":{"citing_paper":"/paper/2608.01605"},"observation_digest":"sha256:221ea464cc7fb15573cee556959483395a425ad23f7b5ae5ac1847d5ddb767ca","observation_id":"675ed164-e6b0-473e-b02d-0b5378d1fd7e","resolution":{"observed_at":"2026-08-05T00:18:47.451784Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:18:47.198854Z","title":"Learning a model of facial shape and expression from 4D scans,","venue":null,"work_id":"898c3147-8d1e-4f61-a620-00034380f47e","year":2017},"citing_paper":{"arxiv_id":"2608.01605","last_updated":"2026-08-03T02:24:23Z","snapshot_observed_at":"2026-08-07T13:15:08.040478Z","submitted_at":"2026-08-03T02:24:23Z","title":"ETHead: Generating Expressive 3D Facial Animation and Head Movement from Speech","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-05T00:18:40.859432Z"},"links":{"citing_paper":"/paper/2608.01605"},"observation_digest":"sha256:8e4f2228f3d1403332b6f7ea480a9af285f2ac73eab3361c617d3335576c828c","observation_id":"34ed7998-58b9-406b-b651-5ce170887e2b","resolution":{"observed_at":"2026-08-05T00:18:47.273932Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:18:47.032509Z","title":"On the continuity of rotation representations in neural networks,","venue":null,"work_id":"f6cb3294-4bcd-4779-b346-d7ff390f4264","year":2019},"citing_paper":{"arxiv_id":"2608.01605","last_updated":"2026-08-03T02:24:23Z","snapshot_observed_at":"2026-08-07T13:15:08.040478Z","submitted_at":"2026-08-03T02:24:23Z","title":"ETHead: Generating Expressive 3D Facial Animation and Head Movement from Speech","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-05T00:18:41.039248Z"},"links":{"citing_paper":"/paper/2608.01605"},"observation_digest":"sha256:27dd8de0eb38587bb1bdc9310408153c3991026b4b376ab9f77d4dd5596d3bc8","observation_id":"b0307c42-10e7-4189-b309-fe55ca1f4d02","resolution":{"observed_at":"2026-08-05T00:18:47.099214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:18:46.745333Z","title":"Wavlm: Large-scale self-supervised pre- training for full stack speech processing,","venue":null,"work_id":"c1c2f863-30f4-4e7f-9c5d-f53023907b13","year":2022},"citing_paper":{"arxiv_id":"2608.01605","last_updated":"2026-08-03T02:24:23Z","snapshot_observed_at":"2026-08-07T13:15:08.040478Z","submitted_at":"2026-08-03T02:24:23Z","title":"ETHead: Generating Expressive 3D Facial Animation and Head Movement from Speech","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-05T00:18:41.154308Z"},"links":{"citing_paper":"/paper/2608.01605"},"observation_digest":"sha256:af827fcd6998e4e9c2d8b54532cd40c4ecef5e17bc7c63e045764f2bf06a819a","observation_id":"92f7707e-bb84-4338-a4cd-3ba1b7bbdaf3","resolution":{"observed_at":"2026-08-05T00:18:46.901824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:18:46.492838Z","title":"Denoising diffusion probabilistic mod- els,","venue":null,"work_id":"5eb7a649-accd-421d-95ff-eddd5bd4a617","year":2020},"citing_paper":{"arxiv_id":"2608.01605","last_updated":"2026-08-03T02:24:23Z","snapshot_observed_at":"2026-08-07T13:15:08.040478Z","submitted_at":"2026-08-03T02:24:23Z","title":"ETHead: Generating Expressive 3D Facial Animation and Head Movement from Speech","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-05T00:18:41.312781Z"},"links":{"citing_paper":"/paper/2608.01605"},"observation_digest":"sha256:a29f579cd0495fa78be1bc90fa577342a2c1e213ebaff53ff08b416582599646","observation_id":"1c65d26e-5e7f-4a57-900d-f6ba7340a418","resolution":{"observed_at":"2026-08-05T00:18:46.589490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:18:46.225126Z","title":"Arbitrary style transfer in real-time with adaptive instance normalization,","venue":null,"work_id":"4fe8cf8e-7b68-49b3-8844-e4daa48da7d6","year":2017},"citing_paper":{"arxiv_id":"2608.01605","last_updated":"2026-08-03T02:24:23Z","snapshot_observed_at":"2026-08-07T13:15:08.040478Z","submitted_at":"2026-08-03T02:24:23Z","title":"ETHead: Generating Expressive 3D Facial Animation and Head Movement from Speech","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-05T00:18:41.431867Z"},"links":{"citing_paper":"/paper/2608.01605"},"observation_digest":"sha256:5aa908f04b1549ed2a0a8dde74bef71178c6e9c94feee8eebb3ba56b5f222978","observation_id":"46b9487e-54e9-4c08-af00-78241bd699fb","resolution":{"observed_at":"2026-08-05T00:18:46.370440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:18:46.048947Z","title":"6d rotation representation for unconstrained head pose estimation,","venue":null,"work_id":"b0e48ac3-3377-4d4e-8c5c-2ec8fda2a7f5","year":2022},"citing_paper":{"arxiv_id":"2608.01605","last_updated":"2026-08-03T02:24:23Z","snapshot_observed_at":"2026-08-07T13:15:08.040478Z","submitted_at":"2026-08-03T02:24:23Z","title":"ETHead: Generating Expressive 3D Facial Animation and Head Movement from Speech","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-05T00:18:41.591153Z"},"links":{"citing_paper":"/paper/2608.01605"},"observation_digest":"sha256:59191ec790e6a52779275d213d5468d97e53eca2b73c5f94f8f2af67f5dedccb","observation_id":"66f56ba2-16ab-4732-8cc7-82d5dc6e6d6d","resolution":{"observed_at":"2026-08-05T00:18:46.131464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-07-06T06:49:24.960992Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-05T00:18:41.749531Z","title":"Representation learning with contrastive predictive coding,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.01605","last_updated":"2026-08-03T02:24:23Z","snapshot_observed_at":"2026-08-07T13:15:08.040478Z","submitted_at":"2026-08-03T02:24:23Z","title":"ETHead: Generating Expressive 3D Facial Animation and Head Movement from Speech","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-05T00:18:41.749531Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2608.01605"},"observation_digest":"sha256:624eacd5394d375856448f0ccdade348005e2e1eafe0f7a0179704ad1a77e477","observation_id":"d2305b1d-1078-4788-8050-7040569699c4","resolution":{"observed_at":"2026-08-05T00:18:41.749531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:18:45.883032Z","title":"Celebv-hq: A large-scale video facial attributes dataset,","venue":null,"work_id":"07d4b2ac-339e-4786-a57d-d3fb099d4a85","year":2022},"citing_paper":{"arxiv_id":"2608.01605","last_updated":"2026-08-03T02:24:23Z","snapshot_observed_at":"2026-08-07T13:15:08.040478Z","submitted_at":"2026-08-03T02:24:23Z","title":"ETHead: Generating Expressive 3D Facial Animation and Head Movement from Speech","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-05T00:18:41.966760Z"},"links":{"citing_paper":"/paper/2608.01605"},"observation_digest":"sha256:a3a71b5eb7f996e05a04acc9a2a8aa883b2af475666e08afd4cf7d57d93f64d8","observation_id":"da6a2912-f355-48a5-9a2a-167ce8f7adc5","resolution":{"observed_at":"2026-08-05T00:18:45.977610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:18:45.739565Z","title":"Celebv- text: A large-scale facial text-video dataset,","venue":null,"work_id":"d606ca59-ba5f-4671-bf3e-2696ce958e93","year":2023},"citing_paper":{"arxiv_id":"2608.01605","last_updated":"2026-08-03T02:24:23Z","snapshot_observed_at":"2026-08-07T13:15:08.040478Z","submitted_at":"2026-08-03T02:24:23Z","title":"ETHead: Generating Expressive 3D Facial Animation and Head Movement from Speech","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-05T00:18:42.123489Z"},"links":{"citing_paper":"/paper/2608.01605"},"observation_digest":"sha256:4e056b52764b3d0e7ac961e106fcf74641dd503c9825cf54a7437a573ac64385","observation_id":"911cfa3c-3782-4e0a-a4d4-dd0e1d18c2be","resolution":{"observed_at":"2026-08-05T00:18:45.800742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:18:45.562794Z","title":"3d facial expressions through analysis- by-neural-synthesis,","venue":null,"work_id":"4ec6410d-b859-4018-a3e7-9e6ca6f200a6","year":2024},"citing_paper":{"arxiv_id":"2608.01605","last_updated":"2026-08-03T02:24:23Z","snapshot_observed_at":"2026-08-07T13:15:08.040478Z","submitted_at":"2026-08-03T02:24:23Z","title":"ETHead: Generating Expressive 3D Facial Animation and Head Movement from Speech","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-05T00:18:42.271178Z"},"links":{"citing_paper":"/paper/2608.01605"},"observation_digest":"sha256:7f5f29fe73ba6601074c15a2e6d19809a918a6dccd2d911e19fdec16ab762ccf","observation_id":"5857457e-2674-413f-a669-80ddf548e2a4","resolution":{"observed_at":"2026-08-05T00:18:45.648236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:18:42.414658Z","title":"The ryerson audio-visual database of emotional speech and song (ravdess): A dynamic, multimodal set of facial and vocal expressions in north american english,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.01605","last_updated":"2026-08-03T02:24:23Z","snapshot_observed_at":"2026-08-07T13:15:08.040478Z","submitted_at":"2026-08-03T02:24:23Z","title":"ETHead: Generating Expressive 3D Facial Animation and Head Movement from Speech","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-05T00:18:42.414658Z"},"links":{"citing_paper":"/paper/2608.01605"},"observation_digest":"sha256:de6665756c22e8bce41c14a0106cede5a129a213d2a625776893e7cea2b65138","observation_id":"c9d51fb0-dbb3-4e37-8730-3fa7c2eca76b","resolution":{"observed_at":"2026-08-05T00:18:42.414658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:18:45.346805Z","title":"MEAD: A large-scale audio-visual dataset for emotional talking-face generation,","venue":null,"work_id":"98543ffb-6eef-481d-abdb-6a6b6c95ae1f","year":2020},"citing_paper":{"arxiv_id":"2608.01605","last_updated":"2026-08-03T02:24:23Z","snapshot_observed_at":"2026-08-07T13:15:08.040478Z","submitted_at":"2026-08-03T02:24:23Z","title":"ETHead: Generating Expressive 3D Facial Animation and Head Movement from Speech","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-05T00:18:42.584271Z"},"links":{"citing_paper":"/paper/2608.01605"},"observation_digest":"sha256:5f7ddcc290013c94dc0572091df1c56466679bc7ac193cd8e1c2a78333948d84","observation_id":"24fbeea6-ce8d-4c72-94b4-6cc7f1363d29","resolution":{"observed_at":"2026-08-05T00:18:45.486821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:18:45.086148Z","title":"Flow-guided one-shot talking face generation with a high-resolution audio-visual dataset,","venue":null,"work_id":"073f56c5-53e2-4a27-92a1-ec90741c77e1","year":2021},"citing_paper":{"arxiv_id":"2608.01605","last_updated":"2026-08-03T02:24:23Z","snapshot_observed_at":"2026-08-07T13:15:08.040478Z","submitted_at":"2026-08-03T02:24:23Z","title":"ETHead: Generating Expressive 3D Facial Animation and Head Movement from Speech","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-05T00:18:42.660462Z"},"links":{"citing_paper":"/paper/2608.01605"},"observation_digest":"sha256:1b1e1fdac63c176bb896a3ca340f6af2037f5157c22284ce22905891f8861965","observation_id":"2c329232-d87c-4695-aa8b-ef3218ce314e","resolution":{"observed_at":"2026-08-05T00:18:45.216822Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:18:44.924574Z","title":"Bailando: 3d dance generation by actor-critic GPT with choreographic memory,","venue":null,"work_id":"a1777968-1fef-43c7-bf83-ad4c46d8658a","year":2022},"citing_paper":{"arxiv_id":"2608.01605","last_updated":"2026-08-03T02:24:23Z","snapshot_observed_at":"2026-08-07T13:15:08.040478Z","submitted_at":"2026-08-03T02:24:23Z","title":"ETHead: Generating Expressive 3D Facial Animation and Head Movement from Speech","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-05T00:18:42.784802Z"},"links":{"citing_paper":"/paper/2608.01605"},"observation_digest":"sha256:cc6a635c6704f4b207c0000abef12a73083fda2e53530d7316503ac3e3ae2a1a","observation_id":"7dc936e7-25ec-47e5-8e60-166a32611913","resolution":{"observed_at":"2026-08-05T00:18:44.997210Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:18:42.932865Z","title":"A technique for the measurement of attitudes","venue":null,"work_id":null,"year":1932},"citing_paper":{"arxiv_id":"2608.01605","last_updated":"2026-08-03T02:24:23Z","snapshot_observed_at":"2026-08-07T13:15:08.040478Z","submitted_at":"2026-08-03T02:24:23Z","title":"ETHead: Generating Expressive 3D Facial Animation and Head Movement from Speech","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-05T00:18:42.932865Z"},"links":{"citing_paper":"/paper/2608.01605"},"observation_digest":"sha256:e8c27547c95bf79291f63b14c5367478d417e16f427639f1ed2d90faade5a6b9","observation_id":"d03cd434-f0db-456a-bcb4-9c7b91843d62","resolution":{"observed_at":"2026-08-05T00:18:42.932865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:18:44.659722Z","title":"Autoregressive image generation without vector quantization,","venue":null,"work_id":"f16bc224-7e18-484b-91c9-e71704737804","year":2024},"citing_paper":{"arxiv_id":"2608.01605","last_updated":"2026-08-03T02:24:23Z","snapshot_observed_at":"2026-08-07T13:15:08.040478Z","submitted_at":"2026-08-03T02:24:23Z","title":"ETHead: Generating Expressive 3D Facial Animation and Head Movement from Speech","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-05T00:18:43.052345Z"},"links":{"citing_paper":"/paper/2608.01605"},"observation_digest":"sha256:df90ad8db8c223bb7509afeb95cf07610cf24f44a8404727031202f128675ce7","observation_id":"456c94a6-4629-439d-93b7-9a77fc9f160b","resolution":{"observed_at":"2026-08-05T00:18:44.741122Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:18:44.377264Z","title":"Flow matching for generative modeling,","venue":null,"work_id":"d05f214d-f3c6-43e3-b482-fde24c458c37","year":2023},"citing_paper":{"arxiv_id":"2608.01605","last_updated":"2026-08-03T02:24:23Z","snapshot_observed_at":"2026-08-07T13:15:08.040478Z","submitted_at":"2026-08-03T02:24:23Z","title":"ETHead: Generating Expressive 3D Facial Animation and Head Movement from Speech","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-05T00:18:43.172558Z"},"links":{"citing_paper":"/paper/2608.01605"},"observation_digest":"sha256:47e507917a8511bab8c0a8f56afac4088ffb2fa878c5e7c15585c6d11b420990","observation_id":"8b277eb9-66a0-4cf7-b03c-f53d78591c7a","resolution":{"observed_at":"2026-08-05T00:18:44.561801Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:18:44.230838Z","title":"Fmdistance: A fast and effective distance function for motion capture data,","venue":null,"work_id":"ef21714e-8839-4024-97a0-637479c78975","year":2008},"citing_paper":{"arxiv_id":"2608.01605","last_updated":"2026-08-03T02:24:23Z","snapshot_observed_at":"2026-08-07T13:15:08.040478Z","submitted_at":"2026-08-03T02:24:23Z","title":"ETHead: Generating Expressive 3D Facial Animation and Head Movement from Speech","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-05T00:18:43.298489Z"},"links":{"citing_paper":"/paper/2608.01605"},"observation_digest":"sha256:5957b4e5ee5c5c1afd1549d0a2f5cc1562c072478f267157ee3ec73707a0be3e","observation_id":"778c785a-ebde-409b-a6aa-a57d38497e4b","resolution":{"observed_at":"2026-08-05T00:18:44.264235Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.01605","last_updated":"2026-08-03T02:24:23Z","latest_version":1,"primary_category":"cs.GR","snapshot_observed_at":"2026-08-07T13:15:08.040478Z","submitted_at":"2026-08-03T02:24:23Z","title":"ETHead: Generating Expressive 3D Facial Animation and Head Movement from Speech"},"reference_resolution":{"displayed":92,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":18,"verified_exact":1,"verified_fuzzy":72},"total_outbound_references":92},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 92 of 92 outbound references and 0 inbound Pith citation observations for arXiv:2608.01605."}