{"as_of":"2026-08-10T16:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f053081ba80ee69820f926dea6c925f995616dc333fed98a483724b0a7540bfa","coverage":[{"denominator":86,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":86,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T13:39:36.267401Z","state":"measured"},{"denominator":86,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":86,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.20452/citation-record","integrity":"/paper/2507.20452/integrity","json":"/paper/2507.20452/citation-record.json","paper":"/paper/2507.20452"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:27.844754Z","title":"Facewarehouse: A 3d facial expression database for visual computing.IEEE Transactions on Visualization and Computer Graphics, 20(3):413–425, 2013","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-09T02:32:25.994375Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:27.844754Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:ed7468a61f9328bc1c9c7d95323b7034d2c87fe0e0e16c6ea4eb12b335736ec0","observation_id":"b5c61b92-42de-440b-8864-c2c13d694652","resolution":{"observed_at":"2026-08-06T13:39:27.844754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:27.988641Z","title":"Hiface: High-fidelity 3d face reconstruction by learning static and dynamic details","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-09T02:32:25.994375Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:27.988641Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:deb0a074440b1629c53b489e7f08d54121ceab2b9640e7b27b5425edf3c25004","observation_id":"e53ddc25-af8d-4e39-a107-3f167b852de0","resolution":{"observed_at":"2026-08-06T13:39:27.988641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:28.098360Z","title":"IQA-PyTorch: Pytorch toolbox for image qual- ity assessment","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-09T02:32:25.994375Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:28.098360Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:8c93e46f918a9e5800fda37087e1244ee67264c04c52f1e4e7c0e6c5639b74ce","observation_id":"9ccc7da9-a064-4f53-b334-f8df148f8e21","resolution":{"observed_at":"2026-08-06T13:39:28.098360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:28.199572Z","title":"Topiq: A top-down approach from semantics to distortions for image quality assessment.IEEE Transactions on Image Processing, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-09T02:32:25.994375Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:28.199572Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:5429fdefb3983a99274df1c46c88a54e271ae9a327304119fe466b46371a9458","observation_id":"036fa333-8e8a-48f0-b837-092eeda73bf4","resolution":{"observed_at":"2026-08-06T13:39:28.199572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1806.05622","last_updated":"2018-06-27T01:49:17Z","snapshot_observed_at":"2026-08-08T04:36:13.309903Z","submitted_at":"2018-06-14T15:59:12Z","title":"VoxCeleb2: Deep Speaker Recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.05622","snapshot_observed_at":"2026-08-06T13:39:28.325314Z","title":"V oxceleb2: Deep speaker recognition.arXiv preprint arXiv:1806.05622, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-09T02:32:25.994375Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:28.325314Z"},"links":{"cited_paper":"/paper/1806.05622","citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:f31e6ea713d245229fd98cf8b97118fa5ee7ec764a3eb71688c76c330a898030","observation_id":"2b8a60f2-fb4c-42f6-9e76-3f61b8d69fcc","resolution":{"observed_at":"2026-08-06T13:39:28.325314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:28.419724Z","title":"Emoca: Emotion driven monoc- ular face capture and animation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-09T02:32:25.994375Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:28.419724Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:95f769405c01404af5ecd9b4104875ff1e087a0dc097ea456aca5e350d6c2fce","observation_id":"64300e98-df5e-45d8-a1ff-9ed4a51d992d","resolution":{"observed_at":"2026-08-06T13:39:28.419724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:28.554745Z","title":"Arcface: Additive angular margin loss for deep face recognition","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-09T02:32:25.994375Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:28.554745Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:fa4145d3354f5a0e5acb78cd8ae36b8e4898c5a096872a4fe2fc0a0b907e226d","observation_id":"5e8311fb-0280-47f4-8c02-596ffa3c3ea7","resolution":{"observed_at":"2026-08-06T13:39:28.554745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:51.984892Z","title":"Ac- curate 3d face reconstruction with weakly-supervised learning: From single image to image set","venue":null,"work_id":"5dab2931-8196-473a-8ca5-477736fb7c29","year":2019},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-09T02:32:25.994375Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:28.634750Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:5d79708cd6b0461d376388d353a4fa6904383874c178e8bdea75c1b8fcfcb101","observation_id":"a8416907-96b5-4a95-ad01-e07d2f657584","resolution":{"observed_at":"2026-08-06T13:39:52.154750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:51.504754Z","title":"Headgan: One-shot neural head synthesis and editing","venue":null,"work_id":"038f4504-b00a-42df-95db-330b37c4961e","year":2021},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-09T02:32:25.994375Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:28.779920Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:c0a685453fe0a2c0cd4d9628f48d124a37fe9f5aad9a2819bb5422de068755b3","observation_id":"b6826680-cb5a-4022-be23-c926fbddc557","resolution":{"observed_at":"2026-08-06T13:39:51.704889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:51.207220Z","title":"Free-headgan: Neural talking head synthesis with explicit gaze control","venue":null,"work_id":"7e171d15-8c50-47aa-9118-244c2dd43694","year":2023},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-09T02:32:25.994375Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:28.914742Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:f2141433aaf60a0cd5a84b76039fc00868ea12fbf834c5d39d0dec531e5b4b73","observation_id":"9594e41b-880b-42f0-a799-2e44e584cdbe","resolution":{"observed_at":"2026-08-06T13:39:51.294070Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:50.948768Z","title":"Megaportraits: One-shot megapixel neural head avatars","venue":null,"work_id":"91e732c9-d9cb-4d38-a31d-5c840e55add2","year":2022},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-09T02:32:25.994375Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:29.098001Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:47eb5ecd8f7cf7e9a81aa5ef06d9394ad092445e3b1f7288a5160338f39dcf29","observation_id":"40b383c9-873e-45b6-b18e-906817f839bd","resolution":{"observed_at":"2026-08-06T13:39:51.035436Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:50.595446Z","title":"Emoportraits: Emotion-enhanced multimodal one-shot head avatars","venue":null,"work_id":"352218e2-680b-4867-9116-54b977c1c775","year":2024},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-09T02:32:25.994375Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:29.252262Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:fbffcddd43c1c5578783afc37cc581232dc55192f638d5b2878253a76161c2c4","observation_id":"35fb1ffb-7c72-4aa9-95bd-33bc82142019","resolution":{"observed_at":"2026-08-06T13:39:50.747678Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:50.234748Z","title":"3d morphable face models—past, present, and future.ACM Transactions on Graphics (ToG), 39(5):1–38, 2020","venue":null,"work_id":"bf6cbee1-cd6c-4932-a1b5-cbb330f1b387","year":2020},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-09T02:32:25.994375Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:29.340935Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:dd2e97a0f8d0ebaed001e99202ab884045b1fcd6e32637d53cf15756a5a768a0","observation_id":"aa420262-44c8-4865-bc32-8fc217c28963","resolution":{"observed_at":"2026-08-06T13:39:50.434842Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:49.862180Z","title":"Facial action coding system.Environmental Psy- chology & Nonverbal Behavior, 1978","venue":null,"work_id":"aaf8d411-70f7-462d-8bcf-b08114228a31","year":1978},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-09T02:32:25.994375Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:29.438106Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:3e2760b9a5922b84e6ba4cad458cbc303c2f0c9b896b70ccdca50cb7768eabc2","observation_id":"2f75bd06-e7b8-4aa1-9fc2-b4d209e1fabb","resolution":{"observed_at":"2026-08-06T13:39:50.028325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1804.03619","last_updated":"2018-08-09T21:22:37Z","snapshot_observed_at":"2026-08-06T20:20:05.725909Z","submitted_at":"2018-04-10T16:28:59Z","title":"Looking to Listen at the Cocktail Party: A Speaker-Independent Audio-Visual Model for Speech Separation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.03619","snapshot_observed_at":"2026-08-06T13:39:29.510807Z","title":"Looking to listen at the cocktail party: A speaker-independent audio-visual model for speech separation.arXiv preprint arXiv:1804.03619, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-09T02:32:25.994375Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:29.510807Z"},"links":{"cited_paper":"/paper/1804.03619","citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:7352992a3d182a9c148c686c91ca4819b5234b547b1e75d65e46afca21840e19","observation_id":"e23e40ce-d579-4825-974c-0d672e3df384","resolution":{"observed_at":"2026-08-06T13:39:29.510807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:29.590290Z","title":"Learning an animatable detailed 3d face model from in-the-wild images.ACM Transactions on Graphics (ToG), 40(4):1–13, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-09T02:32:25.994375Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:29.590290Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:2701290a32be49920279058721bf3bb96e936a4dbbd885d0d5b4216a88a4a093","observation_id":"5c86ad74-8e25-477c-aeab-aef5108e5339","resolution":{"observed_at":"2026-08-06T13:39:29.590290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:49.494141Z","title":"Surface simplification using quadric error met- rics","venue":null,"work_id":"a8b633a6-2354-4dd7-b181-81fc46da6bdc","year":1997},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-09T02:32:25.994375Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:29.646577Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:b03735df7eb0ccf77d709cca2905652453abc15a079afc604211b57ee4de5c90","observation_id":"833d90c2-3484-425f-a387-38cb244c7af6","resolution":{"observed_at":"2026-08-06T13:39:49.634750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:49.181617Z","title":"Morphable face models-an open frame- work","venue":null,"work_id":"43bdbd10-4b97-4fb9-823c-314ddf1838b3","year":2018},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-09T02:32:25.994375Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:29.710651Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:d35465f7eced3dfec63434a439fed5ea48d3e5fa2c89d345a4f9490c11e114a6","observation_id":"2d03d31e-d535-4d28-a03a-7c05d0886086","resolution":{"observed_at":"2026-08-06T13:39:49.325837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.10962","last_updated":"2020-06-19T05:07:38Z","snapshot_observed_at":"2026-07-06T09:30:38.493338Z","submitted_at":"2020-06-19T05:07:38Z","title":"Attention Mesh: High-fidelity Face Mesh Prediction in Real-time","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.10962","snapshot_observed_at":"2026-08-06T13:39:29.799219Z","title":"Attention mesh: High-fidelity face mesh prediction in real-time","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-09T02:32:25.994375Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:29.799219Z"},"links":{"cited_paper":"/paper/2006.10962","citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:3424824e6a319dedd7d08e7fce34c1ece0c8945588bce7ada77da1d443c5f317","observation_id":"23d37766-fe89-4821-89f4-32a86b935009","resolution":{"observed_at":"2026-08-06T13:39:29.799219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03168","last_updated":"2025-02-28T14:39:17Z","snapshot_observed_at":"2026-08-08T10:55:01.205999Z","submitted_at":"2024-07-03T14:41:39Z","title":"LivePortrait: Efficient Portrait Animation with Stitching and Retargeting Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.03168","snapshot_observed_at":"2026-08-06T13:39:29.907882Z","title":"Liveportrait: Efficient portrait animation with stitching and retar- geting control.arXiv preprint arXiv:2407.03168, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-09T02:32:25.994375Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:29.907882Z"},"links":{"cited_paper":"/paper/2407.03168","citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:90fabbc1dcf8beef9f4092bfa0181fc2a8a31ad74b5dd57715e81197b8e39b92","observation_id":"5ceb2151-0041-4694-aa51-e82987f7f473","resolution":{"observed_at":"2026-08-06T13:39:29.907882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:29.997607Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-09T02:32:25.994375Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:29.997607Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:a5a42b160e5b807d80a372af41939b727eb64b7135622a302183c73cdbb7d78c","observation_id":"5aaf2052-996d-4143-a032-daeb9c554c38","resolution":{"observed_at":"2026-08-06T13:39:29.997607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:30.129703Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilibrium.Advances in neural information processing systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-09T02:32:25.994375Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:30.129703Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:f7ce7fdced0ff736d9ed5c32417e10226d78e1300530ceaf685d3e5183a7ec18","observation_id":"10ebb122-024f-4579-a734-e317f77588ec","resolution":{"observed_at":"2026-08-06T13:39:30.129703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-06T13:39:30.197962Z","title":"Classifier-free diffusion guidance.arXiv preprint arXiv:2207.12598, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-09T02:32:25.994375Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:30.197962Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:8502e45cfc45f70c094b9b13e8f93363ac4425225579be6792d1ac090536766e","observation_id":"2f9c5b4b-a39c-4015-8bad-19eb3343bda5","resolution":{"observed_at":"2026-08-06T13:39:30.197962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:30.313052Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-09T02:32:25.994375Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:30.313052Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:ada09a1956b1d55bc9e68e2384a84d6249041e35169f086751df6e9e3c75a7ea","observation_id":"dc607002-be97-4dde-8835-1fdd06b0a10f","resolution":{"observed_at":"2026-08-06T13:39:30.313052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:48.609784Z","title":"Image-to-image trans- lation with conditional adversarial networks","venue":null,"work_id":"26ce96c5-425f-4a28-ae46-075c9809842b","year":2017},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-09T02:32:25.994375Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:30.376358Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:38529f822ed51e36b89fc433ebab07ce2e5025f690ce00eba3296922d12e253c","observation_id":"aa1f875f-e376-4ce1-a937-d31e3f6860e3","resolution":{"observed_at":"2026-08-06T13:39:48.769236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18284","last_updated":"2024-08-08T12:18:30Z","snapshot_observed_at":"2026-07-06T18:37:17.280637Z","submitted_at":"2024-06-26T12:09:59Z","title":"RealTalk: Real-time and Realistic Audio-driven Face Generation with 3D Facial Prior-guided Identity Alignment Network","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18284","snapshot_observed_at":"2026-08-06T13:39:30.454868Z","title":"Realtalk: Real-time and realistic audio-driven face generation with 3d facial prior-guided identity alignment network","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-09T02:32:25.994375Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:30.454868Z"},"links":{"cited_paper":"/paper/2406.18284","citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:e1bcfc151a950f5630445770fb95e042198318f748637aa79899d08eb6474bb3","observation_id":"91a3f7c3-d4f3-4483-990a-bb19a66d338a","resolution":{"observed_at":"2026-08-06T13:39:30.454868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:48.370383Z","title":"Eamm: One-shot emotional talking face via audio-based emotion-aware motion model","venue":null,"work_id":"1ec24209-b98a-4708-afb9-49cbbd9b282b","year":2022},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-09T02:32:25.994375Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:30.530150Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:abf54a11f382f7f0eae7b13ad243a25df6f8bc16bfac8ad3c05c0afe50beb9e9","observation_id":"d28459ac-b837-43cc-bd0a-d8b7408469c6","resolution":{"observed_at":"2026-08-06T13:39:48.466735Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:48.014769Z","title":"Loopy: Taming audio-driven portrait avatar with long-term motion dependency","venue":null,"work_id":"7c6d78db-c4ce-4fda-8d25-23a33925f623","year":2024},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-09T02:32:25.994375Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:30.643230Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:30778cdd5ea1a1c7f0fb269380c8ec435e6393b1585defb27b999d0c6dfb1c57","observation_id":"8c28182c-38c5-4419-ae04-ebc6fc929316","resolution":{"observed_at":"2026-08-06T13:39:48.172525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-06T13:39:30.716088Z","title":"Adam: A method for stochastic optimization.arXiv preprint arXiv:1412.6980, 2014","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-09T02:32:25.994375Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:30.716088Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:803bd27539d13eb7f5d82d0cdad5c33e193d2a80a83db2e7d2fbbc3cff5ce05e","observation_id":"56aeb3b4-4077-4ecc-9755-50f082108855","resolution":{"observed_at":"2026-08-06T13:39:30.716088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:47.740017Z","title":"Photo-realistic single image super-resolution using a generative adversarial network","venue":null,"work_id":"1dfced39-c31d-4b95-8623-c2b4ddbd58d0","year":2017},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-09T02:32:25.994375Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:30.809494Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:4b1fb19a89e670e656ebc44c18dff49b63cfdf57ee1574b1e11810c99dc542f1","observation_id":"97bd352f-9815-4354-8069-726945ac47f2","resolution":{"observed_at":"2026-08-06T13:39:47.884757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09262","last_updated":"2025-03-13T09:17:52Z","snapshot_observed_at":"2026-08-07T20:59:22.905615Z","submitted_at":"2024-12-12T13:20:52Z","title":"LatentSync: Taming Audio-Conditioned Latent Diffusion Models for Lip Sync with SyncNet Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09262","snapshot_observed_at":"2026-08-06T13:39:30.957571Z","title":"Latentsync: Audio conditioned latent diffusion models for lip sync","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-09T02:32:25.994375Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:30.957571Z"},"links":{"cited_paper":"/paper/2412.09262","citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:bec1c4c2363fad43f4894fc1f46ea5bbb48eebd9889e40046ea04abe42f36fcf","observation_id":"3299ad7a-593c-4076-8a1e-68af829e8e84","resolution":{"observed_at":"2026-08-06T13:39:30.957571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:47.411952Z","title":"Learning formation of physically-based face attributes","venue":null,"work_id":"0a1f593b-3b35-4afd-99a9-b177b4329308","year":2020},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-09T02:32:25.994375Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:31.057220Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:7db169beee5d95d58cb946a3133a74d6c586a2d00ca157e0a8376027b430b598","observation_id":"09d231e1-49f5-4228-b14c-a788cc1481c1","resolution":{"observed_at":"2026-08-06T13:39:47.487963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.02894","last_updated":"2017-05-09T01:12:28Z","snapshot_observed_at":"2026-07-06T05:41:43.164281Z","submitted_at":"2017-05-08T14:32:33Z","title":"Geometric GAN","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.02894","snapshot_observed_at":"2026-08-06T13:39:31.123805Z","title":"Geometric gan.arXiv preprint arXiv:1705.02894, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-09T02:32:25.994375Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:31.123805Z"},"links":{"cited_paper":"/paper/1705.02894","citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:68621208f8339254c1d715e4b87abe48ca0996c580f92c71f73fdbce3db148fa","observation_id":"ed54530d-224a-4b51-8051-7b4468aa05e2","resolution":{"observed_at":"2026-08-06T13:39:31.123805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:47.136050Z","title":"Robust high- resolution video matting with temporal guidance","venue":null,"work_id":"bdc0a4eb-e847-4a0d-8b22-4c56b52ef86a","year":2022},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-09T02:32:25.994375Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:31.204493Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:03bc7638cd71bab5e6ee73f3aa88b4714735d456a870fee86cf84df1a0e8c8b2","observation_id":"5abfb1b5-46c5-4e93-be8e-d653e54737b1","resolution":{"observed_at":"2026-08-06T13:39:47.275043Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:46.864758Z","title":"Anitalker: animate vivid and diverse talking faces through identity-decoupled facial motion encoding","venue":null,"work_id":"4b530bbd-5a7a-4415-a4c0-eb221ffa9c22","year":2024},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-09T02:32:25.994375Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:31.283100Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:e444af9b27f3997b842cb164cd610becbbc91af1732ad3358ad8ffe57dde20b8","observation_id":"447359e1-4e18-4db1-b8b2-17496f8b76da","resolution":{"observed_at":"2026-08-06T13:39:46.944757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-06T13:39:31.347974Z","title":"Decoupled weight decay regularization.arXiv preprint arXiv:1711.05101, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-09T02:32:25.994375Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:31.347974Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:87d4c04d8038ae294119c7fd7b869845f5f558335d5933600de053e0eb3e33b2","observation_id":"916803fc-2b96-480e-86f2-02362b0caadb","resolution":{"observed_at":"2026-08-06T13:39:31.347974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:31.456523Z","title":"Repaint: Inpainting using denoising diffusion probabilistic models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-09T02:32:25.994375Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:31.456523Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:df6d0055cf15be424e867e100caded3b9cf4793b30a7b149cec63575edf46c41","observation_id":"6d010939-c2c8-4da8-be34-77c14a988298","resolution":{"observed_at":"2026-08-06T13:39:31.456523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:46.367317Z","title":"Implicit warping for animation with image sets.Advances in Neural Information Processing Systems, 35:22438–22450, 2022","venue":null,"work_id":"807875dc-b621-4d21-a349-de26de70df74","year":2022},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-09T02:32:25.994375Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:31.554628Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:c6826c12f66598977237bc2371cfca8d586bab8d79b698f944a5e4a33004fbad","observation_id":"59ece410-6f95-4a26-8001-f29fb2306383","resolution":{"observed_at":"2026-08-06T13:39:46.564761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:46.151015Z","title":"Sidgan: High-resolution dubbed video generation via shift-invariant learning","venue":null,"work_id":"dae1557b-efd7-4766-b1c7-8b11fcd4e971","year":2023},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-09T02:32:25.994375Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:31.616512Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:80629a8ad04c2596adbf02932bca8120305853e4456e9b8ef1fd4753461d7e6d","observation_id":"629c79a5-ad66-474c-8235-c0b5df06a66b","resolution":{"observed_at":"2026-08-06T13:39:46.209299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08655","last_updated":"2024-01-25T02:29:00Z","snapshot_observed_at":"2026-08-10T00:34:14.933324Z","submitted_at":"2023-12-25T04:40:32Z","title":"SAiD: Speech-driven Blendshape Facial Animation with Diffusion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08655","snapshot_observed_at":"2026-08-06T13:39:31.735563Z","title":"Said: Speech-driven blendshape facial animation with diffusion.arXiv preprint arXiv:2401.08655, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-09T02:32:25.994375Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:31.735563Z"},"links":{"cited_paper":"/paper/2401.08655","citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:54ce6402ed988700402dc1f78297b03ec159ae5892a3c331835fd173b8cfd260","observation_id":"78b3d442-d2a7-46ec-8f74-827b8593fadd","resolution":{"observed_at":"2026-08-06T13:39:31.735563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:45.671469Z","title":"Synctalk- face: Talking face generation with precise lip-syncing via audio-lip memory","venue":null,"work_id":"f4f38fb1-41ca-4b94-912b-787371070ce5","year":2022},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-09T02:32:25.994375Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:31.837154Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:b49f0069116cda29a4eb3584d6dfe4d384425096709f3204b4253c0ce67239dd","observation_id":"e12a04d5-9e4c-4f95-bbd4-fa6df4d89496","resolution":{"observed_at":"2026-08-06T13:39:45.930393Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00971","last_updated":"2024-09-02T06:26:48Z","snapshot_observed_at":"2026-08-09T08:47:27.087877Z","submitted_at":"2024-09-02T06:26:48Z","title":"Interpretable Convolutional SyncNet","version":1},"cited_work":{"arxiv_id":"2409.00971","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.00971","snapshot_observed_at":"2026-08-06T13:39:37.231709Z","title":"Interpretable Convolutional SyncNet","venue":"cs.CV","work_id":"e813c5e4-3ebc-4c82-861d-784a85cd8ad0","year":2024},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-09T02:32:25.994375Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:31.975485Z"},"links":{"cited_paper":"/paper/2409.00971","citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:732fe363823d4019610f5a1ab4d32f0be4f7796285b6318bcf4690838e26b325","observation_id":"18b4a7fe-d2cd-440b-9152-21e9f6e1907d","resolution":{"observed_at":"2026-08-06T13:39:37.325379Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:45.424748Z","title":"Semantic image synthesis with spatially-adaptive normalization","venue":null,"work_id":"71fbb4b9-ebbb-4834-a9ea-0bfccfc6c3e1","year":2019},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-09T02:32:25.994375Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:32.077299Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:b81f07b4eb6f7031641fd6434a2183d4aa4674c4f534ca1092042ce4e2c29514","observation_id":"9b9c38e4-9715-443e-b3cd-74df5d3d15ed","resolution":{"observed_at":"2026-08-06T13:39:45.534830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:45.091841Z","title":"A 3d face model for pose and illumination invariant face recognition","venue":null,"work_id":"a40fdda0-da02-4aa6-b13c-d484dac74fbb","year":2009},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-09T02:32:25.994375Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:32.253438Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:5ad2f0105ab3c91ebb3e8ee6887a4a8306e93802c9da3badaa17719b25e22065","observation_id":"7a8cfbf9-506e-4a66-a661-6413bbe2ba9e","resolution":{"observed_at":"2026-08-06T13:39:45.197617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:32.384741Z","title":"A lip sync expert is all you need for speech to lip generation in the wild","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-09T02:32:25.994375Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:32.384741Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:5e531b7c2dd1976e21daec94db9321fcf0c8553db268ffe919da22d472889799","observation_id":"43871328-a0f3-4e5d-a8e3-3299a07bf0da","resolution":{"observed_at":"2026-08-06T13:39:32.384741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.08501","last_updated":"2020-07-16T17:53:02Z","snapshot_observed_at":"2026-07-06T09:38:53.228850Z","submitted_at":"2020-07-16T17:53:02Z","title":"Accelerating 3D Deep Learning with PyTorch3D","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.08501","snapshot_observed_at":"2026-08-06T13:39:32.431687Z","title":"Accelerating 3d deep learning with pytorch3d","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-09T02:32:25.994375Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:32.431687Z"},"links":{"cited_paper":"/paper/2007.08501","citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:f42d325be8afc118efb5950e398304272efb2b27abcc40bf2b231a142786d092","observation_id":"13cc7b11-b53d-476c-adfe-efcb38840494","resolution":{"observed_at":"2026-08-06T13:39:32.431687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:44.754741Z","title":"Pirenderer: Control- lable portrait image generation via semantic neural rendering","venue":null,"work_id":"3a387650-4dbe-49e9-95d1-792adf3c5a8b","year":2021},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-09T02:32:25.994375Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:32.553045Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:0fd732fe10f27dce17520924453e197438f03c200c8cc233f09d3c7002854ddb","observation_id":"04e3ab69-bc01-496f-805c-c7c2f6fad83c","resolution":{"observed_at":"2026-08-06T13:39:44.816217Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:32.603221Z","title":"U-net: Convolutional net- works for biomedical image segmentation","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-09T02:32:25.994375Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:32.603221Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:454e8ecde7c3b2a47b70803021cc015fc5d7bee949a2ab97d1afbc2673f140e9","observation_id":"f03f55cd-d0b9-40a6-9506-02867c514aad","resolution":{"observed_at":"2026-08-06T13:39:32.603221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:44.354741Z","title":"Palette: Image-to-image diffusion mod- els","venue":null,"work_id":"6d3150a4-e47b-463f-b40b-1003198bf1bf","year":2022},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-09T02:32:25.994375Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:32.656474Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:a44b9b08d2acd750ee13e3bd2a33491bc77bd0a50a89b4eda2f577e1b4395670","observation_id":"15b40bc3-5270-416b-8f8f-306d813fd4f6","resolution":{"observed_at":"2026-08-06T13:39:44.479606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:32.802566Z","title":"Improved techniques for training gans.Advances in neural information processing systems, 29, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-09T02:32:25.994375Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:32.802566Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:c5d9273c874e9dd8466c62c7acac7ec15d0d8b00c9896ad6e78fa465a492f8c4","observation_id":"a5e4fb18-61d8-4aa4-9951-19e4c71d618d","resolution":{"observed_at":"2026-08-06T13:39:32.802566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:43.924754Z","title":"pytorch-fid: FID Score for PyTorch.https://github.com/ mseitzer/pytorch-fid, August 2020","venue":null,"work_id":"9022b612-723e-466b-bef5-06280f75501c","year":2020},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-09T02:32:25.994375Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:32.952752Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:19831593d0b79e7f7812b052d55591a63d877483461a11a128e13496643c4ad2","observation_id":"d96f5c64-a23c-48f1-b7d9-a8dcc8fa3ca1","resolution":{"observed_at":"2026-08-06T13:39:44.054773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:43.564883Z","title":"First order motion model for image animation.Advances in neural informa- tion processing systems, 32, 2019","venue":null,"work_id":"a3f4ffe1-47db-4f77-8242-b5c9494a7268","year":2019},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-09T02:32:25.994375Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:33.025935Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:329fe2e5c2af569a1479ad093fba3712f6023878f6d14f9e3231d68850823670","observation_id":"207ed7f0-e8c4-4a9a-a9ab-e46f2171d204","resolution":{"observed_at":"2026-08-06T13:39:43.721816Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1409.1556","last_updated":"2015-04-10T16:25:04Z","snapshot_observed_at":"2026-07-06T03:53:32.549552Z","submitted_at":"2014-09-04T19:48:04Z","title":"Very Deep Convolutional Networks for Large-Scale Image Recognition","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1409.1556","snapshot_observed_at":"2026-08-06T13:39:33.146640Z","title":"Very deep convolutional networks for large- scale image recognition.arXiv preprint arXiv:1409.1556, 2014","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-09T02:32:25.994375Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:33.146640Z"},"links":{"cited_paper":"/paper/1409.1556","citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:77a920f68214d7840239da355653938f01b106ddcba33a536e14b3da7d6779ae","observation_id":"634d6d80-3e21-434b-87c3-1a12f1065992","resolution":{"observed_at":"2026-08-06T13:39:33.146640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:33.258476Z","title":"Deep unsupervised learning using nonequilibrium thermodynamics","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-09T02:32:25.994375Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:33.258476Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:b0a8a4bfb026541bf777e67f98a48f0ccf58b9a896571a23f0e41bda5ad4b29d","observation_id":"f6285648-cc33-4b02-8ec7-0d7bc345be58","resolution":{"observed_at":"2026-08-06T13:39:33.258476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.13456","last_updated":"2021-02-10T18:17:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-11-26T19:39:10Z","title":"Score-Based Generative Modeling through Stochastic Differential Equations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.13456","snapshot_observed_at":"2026-08-06T13:39:33.344753Z","title":"Score-based generative modeling through stochastic differential equations.arXiv preprint arXiv:2011.13456, 2020","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-09T02:32:25.994375Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:33.344753Z"},"links":{"cited_paper":"/paper/2011.13456","citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:d020df9e0a6b92f377ed66ecc828333055ef648d15d68b8a14862d4e1a4ce37a","observation_id":"8a61772a-7f49-4d2c-b904-cb72350e8f88","resolution":{"observed_at":"2026-08-06T13:39:33.344753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19860","last_updated":"2024-12-26T07:39:08Z","snapshot_observed_at":"2026-07-06T20:13:54.305272Z","submitted_at":"2024-12-26T07:39:08Z","title":"UniAvatar: Taming Lifelike Audio-Driven Talking Head Generation with Comprehensive Motion and Lighting Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19860","snapshot_observed_at":"2026-08-06T13:39:33.440194Z","title":"Uniavatar: Taming lifelike audio-driven talking head generation with comprehensive motion and lighting control.arXiv preprint arXiv:2412.19860, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-09T02:32:25.994375Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:33.440194Z"},"links":{"cited_paper":"/paper/2412.19860","citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:267846dcd06117f648bb1e445bdd9bbd37156b8a3978f6e554b0183ce1128b7c","observation_id":"4d5a9aed-d76c-4689-9b42-cb70207d4d25","resolution":{"observed_at":"2026-08-06T13:39:33.440194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:43.215745Z","title":"Diffposetalk: Speech-driven stylistic 3d facial animation and head pose generation via diffusion models.ACM Transactions on Graphics (TOG), 43(4): 1–9, 2024","venue":null,"work_id":"f5592e6d-e37f-4782-8ecb-b00ed1621a41","year":2024},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-09T02:32:25.994375Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:33.563374Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:12a7497ad9a8222a1670a99777f0dd8726e6510f21bb4938ea4c3b1126e4178a","observation_id":"e030ceec-abb6-462c-bf73-a8f6a3641bd0","resolution":{"observed_at":"2026-08-06T13:39:43.329796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:42.914747Z","title":"Mofa: Model-based deep convolutional face autoencoder for unsupervised monocular reconstruction","venue":null,"work_id":"d9f88521-2439-4c2a-9d23-f51c343f197f","year":2017},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-09T02:32:25.994375Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:33.671556Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:4b9e446152836e0056fb007e1d890ea94169fb2330ff3c4dac4c56e1f3361590","observation_id":"c74ae494-b109-4b0d-ada8-38ea9c7732ed","resolution":{"observed_at":"2026-08-06T13:39:43.026476Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1607.08022","last_updated":"2017-11-06T14:21:43Z","snapshot_observed_at":"2026-08-05T08:35:49.218794Z","submitted_at":"2016-07-27T10:23:00Z","title":"Instance Normalization: The Missing Ingredient for Fast Stylization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.08022","snapshot_observed_at":"2026-08-06T13:39:33.789332Z","title":"Instance normalization: The missing ingredient for fast stylization.arXiv preprint arXiv:1607.08022, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-09T02:32:25.994375Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:33.789332Z"},"links":{"cited_paper":"/paper/1607.08022","citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:fe0ce84c0a8d86edf45212ecd443aa23db8082f2288e1076a8cf425774962ab1","observation_id":"4c3ffe1a-c906-4fa6-b52a-69d3472ea9fd","resolution":{"observed_at":"2026-08-06T13:39:33.789332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:42.634451Z","title":"Seeing what you said: Talking face generation guided by a lip reading expert","venue":null,"work_id":"69f91352-1f08-4e42-afd0-c475e54c7eb0","year":2023},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-09T02:32:25.994375Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:33.915452Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:3cb7983fe85890c43e079c927252d0cd182dc02df3f87f16f3c04e2d7383a51a","observation_id":"e95bcd4b-54e0-4c99-8704-59a1955c660f","resolution":{"observed_at":"2026-08-06T13:39:42.762236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01798","last_updated":"2025-01-03T13:14:52Z","snapshot_observed_at":"2026-07-06T20:16:13.411201Z","submitted_at":"2025-01-03T13:14:52Z","title":"JoyGen: Audio-Driven 3D Depth-Aware Talking-Face Video Editing","version":1},"cited_work":{"arxiv_id":"2501.01798","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.01798","snapshot_observed_at":"2026-08-06T13:39:36.810890Z","title":"JoyGen: Audio-Driven 3D Depth-Aware Talking-Face Video Editing","venue":"cs.CV","work_id":"6eda6200-92ee-4323-9088-d195af64a6a2","year":2025},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-09T02:32:25.994375Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:34.035222Z"},"links":{"cited_paper":"/paper/2501.01798","citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:fe2642f69be7457d3f8f783dc803a1c32be85b29d05bcec347b14311093f70be","observation_id":"cca0aa83-f00d-42b8-a2ec-60bf1bb2b0d0","resolution":{"observed_at":"2026-08-06T13:39:36.934732Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:42.314745Z","title":"One-shot free-view neural talking- head synthesis for video conferencing","venue":null,"work_id":"5466ac6f-0f0f-44a3-8981-b897eba9e72f","year":2021},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-09T02:32:25.994375Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:34.095342Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:69a61f45d912871c0b042e25c72010a033d9d3e40b3bc162ef9f7d321e7b5621","observation_id":"b0910bb9-7e8e-4faf-8ca2-8bc1a6c9c04c","resolution":{"observed_at":"2026-08-06T13:39:42.524760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:42.113114Z","title":"Im- itating arbitrary talking style for realistic audio-driven talking face synthesis","venue":null,"work_id":"6e4f12d6-67b5-43e0-8657-bc687e991165","year":2021},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-09T02:32:25.994375Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:34.191233Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:6ac12d2d5af7a04349857c09100cdef5c84349034b103d74e0e3a8ceba4cf0b6","observation_id":"800e569a-8dc8-44f6-a940-de396405586b","resolution":{"observed_at":"2026-08-06T13:39:42.177100Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:34.321999Z","title":"Group normalization","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-09T02:32:25.994375Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:34.321999Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:38597415f580f8e7c15b011419f37acdf34d8318cec26a629a8f42397d21b9b9","observation_id":"e1cd2faa-24b2-4e10-b08b-b60d51c27c4d","resolution":{"observed_at":"2026-08-06T13:39:34.321999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:41.804948Z","title":"Vfhq: A high-quality dataset and benchmark for video face super-resolution","venue":null,"work_id":"80e2ffc0-e561-4b44-90a8-4d58dd605a71","year":2022},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-09T02:32:25.994375Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:34.448317Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:7fb51e9d54f85a6b18e59c0daecc7f549108155fd7c0e4da77aee659e650fd53","observation_id":"3a0fb7a7-b975-4c4c-82b1-a21a80bac6a8","resolution":{"observed_at":"2026-08-06T13:39:41.956369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:41.605939Z","title":"High-fidelity generalized emotional talking face generation with multi-modal emotion space learning","venue":null,"work_id":"dc06e7dd-10b0-42cb-945b-0863f0bc52fa","year":2023},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-09T02:32:25.994375Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:34.547704Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:1f622d4820bb309bda88133c158cfcf2013ff54c61f9735ead85f6687aa2e8e3","observation_id":"5c7f96f4-0f53-472a-9c71-5ff53db2c77b","resolution":{"observed_at":"2026-08-06T13:39:41.706446Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08801","last_updated":"2024-06-16T07:10:41Z","snapshot_observed_at":"2026-07-06T18:30:06.570612Z","submitted_at":"2024-06-13T04:33:20Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08801","snapshot_observed_at":"2026-08-06T13:39:34.642522Z","title":"Hallo: Hierarchical audio-driven visual synthesis for portrait image animation.arXiv preprint arXiv:2406.08801, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-09T02:32:25.994375Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:34.642522Z"},"links":{"cited_paper":"/paper/2406.08801","citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:2bedf09084e5e0410cea935936ae42e643eeff7a469856c922549282ab63ca25","observation_id":"776c542c-0ebf-4ce1-8283-319b259dc0f0","resolution":{"observed_at":"2026-08-06T13:39:34.642522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:41.364830Z","title":"Vasa-1: Lifelike audio-driven talking faces generated in real time.Advances in Neural Information Processing Systems, 37: 660–684, 2025","venue":null,"work_id":"44792990-ec19-44b0-8d40-ee4a92149349","year":2025},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-09T02:32:25.994375Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:34.736629Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:5af6ee05061a8d93fd5b6814d67308d4a2fcfcd60a41b528e2824a6bfdc37a34","observation_id":"664cfe33-f7d2-48b7-8b67-823303c094aa","resolution":{"observed_at":"2026-08-06T13:39:41.478297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08503","last_updated":"2024-03-23T06:40:22Z","snapshot_observed_at":"2026-08-10T12:06:56.310596Z","submitted_at":"2024-01-16T17:04:30Z","title":"Real3D-Portrait: One-shot Realistic 3D Talking Portrait Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08503","snapshot_observed_at":"2026-08-06T13:39:34.794532Z","title":"Real3d-portrait: One-shot real- istic 3d talking portrait synthesis.arXiv preprint arXiv:2401.08503, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-09T02:32:25.994375Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:34.794532Z"},"links":{"cited_paper":"/paper/2401.08503","citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:99cc00de863ff05526ce8cd0fa1476bf06f972b74739bd2b7cbb107d6ccd0a2c","observation_id":"a621fd21-2307-4fea-94fe-f4f451b6878f","resolution":{"observed_at":"2026-08-06T13:39:34.794532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06180","last_updated":"2022-04-13T05:56:12Z","snapshot_observed_at":"2026-08-08T16:57:08.435859Z","submitted_at":"2022-04-13T05:56:12Z","title":"Dynamic Neural Textures: Generating Talking-Face Videos with Continuously Controllable Expressions","version":1},"cited_work":{"arxiv_id":"2204.06180","doi":null,"metadata_source":"pith","pith_arxiv_id":"2204.06180","snapshot_observed_at":"2026-08-06T13:39:36.456184Z","title":"Dynamic Neural Textures: Generating Talking-Face Videos with Continuously Controllable Expressions","venue":"cs.CV","work_id":"d62cdfa3-f824-4155-9df1-226edabe256a","year":2022},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-09T02:32:25.994375Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:34.839399Z"},"links":{"cited_paper":"/paper/2204.06180","citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:3cea22f3fe8f04003ae7148a35383eff8fe2527e30d8c1f29ed51a2fe34fb9b1","observation_id":"d52bddd0-e699-4fc2-a245-258d573e19b4","resolution":{"observed_at":"2026-08-06T13:39:36.594730Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.10137","last_updated":"2020-03-05T10:06:22Z","snapshot_observed_at":"2026-08-09T13:26:18.701286Z","submitted_at":"2020-02-24T10:02:10Z","title":"Audio-driven Talking Face Video Generation with Learning-based Personalized Head Pose","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.10137","snapshot_observed_at":"2026-08-06T13:39:34.940981Z","title":"Audio-driven talk- ing face video generation with learning-based personalized head pose.arXiv preprint arXiv:2002.10137, 2020","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-09T02:32:25.994375Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:34.940981Z"},"links":{"cited_paper":"/paper/2002.10137","citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:efbcd7ff3dc7119c3028a4eea99273284155123c6743812179300f20634231c9","observation_id":"63ba9994-1cfe-4f93-b806-b72b859aa270","resolution":{"observed_at":"2026-08-06T13:39:34.940981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:41.155021Z","title":"Face animation with an attribute-guided diffusion model","venue":null,"work_id":"e4732b19-17d0-4b75-a62a-a77b4605336f","year":2023},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-09T02:32:25.994375Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:35.033457Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:9e4c08f26d3136a8d4aa8c2bfbbdda98adf2150c1728773dcba015dc7a347bd6","observation_id":"4157b59f-bfa4-4588-9252-5a8b327f1495","resolution":{"observed_at":"2026-08-06T13:39:41.262334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:40.858509Z","title":"Facial: Synthesizing dynamic talking face with implicit attribute learning","venue":null,"work_id":"c54581b2-09ca-4b43-9683-8e5f5bd668f4","year":2021},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-09T02:32:25.994375Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:35.108427Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:2c687cc18da70909d0703b04875c058d142e30cb06f95869ee5a7fcfe014efc8","observation_id":"9bac0f53-df88-4098-a062-d3d80a038363","resolution":{"observed_at":"2026-08-06T13:39:41.002242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:40.510328Z","title":"Refa: Real-time egocentric facial animations for virtual reality","venue":null,"work_id":"533d5290-5309-41ff-9a71-7c6b6bb4773a","year":2024},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-09T02:32:25.994375Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:35.202295Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:1419dd4f37a81cc08e6cec56cd3669a4b555aa77ae83f992dac02484955df0e6","observation_id":"0422318c-2edd-4c9b-a99b-19dd9e1bdd53","resolution":{"observed_at":"2026-08-06T13:39:40.674745Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:40.200653Z","title":"Sadtalker: Learning realistic 3d motion coefficients for stylized audio-driven single image talking face animation","venue":null,"work_id":"c05d94a5-cf2c-43e5-9b9c-41b6f71e9890","year":2023},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-09T02:32:25.994375Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:35.285388Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:fc09540242edc1d40ec633fcbc11448c8cd215f2e69b0d626d672f0017dd4b71","observation_id":"879dae3c-ae67-4888-b272-598b973b81a8","resolution":{"observed_at":"2026-08-06T13:39:40.308738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10122","last_updated":"2025-03-26T10:48:17Z","snapshot_observed_at":"2026-07-06T19:32:46.742766Z","submitted_at":"2024-10-14T03:22:26Z","title":"MuseTalk: Real-Time High-Fidelity Video Dubbing via Spatio-Temporal Sampling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10122","snapshot_observed_at":"2026-08-06T13:39:35.346930Z","title":"Musetalk: Real-time high quality lip synchro- nization with latent space inpainting.arXiv preprint arXiv:2410.10122, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-09T02:32:25.994375Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:35.346930Z"},"links":{"cited_paper":"/paper/2410.10122","citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:b3f3730041fa368b4d711ecb8f11ca1eca887b0a5cd9abaf4c360fed8788d48a","observation_id":"9811c709-e290-485d-8a75-120a73b6c8ff","resolution":{"observed_at":"2026-08-06T13:39:35.346930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:39.949232Z","title":"Flow-guided one-shot talking face generation with a high-resolution audio-visual dataset","venue":null,"work_id":"5e939350-d8aa-4bf3-8371-8d081b1a5378","year":2021},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-09T02:32:25.994375Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:35.424448Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:84a6c2cac400cdae1e57685fe1fa5c629045ea30978e25af621519188658db2b","observation_id":"8b9d950b-6414-4087-a251-91625d824470","resolution":{"observed_at":"2026-08-06T13:39:40.054748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:39.704759Z","title":"Dinet: Deformation inpainting network for realistic face visually dubbing on high res- olution video","venue":null,"work_id":"faa27e75-157c-4b1a-8454-49174db839c0","year":2023},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-09T02:32:25.994375Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:35.481510Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:e16ed43cc60be3c598d08336f3f5e9371d40864540bf432d65c7c9f34d78c80f","observation_id":"c020f487-236e-43b8-a64f-a0949742b08c","resolution":{"observed_at":"2026-08-06T13:39:39.824124Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:39.492149Z","title":"Avid: Any-length video inpainting with diffusion model","venue":null,"work_id":"6c7f13ca-ce56-42fd-9deb-d1d37d6b8d97","year":2024},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-09T02:32:25.994375Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:35.584749Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:7b2f8db2410b671951727aea8dc947702a2315a2a05d93f144bf40bbb394a961","observation_id":"b6829569-aedf-4c87-bd57-1b7fd6d8b006","resolution":{"observed_at":"2026-08-06T13:39:39.579572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:39.247800Z","title":"General facial representation learn- ing in a visual-linguistic manner","venue":null,"work_id":"f6e75922-82b4-4915-b6a6-d37680636d54","year":2022},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-09T02:32:25.994375Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:35.672562Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:420b79a9b97e782180cd99132c7f50e05ffd1eb9d6d64b1366c359bcac9f131f","observation_id":"b4b5f0c6-1f7b-416b-a740-3c14836a54bc","resolution":{"observed_at":"2026-08-06T13:39:39.366507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:39.026519Z","title":"Identity-preserving talking face generation with landmark and appearance priors","venue":null,"work_id":"3206bfc4-2d57-49b7-8c64-5020cbebc890","year":2023},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-09T02:32:25.994375Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:35.695632Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:c0c47fa073bea19bfd51893f274c2912116c748b7cd3f51bcfc208b020c9eace","observation_id":"db3a4d5b-bec0-4ead-afda-b9904fdd7efc","resolution":{"observed_at":"2026-08-06T13:39:39.125796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:38.813709Z","title":"On the continuity of rotation representations in neural networks","venue":null,"work_id":"8ee43d66-2b80-4b6a-a2c2-d537edc7fb2b","year":2019},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-09T02:32:25.994375Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:35.804750Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:f9e15b5bf1433550015b80e2b71bdbf329fa829b6521739d080516adc3b09036","observation_id":"30928c61-73dd-4168-b5f1-80bb44a3e58a","resolution":{"observed_at":"2026-08-06T13:39:38.914745Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:35.884744Z","title":"Celebv-hq: A large-scale video facial attributes dataset","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-09T02:32:25.994375Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:35.884744Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:af2ac799f8dd864c2910f6ee333aecf1c3c6d82aa5890c9496c8c3451d3d6ba6","observation_id":"16350022-bbee-41f7-8a26-41640f31ec27","resolution":{"observed_at":"2026-08-06T13:39:35.884744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:38.544757Z","title":"Face alignment across large poses: A 3d solution","venue":null,"work_id":"9fc5c584-c4d8-4e81-b79a-c2e84706d605","year":2016},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-09T02:32:25.994375Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:35.995606Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:6d094b66019ff3e886e98905056b8605825d91fe9c1b1d1c591cdb1c9a0bd49d","observation_id":"6ddcae72-4a54-4602-addd-1572a4f83b33","resolution":{"observed_at":"2026-08-06T13:39:38.679177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:38.204750Z","title":"We also include identity consistency lossL id =∥α 1 −α 2∥2 2, where 1 and 2 indicate identity param- eters extracted from the same video but from different frames","venue":null,"work_id":"77ab281a-97d2-4b5d-81a0-f101684e069e","year":null},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-09T02:32:25.994375Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:36.109562Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:3c30912aab6e5ae1991c67e84357541c723244daab46ebdac7b143c165588f5f","observation_id":"fa695015-4b98-413e-adea-91038e6223b8","resolution":{"observed_at":"2026-08-06T13:39:38.329313Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:37.928828Z","title":"Recall from Sec","venue":null,"work_id":"602e5fca-1f75-4100-8a05-db98470b4fe0","year":null},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-09T02:32:25.994375Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:36.267401Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:25727b7da237cb9ac1dfb86f8c908f05d1de1453f17f6366400f1a268facb62d","observation_id":"3b55c148-1b18-4996-b193-375f349ce86a","resolution":{"observed_at":"2026-08-06T13:39:38.046610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T02:32:25.994375Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync"},"reference_resolution":{"displayed":86,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":37,"verified_exact":3,"verified_fuzzy":46},"total_outbound_references":86},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 86 of 86 outbound references and 0 inbound Pith citation observations for arXiv:2507.20452."}