{"as_of":"2026-08-21T11:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e716527e9bfea6f9a8ad3205bca766d98bd2c9177689797e5a87fa30471da3e2","coverage":[{"denominator":100,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:58:32.804437Z","state":"measured"},{"denominator":103,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":103,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T19:07:29.217054Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-29T08:03:13.813124Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-14T07:12:00.142810Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.01390","snapshot_observed_at":"2026-08-05T19:07:29.217054Z","title":"Fixtalk: Taming identity leakage for high-quality talking head generation in extreme cases,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.13442","last_updated":"2025-08-19T01:55:25Z","snapshot_observed_at":"2026-08-18T01:56:32.902193Z","submitted_at":"2025-08-19T01:55:25Z","title":"EDTalk++: Full Disentanglement for Controllable Talking Head Synthesis","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T19:07:29.217054Z"},"links":{"cited_paper":"/paper/2507.01390","citing_paper":"/paper/2508.13442"},"observation_digest":"sha256:f150a226f472909b796a2026da74e55813e56d09bea6d3f2900366a2da44fe24","observation_id":"c52eddb4-771e-42d3-8b71-97be5006d837","resolution":{"observed_at":"2026-08-05T19:07:29.217054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-14T07:12:00.142810Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"cited_work":{"arxiv_id":"2507.01390","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.01390","snapshot_observed_at":"2026-06-29T08:03:13.813124Z","title":"Fixtalk: Taming identity leakage for high-quality talking head generation in extreme cases.CoRR, abs/2507.01390","venue":null,"work_id":"2b65a158-d981-4cd1-b092-6d2e4f52ee48","year":2025},"citing_paper":{"arxiv_id":"2604.19129","last_updated":"2026-04-21T06:22:47Z","snapshot_observed_at":"2026-08-17T21:06:20.803846Z","submitted_at":"2026-04-21T06:22:47Z","title":"PortraitDirector: A Hierarchical Disentanglement Framework for Controllable and Real-time Facial Reenactment","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-10T03:30:18.645845Z"},"links":{"cited_paper":"/paper/2507.01390","citing_paper":"/paper/2604.19129"},"observation_digest":"sha256:f3d8ff355bf46e8ab619fb7320b4f06a3dc82ffe31dd32f74de0c1a9585bbd65","observation_id":"d74195c8-79f0-493a-aa5d-bfeaa318aa64","resolution":{"observed_at":"2026-05-11T12:31:04.324918Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-14T07:12:00.142810Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"cited_work":{"arxiv_id":"2507.01390","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.01390","snapshot_observed_at":"2026-06-29T08:03:13.813124Z","title":"Fixtalk: Taming identity leakage for high-quality talking head generation in extreme cases.CoRR, abs/2507.01390","venue":null,"work_id":"2b65a158-d981-4cd1-b092-6d2e4f52ee48","year":2025},"citing_paper":{"arxiv_id":"2605.30311","last_updated":"2026-05-28T17:53:27Z","snapshot_observed_at":"2026-07-06T23:39:38.845840Z","submitted_at":"2026-05-28T17:53:27Z","title":"Archon: A Unified Multimodal Model for Holistic Digital Human Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-29T08:03:04.294439Z"},"links":{"cited_paper":"/paper/2507.01390","citing_paper":"/paper/2605.30311"},"observation_digest":"sha256:4bdd0501270d53177623a6435731d66872b9e9be55e91e74b5d9523bbc7cbe3c","observation_id":"c47e529a-4b32-4ba9-bb48-a179bbb9cebd","resolution":{"observed_at":"2026-06-29T08:03:13.814718Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.01390/citation-record","integrity":"/paper/2507.01390/integrity","json":"/paper/2507.01390/citation-record.json","paper":"/paper/2507.01390"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2311.12052","last_updated":"2024-05-05T05:07:34Z","snapshot_observed_at":"2026-08-20T12:40:23.421319Z","submitted_at":"2023-11-18T10:22:44Z","title":"MagicPose: Realistic Human Poses and Facial Expressions Retargeting with Identity-aware Diffusion","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12052","snapshot_observed_at":"2026-08-06T20:58:21.467931Z","title":"Magicdance: Realistic human dance video gen- eration with motions & facial expressions transfer","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-14T07:12:00.142810Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:21.467931Z"},"links":{"cited_paper":"/paper/2311.12052","citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:5f8dc4daa2b47932dcb9230309ee3d180cea13ece0c3752d75cfdd812771f796","observation_id":"5f833766-b682-420b-aad2-d79e16885251","resolution":{"observed_at":"2026-08-06T20:58:21.467931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.13272","last_updated":"2024-12-02T12:18:12Z","snapshot_observed_at":"2026-08-16T13:41:34.831210Z","submitted_at":"2024-06-19T07:08:48Z","title":"AniFaceDiff: Animating Stylized Avatars via Parametric Conditioned Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.13272","snapshot_observed_at":"2026-08-06T20:58:21.554078Z","title":"Anifacediff: High-fidelity face reenactment via fa- cial parametric conditioned diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-14T07:12:00.142810Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:21.554078Z"},"links":{"cited_paper":"/paper/2406.13272","citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:a1c0e3d22e7202fb98fcc4f7b889dbfdf1f19d3a51f9fd346d1f6c3ebfc769d6","observation_id":"9390c551-17ff-4675-80c0-b9b92e7aba57","resolution":{"observed_at":"2026-08-06T20:58:21.554078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:21.715441Z","title":"Lip movements generation at a glance","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-14T07:12:00.142810Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:21.715441Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:e72131329162310cc7c3d99e710426c8c2d6793f433ac094594e53a8aa81b490","observation_id":"d8534d57-228d-4ed3-be0a-1c5f21ee91b5","resolution":{"observed_at":"2026-08-06T20:58:21.715441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:21.876831Z","title":"Hierarchical cross-modal talking face generation with dynamic pixel-wise loss","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-14T07:12:00.142810Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:21.876831Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:9c37aba7404eba08671bcbe74bcef11ca844a6ef76d1801c9dbdabddc7d2015c","observation_id":"09a1aa1f-f02a-48a6-aebd-cc71fddf10a2","resolution":{"observed_at":"2026-08-06T20:58:21.876831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:22.046172Z","title":"Talking-head generation with rhyth- mic head motion","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-14T07:12:00.142810Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:22.046172Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:17df4592484b9d191ff4460ac3f83a57b46edd57a209eed17cce7e93ddaad577","observation_id":"a0317fcc-ef60-484e-9aa4-418d68f9e562","resolution":{"observed_at":"2026-08-06T20:58:22.046172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:22.197475Z","title":"Vast: Vivify your talk- ing avatar via zero-shot expressive facial style transfer","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-14T07:12:00.142810Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:22.197475Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:92884121bbfc46ca9190d0f07218d9a6cd89d35a68cb20d57b4c245eedf9ab11","observation_id":"8c8f1b63-48d9-40f5-b7b2-18fbb7008636","resolution":{"observed_at":"2026-08-06T20:58:22.197475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08136","last_updated":"2024-07-12T02:41:51Z","snapshot_observed_at":"2026-08-17T16:30:00.213972Z","submitted_at":"2024-07-11T02:26:51Z","title":"EchoMimic: Lifelike Audio-Driven Portrait Animations through Editable Landmark Conditions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08136","snapshot_observed_at":"2026-08-06T20:58:22.315210Z","title":"Echomimic: Lifelike audio-driven por- trait animations through editable landmark conditions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-14T07:12:00.142810Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:22.315210Z"},"links":{"cited_paper":"/paper/2407.08136","citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:cef8cc79f3aba7a686f107f791e2fbb60a27950b04e198ccf29c2e988910f9e5","observation_id":"d2afcd9e-6efc-48d3-97ef-7e7d6fc4ee67","resolution":{"observed_at":"2026-08-06T20:58:22.315210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:22.475622Z","title":"Out of time: auto- mated lip sync in the wild","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-14T07:12:00.142810Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:22.475622Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:c4d0e087846728ac787f5158ee5d9d31d58f98468059a7d1698e9b68b79bdf92","observation_id":"3365c6d2-17ee-4693-9e3e-29929e1b7240","resolution":{"observed_at":"2026-08-06T20:58:22.475622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07718","last_updated":"2024-10-14T13:35:17Z","snapshot_observed_at":"2026-08-18T14:49:48.395825Z","submitted_at":"2024-10-10T08:34:41Z","title":"Hallo2: Long-Duration and High-Resolution Audio-Driven Portrait Image Animation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07718","snapshot_observed_at":"2026-08-06T20:58:22.630703Z","title":"Hallo2: Long-duration and high-resolution audio-driven portrait im- age animation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-14T07:12:00.142810Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:22.630703Z"},"links":{"cited_paper":"/paper/2410.07718","citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:98e6c0be3db2f9d91db4a13b2d0463cffb42d507f1ce02a79eb09201173701d3","observation_id":"5c6c34f5-2787-48e5-ad04-0801b8d182cd","resolution":{"observed_at":"2026-08-06T20:58:22.630703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00733","last_updated":"2025-03-13T08:23:27Z","snapshot_observed_at":"2026-08-18T10:30:20.725493Z","submitted_at":"2024-12-01T08:54:30Z","title":"Hallo3: Highly Dynamic and Realistic Portrait Image Animation with Video Diffusion Transformer","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00733","snapshot_observed_at":"2026-08-06T20:58:22.787467Z","title":"Hallo3: Highly dynamic and realistic portrait image an- imation with diffusion transformer networks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-14T07:12:00.142810Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:22.787467Z"},"links":{"cited_paper":"/paper/2412.00733","citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:063a13ee3535d26008508f951bcea10f7a23b67a17385fd6ae341530ed27cec5","observation_id":"02d17b77-7cb3-43cf-9141-75f12639f65e","resolution":{"observed_at":"2026-08-06T20:58:22.787467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:22.904616Z","title":"Speech-driven facial animation using cas- caded gans for learning of motion and texture","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-14T07:12:00.142810Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:22.904616Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:cd8f82cc392b4e305b915f727b2cee7192fe7fbe5c6a183ff3c0dddb9074f313","observation_id":"5f6892af-eed6-4aee-9b20-49d12c35b591","resolution":{"observed_at":"2026-08-06T20:58:22.904616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:23.039770Z","title":"Megaportraits: One-shot megapixel neural head avatars","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-14T07:12:00.142810Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:23.039770Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:c514cb38078533c6a657b1f6033325d7c7cfb6c2931b64f9e873a0c88290daa2","observation_id":"91569752-12db-4caf-b3d0-41df5f9b889a","resolution":{"observed_at":"2026-08-06T20:58:23.039770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:23.160720Z","title":"Emoportraits: Emotion-enhanced multimodal one-shot head avatars","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-14T07:12:00.142810Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:23.160720Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:c1d1eac00be1fc87d683be3294fa34510f47afbe66781167141de2c0d9b03a85","observation_id":"36621e5f-53a4-4240-b2f7-c99f68f6bf17","resolution":{"observed_at":"2026-08-06T20:58:23.160720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:23.309161Z","title":"Efficient emotional adaptation for audio-driven talking-head generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-14T07:12:00.142810Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:23.309161Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:aee21f35eecf8229b31a4c05296b583b6cb2dbedc12e09b1e412d9abc6f69448","observation_id":"1bed86f5-5460-43ba-8d8b-9c8e43a036c8","resolution":{"observed_at":"2026-08-06T20:58:23.309161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:23.444115Z","title":"Generative adversarial networks","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-14T07:12:00.142810Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:23.444115Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:dd68fc28d911ca25f7a1cddae3879d4df172bdf5a2e97d5a4918e9e4f39a03a6","observation_id":"1b6ca795-ca90-4898-856c-05c71a67acdb","resolution":{"observed_at":"2026-08-06T20:58:23.444115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:23.599505Z","title":"Stylesync: High-fidelity generalized and personalized lip sync in style-based genera- tor","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-14T07:12:00.142810Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:23.599505Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:57eb1ed74b8d14e264f97b7416e58a6b4acc3fdd9fb7f71cb758976914c60c82","observation_id":"8d5f2a63-e22f-40d2-8c4d-1f49d785d6f3","resolution":{"observed_at":"2026-08-06T20:58:23.599505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03284","last_updated":"2024-08-06T16:31:45Z","snapshot_observed_at":"2026-08-16T13:28:09.800154Z","submitted_at":"2024-08-06T16:31:45Z","title":"ReSyncer: Rewiring Style-based Generator for Unified Audio-Visually Synced Facial Performer","version":1},"cited_work":{"arxiv_id":"2408.03284","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.03284","snapshot_observed_at":"2026-08-06T20:58:33.962984Z","title":"ReSyncer: Rewiring Style-based Generator for Unified Audio-Visually Synced Facial Performer","venue":"cs.CV","work_id":"68587a73-845d-4a93-9ebb-3822002eecf9","year":2024},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-14T07:12:00.142810Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:23.782875Z"},"links":{"cited_paper":"/paper/2408.03284","citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:e03fbf7c191e54146f7bee6daa0d1c5bf9e1cabf0e4446e4bd94eae9cb7e3dd6","observation_id":"326d3489-574c-4c39-b447-d864d5888c40","resolution":{"observed_at":"2026-08-06T20:58:34.043456Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03168","last_updated":"2025-02-28T14:39:17Z","snapshot_observed_at":"2026-08-18T14:48:47.548305Z","submitted_at":"2024-07-03T14:41:39Z","title":"LivePortrait: Efficient Portrait Animation with Stitching and Retargeting Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.03168","snapshot_observed_at":"2026-08-06T20:58:23.941280Z","title":"Livepor- trait: Efficient portrait animation with stitching and retarget- ing control","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-14T07:12:00.142810Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:23.941280Z"},"links":{"cited_paper":"/paper/2407.03168","citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:3916ee6bb1a51b45ae365110a7e328d9eb3db9278b9d05732fb76c4eea2ead53","observation_id":"53726732-687d-45fc-80d2-701344beac12","resolution":{"observed_at":"2026-08-06T20:58:23.941280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15179","last_updated":"2024-09-23T16:33:53Z","snapshot_observed_at":"2026-08-20T15:30:54.108153Z","submitted_at":"2024-09-23T16:33:53Z","title":"MIMAFace: Face Animation via Motion-Identity Modulated Appearance Feature Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.15179","snapshot_observed_at":"2026-08-06T20:58:24.056864Z","title":"Mimaface: Face animation via motion-identity modulated appearance feature learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-14T07:12:00.142810Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:24.056864Z"},"links":{"cited_paper":"/paper/2409.15179","citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:1705c626b20f81ca40a2811340592e414ef9ad4dce5a8c1fa31efab11aa0a192","observation_id":"49a37c06-cd84-4cc2-bf49-df0975b38007","resolution":{"observed_at":"2026-08-06T20:58:24.056864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:24.222486Z","title":"Depth-aware generative adversarial network for talking head video generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-14T07:12:00.142810Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:24.222486Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:71394ad687c1529e3a499cb243dacf216b8def27df0859bd2b98083c0617d2c8","observation_id":"bff06acf-b371-42f8-9b8f-5f3d863c157d","resolution":{"observed_at":"2026-08-06T20:58:24.222486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:24.412644Z","title":"Image quality metrics: Psnr vs","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-14T07:12:00.142810Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:24.412644Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:c538390f58a63ab8d9d9e9f4a69d16fff51460ae8e793284b584d7ccc0625ce2","observation_id":"87f4bb73-c48b-4ebf-8415-3c952b96d92f","resolution":{"observed_at":"2026-08-06T20:58:24.412644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17117","last_updated":"2024-06-13T06:37:20Z","snapshot_observed_at":"2026-08-17T07:05:18.024386Z","submitted_at":"2023-11-28T12:27:15Z","title":"Animate Anyone: Consistent and Controllable Image-to-Video Synthesis for Character Animation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17117","snapshot_observed_at":"2026-08-06T20:58:24.581586Z","title":"Animate anyone: Consistent and controllable image-to-video synthesis for character animation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-14T07:12:00.142810Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:24.581586Z"},"links":{"cited_paper":"/paper/2311.17117","citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:10dc235c6ed077e69d097f83e2dc02df8e98fbf25c57a8db1daba67bc6b915ee","observation_id":"54de9502-8151-4291-abb5-d848315272c2","resolution":{"observed_at":"2026-08-06T20:58:24.581586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:24.716893Z","title":"You said that?: Synthesising talking faces from audio","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-14T07:12:00.142810Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:24.716893Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:10d4eabbacfe8505d7d7534f9a4b467b792bc89b62b1a733657e92b440e45206","observation_id":"53f342e7-3c36-4954-9794-7317db3a2a97","resolution":{"observed_at":"2026-08-06T20:58:24.716893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:24.913012Z","title":"Stylevr: Stylizing character animations with normal- izing flows","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-14T07:12:00.142810Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:24.913012Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:fbb6a46a28477094f8c303d3eedc9fbb50627bee0d3859a6fada0d91345fd620","observation_id":"b95e8d46-d00e-40ed-b3c9-720002ddcd98","resolution":{"observed_at":"2026-08-06T20:58:24.913012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:25.124693Z","title":"Sport: From zero-shot prompts to real-time motion gener- ation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-14T07:12:00.142810Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:25.124693Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:3bd0e966ffa95c6ec1a54e10ea1da01e869f5b3ec3f89b5fe9e6df0e05ccf439","observation_id":"6329ee8a-5a73-4019-8d8c-8d79c8b3a4cf","resolution":{"observed_at":"2026-08-06T20:58:25.124693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:25.339089Z","title":"Eamm: One-shot emotional talking face via audio-based emotion-aware motion model","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-14T07:12:00.142810Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:25.339089Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:814d23c7eb1eee0165831ad9fc2b391ffb650d789f3c75c1a73c705e53bc92f1","observation_id":"0e998991-59a5-4f91-b10b-e24aa973e0c1","resolution":{"observed_at":"2026-08-06T20:58:25.339089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02634","last_updated":"2025-04-04T05:13:40Z","snapshot_observed_at":"2026-08-17T16:32:16.739621Z","submitted_at":"2024-09-04T11:55:14Z","title":"Loopy: Taming Audio-Driven Portrait Avatar with Long-Term Motion Dependency","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02634","snapshot_observed_at":"2026-08-06T20:58:25.497728Z","title":"Loopy: Taming audio-driven portrait avatar with long-term motion dependency","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-14T07:12:00.142810Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:25.497728Z"},"links":{"cited_paper":"/paper/2409.02634","citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:2163c57e4e58388ce88003653753b0fc7334d53f559df8f0440091af237a5ac6","observation_id":"a8f7659b-237e-432f-b8f1-d8c16d291a53","resolution":{"observed_at":"2026-08-06T20:58:25.497728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:25.704083Z","title":"Percep- tual losses for real-time style transfer and super-resolution","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-14T07:12:00.142810Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:25.704083Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:51e17749bbd46125a9668912527ace104e064ed4a65d1c3e8d089e2cb396fc19","observation_id":"9838acb1-9a47-452f-9d4e-646f031f3948","resolution":{"observed_at":"2026-08-06T20:58:25.704083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:25.793774Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-14T07:12:00.142810Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:25.793774Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:96ebd0b992c9323eed1d77332e3c682289462dab3bb3753dce3c7e7a426759d0","observation_id":"ab19e5d0-2d8a-4875-9fd6-131475d75aee","resolution":{"observed_at":"2026-08-06T20:58:25.793774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:25.880766Z","title":"Intergen: Diffusion-based multi-human motion genera- tion under complex interactions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-14T07:12:00.142810Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:25.880766Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:f2aeb160a6053223c7433b3d01d116352d6e71cc0b8c147b3cdb2ec10a571171","observation_id":"7597572e-a216-4343-be70-88d0ed1b0ef1","resolution":{"observed_at":"2026-08-06T20:58:25.880766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01876","last_updated":"2025-04-05T05:31:38Z","snapshot_observed_at":"2026-08-19T21:16:46.905576Z","submitted_at":"2024-09-03T13:19:31Z","title":"CyberHost: Taming Audio-driven Avatar Diffusion Model with Region Codebook Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.01876","snapshot_observed_at":"2026-08-06T20:58:25.954676Z","title":"Cyberhost: Taming audio- driven avatar diffusion model with region codebook atten- tion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-14T07:12:00.142810Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:25.954676Z"},"links":{"cited_paper":"/paper/2409.01876","citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:492973fd165b90dea2999477ca6fc5d53aae79a9120ca7308367e3e67ff1b126","observation_id":"116419c8-75ac-4a35-a5cc-d9c71e95eac8","resolution":{"observed_at":"2026-08-06T20:58:25.954676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.03121","last_updated":"2024-05-06T02:32:41Z","snapshot_observed_at":"2026-08-20T08:43:13.442030Z","submitted_at":"2024-05-06T02:32:41Z","title":"AniTalker: Animate Vivid and Diverse Talking Faces through Identity-Decoupled Facial Motion Encoding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.03121","snapshot_observed_at":"2026-08-06T20:58:26.077777Z","title":"Anitalker: Animate vivid and di- verse talking faces through identity-decoupled facial motion encoding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-14T07:12:00.142810Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:26.077777Z"},"links":{"cited_paper":"/paper/2405.03121","citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:620876016e89341ab61fd1e8bb21fed40a78bf09718a31e94ede6890c2a4990a","observation_id":"42b51f07-8418-4ce0-b1a8-65fce0b9a4fc","resolution":{"observed_at":"2026-08-06T20:58:26.077777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09892","last_updated":"2024-12-18T11:12:49Z","snapshot_observed_at":"2026-08-19T14:28:08.835878Z","submitted_at":"2024-12-13T06:14:57Z","title":"VQTalker: Towards Multilingual Talking Avatars through Facial Motion Tokenization","version":2},"cited_work":{"arxiv_id":"2412.09892","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.09892","snapshot_observed_at":"2026-08-06T20:58:33.603497Z","title":"VQTalker: Towards Multilingual Talking Avatars through Facial Motion Tokenization","venue":"cs.CV","work_id":"ca795b04-2a7c-4d24-9085-1b35e0116875","year":2024},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-14T07:12:00.142810Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:26.163505Z"},"links":{"cited_paper":"/paper/2412.09892","citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:eab3a68a0096e32aa9f5468a72e98e3dc0b5aa8bafb22d0417492de460f447fc","observation_id":"8970cea0-eb16-4c25-beb7-0ad61023ec35","resolution":{"observed_at":"2026-08-06T20:58:33.668649Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:43.576088Z","title":"Cvthead: One-shot controllable head avatar with vertex-feature transformer","venue":null,"work_id":"6ede0369-ee4b-43f3-8af8-65ebf29e4afd","year":2024},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-14T07:12:00.142810Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:26.248215Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:3e9f5767081d48f642bff753b168b9c2304f790c53d704a69aef9067add75db7","observation_id":"1f82563c-333c-4f26-a612-7f79f2b70c6b","resolution":{"observed_at":"2026-08-06T20:58:43.696425Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01900","last_updated":"2024-06-07T02:57:36Z","snapshot_observed_at":"2026-08-18T14:57:45.246060Z","submitted_at":"2024-06-04T02:05:57Z","title":"Follow-Your-Emoji: Fine-Controllable and Expressive Freestyle Portrait Animation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01900","snapshot_observed_at":"2026-08-06T20:58:26.335483Z","title":"Follow-your-emoji: Fine-controllable and expressive freestyle portrait animation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-14T07:12:00.142810Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:26.335483Z"},"links":{"cited_paper":"/paper/2406.01900","citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:9e4ba331e5a34658656ce8ffe3cac628ab9bff09a1ff7a4457481473616f3361","observation_id":"abad82ae-21ab-4e66-b392-e5c7026b074a","resolution":{"observed_at":"2026-08-06T20:58:26.335483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:26.442215Z","title":"Echomimicv2: Towards striking, simplified, and semi-body human animation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-14T07:12:00.142810Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:26.442215Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:9313db5e807cbfaecc3628464ef3ceceee5cad4ad5ab9531b23a26cad3ae858d","observation_id":"b234cd9c-b898-4562-9e7a-7fba56894c4e","resolution":{"observed_at":"2026-08-06T20:58:26.442215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:43.399324Z","title":"completely blind","venue":null,"work_id":"ea7a56b0-33ac-49d9-9dd9-94462bd64fee","year":2012},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-14T07:12:00.142810Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:26.527565Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:6c1f3b70ab9609c07ca5dc0dd53d902b7f4a6293406c137b486c159680a858d1","observation_id":"7a79d737-fc3b-41dd-95e6-1234db06ff9d","resolution":{"observed_at":"2026-08-06T20:58:43.488774Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:43.106230Z","title":"Emotional voice puppetry","venue":null,"work_id":"52b8521d-1f98-4a5c-9ea4-a8bfe76bc69a","year":2023},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-14T07:12:00.142810Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:26.629143Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:cadf33c8e9d865e64a036497e50e0a5a97399b3ed908a50094b245daff447e85","observation_id":"ba1c3d46-a838-436d-aeee-c88931d91d78","resolution":{"observed_at":"2026-08-06T20:58:43.237797Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:42.868030Z","title":"Expressive talking avatars","venue":null,"work_id":"a996d4ec-9967-4fb5-a642-194672c757ff","year":2024},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-14T07:12:00.142810Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:26.756376Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:bf59700a8f9d83e3852c11efbad3fc9e06efda9b1aef149a25505b4deec40e58","observation_id":"1c104941-3f65-4724-a74b-2f4a1d345243","resolution":{"observed_at":"2026-08-06T20:58:42.991292Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:42.577552Z","title":"Vasa-rig: Audio-driven 3d facial animation with ‘live’mood dynamics in virtual reality","venue":null,"work_id":"c2d31de9-e072-43e4-a8f8-dd098de044ac","year":2025},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-14T07:12:00.142810Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:26.888357Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:45e7c161a0faeab48a836800bafa77af03285119f03d31e15e0dfc3941e2f879","observation_id":"30be8b83-68b0-4b8f-97f5-1f1721d796b3","resolution":{"observed_at":"2026-08-06T20:58:42.710067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:26.983504Z","title":"Dpe: Dis- entanglement of pose and expression for general video por- trait editing","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-14T07:12:00.142810Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:26.983504Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:c1dd184ecc362f6dfc53efb4af7dae427662ae77ec51d67b720c6a07a87fbc6a","observation_id":"2d8a285e-3a8e-4328-86fa-56318be32cfd","resolution":{"observed_at":"2026-08-06T20:58:26.983504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06070","last_updated":"2025-03-08T08:43:03Z","snapshot_observed_at":"2026-08-19T14:04:38.615117Z","submitted_at":"2024-08-12T11:41:18Z","title":"ControlNeXt: Powerful and Efficient Control for Image and Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06070","snapshot_observed_at":"2026-08-06T20:58:27.059131Z","title":"Controlnext: Powerful and effi- cient control for image and video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-14T07:12:00.142810Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:27.059131Z"},"links":{"cited_paper":"/paper/2408.06070","citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:04169d0596faaef9155a0a01bab7952476d1ab04bffa9bc82590cd5e38018d97","observation_id":"1eb63fe8-f14d-43ae-b645-876b9c74348e","resolution":{"observed_at":"2026-08-06T20:58:27.059131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:27.157855Z","title":"High-resolution image syn- thesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-14T07:12:00.142810Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:27.157855Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:e63191e596f08fce30ed1bd818367f27a02361d4ded6f0e8dc912a13bab50b0b","observation_id":"f5c24d2f-8b78-498e-be3e-7f1b7b1ef125","resolution":{"observed_at":"2026-08-06T20:58:27.157855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:27.225742Z","title":"pytorch-fid: FID Score for PyTorch","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-14T07:12:00.142810Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:27.225742Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:1f52203231931f4a5094a25ab67f2d07f69b4283d170c8730d4294fe9dc691e1","observation_id":"ff5085ea-8f6d-46b7-9e9d-8e1ef0ac780a","resolution":{"observed_at":"2026-08-06T20:58:27.225742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:42.215472Z","title":"Learning dynamic facial radiance fields for few-shot talking head synthesis","venue":null,"work_id":"b1a2c390-7573-43a8-accb-b412a408fb14","year":2022},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-14T07:12:00.142810Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:27.322184Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:5b0b1a29af5b99f8d3cec0fd171d64a2ac0fed0b583971878b590286dee175f7","observation_id":"fa30d92d-fc59-4934-b54a-4f122da70942","resolution":{"observed_at":"2026-08-06T20:58:42.404195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:42.033662Z","title":"Difftalk: Crafting diffusion models for generalized audio-driven portraits animation","venue":null,"work_id":"ce8ef73b-a9cf-427b-a20f-caedf00c9592","year":1982},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-14T07:12:00.142810Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:27.450182Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:f8cc117498cb4f19c1a112a000a1e68903a6f961e723d973425b66cd7d1be670","observation_id":"31b7320f-a108-4da5-8791-cbc5278595ff","resolution":{"observed_at":"2026-08-06T20:58:42.107540Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:41.758774Z","title":"Motionstone: Decoupled motion in- tensity modulation with diffusion transformer for image-to- video generation","venue":null,"work_id":"8c8e230a-3e3b-4b5f-97ab-c8e649d91b94","year":2025},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-14T07:12:00.142810Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:27.540019Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:fa60a7fcd21bc6cbce40d0cdafc29565e354437468b2246b80b5b36918a29553","observation_id":"fa16f019-5c28-4429-be99-0d3731a603fc","resolution":{"observed_at":"2026-08-06T20:58:41.912248Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1409.1556","last_updated":"2015-04-10T16:25:04Z","snapshot_observed_at":"2026-08-17T19:17:06.411141Z","submitted_at":"2014-09-04T19:48:04Z","title":"Very Deep Convolutional Networks for Large-Scale Image Recognition","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1409.1556","snapshot_observed_at":"2026-08-06T20:58:27.622630Z","title":"Very deep convo- lutional networks for large-scale image recognition","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-14T07:12:00.142810Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:27.622630Z"},"links":{"cited_paper":"/paper/1409.1556","citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:c3987e6b3a8b09aaa1955b1766080ad58b11d9629aa266fad23362acb9fdcb63","observation_id":"531ad2a9-b71f-4779-9e82-c793ee3b63dc","resolution":{"observed_at":"2026-08-06T20:58:27.622630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:41.585008Z","title":"Talking face generation by conditional recurrent adversarial network","venue":null,"work_id":"c69442ef-9295-46a0-aa39-ad49cbc5510e","year":2019},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-14T07:12:00.142810Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:27.746743Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:54fde610f1958e1be4a1d4f43ad527180b269d1481e2676f425853b93be240a4","observation_id":"dcd1f923-e9d2-415d-82a3-217aa1d593fd","resolution":{"observed_at":"2026-08-06T20:58:41.638652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:41.440905Z","title":"Emmn: Emotional motion memory network for audio-driven emotional talking face generation","venue":null,"work_id":"c3b32898-ab37-4d4c-9afc-4c10a48eb0f6","year":2023},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-14T07:12:00.142810Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:27.872142Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:3cf1f494979c9a0e90ee05737b68e86222160301da50b131278f392b83683715","observation_id":"b1ec8c6e-db41-485d-8036-33705b0dd78f","resolution":{"observed_at":"2026-08-06T20:58:41.522224Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:41.148596Z","title":"Say anything with any style","venue":null,"work_id":"586089b6-5080-448a-a233-449e79a4c1dc","year":2024},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-14T07:12:00.142810Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:27.963148Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:c1783c4523550bf8a2349678843620d2ecddf34f113358c2704516e8c72d9cd4","observation_id":"2421377a-b90b-4b9c-9c20-e6245e05c527","resolution":{"observed_at":"2026-08-06T20:58:41.280602Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:40.971428Z","title":"Flowvqtalker: High-quality emotional talking face generation through normalizing flow and quantization","venue":null,"work_id":"a6580171-7e6e-48f7-8df1-4bb78ec41f69","year":2024},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-14T07:12:00.142810Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:28.079877Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:84275b782a8dce52e9b82c2378d844314f4148cfa5f9013e4245364564a95df6","observation_id":"fb7f0277-3747-4a2b-b88d-1a002a64eed9","resolution":{"observed_at":"2026-08-06T20:58:41.040401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:28.159722Z","title":"Style2talker: High-resolution talking head generation with emotion style and art style","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-14T07:12:00.142810Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:28.159722Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:6199efc743066c0a516ef993faf17c53dab265d797cf779db9a756dbacf7c580","observation_id":"3d9b1bc7-0dde-44ad-81b4-13337c1db04c","resolution":{"observed_at":"2026-08-06T20:58:28.159722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:40.836120Z","title":"Mimir: Improving video diffusion models for precise text understanding","venue":null,"work_id":"7cc05193-e025-4041-952d-2b02796ed161","year":2025},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-14T07:12:00.142810Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:28.204641Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:f146e0b464a7d7f9fd685f27a0be031a8d38f091412b76cce250de98b827bfe3","observation_id":"4a987c1c-7873-44d4-9077-67d2aaf5b470","resolution":{"observed_at":"2026-08-06T20:58:40.896869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:40.600271Z","title":"Animate-x: Universal character image ani- mation with enhanced motion representation","venue":null,"work_id":"66967612-bdc8-4c99-8c91-20ade3f6f788","year":2025},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-14T07:12:00.142810Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:28.330893Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:b6281a7820cf0e836a5566d97a16396d57e8680623733e82f2bd8161d09b0702","observation_id":"b58591a4-7f66-41c4-9dc1-707728e03e4c","resolution":{"observed_at":"2026-08-06T20:58:40.753289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.23690","snapshot_observed_at":"2026-08-06T20:58:28.474259Z","title":"Synmotion: Semantic-visual adaptation for motion customized video generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-14T07:12:00.142810Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:28.474259Z"},"links":{"cited_paper":"/paper/2506.23690","citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:731650a4cc8cd1c181642a8f0725754d60e81a9527d279dc771835650cc38874","observation_id":"20fd1b1f-af0c-452d-94b4-116723df07bb","resolution":{"observed_at":"2026-08-06T20:58:28.474259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:40.467488Z","title":"Edtalk: Effi- cient disentanglement for emotional talking head synthesis","venue":null,"work_id":"4c513e68-8c48-48fe-b901-ad0c4045635f","year":null},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-14T07:12:00.142810Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:28.553399Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:ecb5c2c8ee2677a46a750dcadd3631d318b67a4299a0238a6f113f36f3f09267","observation_id":"887adebb-fad8-453c-9328-086947d0e3ea","resolution":{"observed_at":"2026-08-06T20:58:40.538330Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03270","last_updated":"2024-11-28T09:53:01Z","snapshot_observed_at":"2026-08-19T11:28:48.657086Z","submitted_at":"2024-09-05T06:27:32Z","title":"SVP: Style-Enhanced Vivid Portrait Talking Head Diffusion Model","version":2},"cited_work":{"arxiv_id":"2409.03270","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.03270","snapshot_observed_at":"2026-08-06T20:58:33.231158Z","title":"SVP: Style-Enhanced Vivid Portrait Talking Head Diffusion Model","venue":"cs.CV","work_id":"ced40590-3500-4698-b1a9-a584e52666f6","year":2024},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-14T07:12:00.142810Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:28.791946Z"},"links":{"cited_paper":"/paper/2409.03270","citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:ad6157fae84b0cc28195e2f40ea1019335bfa0b9c7433518b2c33b7f11845a2e","observation_id":"9cedcbad-b5c4-4e9b-8b1f-7f14712dbb82","resolution":{"observed_at":"2026-08-06T20:58:33.273982Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:39.994610Z","title":"Neural voice puppetry: Audio-driven facial reenactment","venue":null,"work_id":"ff8e5c45-a88f-4ebf-b929-c013142a3680","year":2020},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-14T07:12:00.142810Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:28.914132Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:3c368ad83a78db90e9cfc5b4b19123419d5c2dfcafcdb3350ced6078f5eb079e","observation_id":"dbca7167-10d2-4387-bd09-2df7452ec0cd","resolution":{"observed_at":"2026-08-06T20:58:40.154927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17485","last_updated":"2024-08-08T03:48:38Z","snapshot_observed_at":"2026-08-20T08:43:15.720979Z","submitted_at":"2024-02-27T13:10:11Z","title":"EMO: Emote Portrait Alive -- Generating Expressive Portrait Videos with Audio2Video Diffusion Model under Weak Conditions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17485","snapshot_observed_at":"2026-08-06T20:58:29.031658Z","title":"Emo: Emote portrait alive-generating expressive portrait videos with audio2video diffusion model under weak conditions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-14T07:12:00.142810Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:29.031658Z"},"links":{"cited_paper":"/paper/2402.17485","citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:da525d0bc7b112e3c3c950a2ef58958d80a0128673e7e02fb93ee4a171a61731","observation_id":"befc3a51-deff-4126-a597-9c3651d1d961","resolution":{"observed_at":"2026-08-06T20:58:29.031658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:39.711743Z","title":"Musepose: a pose-driven image-to-video framework for virtual human generation","venue":null,"work_id":"a138a99e-992a-4584-b1b0-1ef315f6d506","year":2024},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-14T07:12:00.142810Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:29.114798Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:bb9ec4db10b0611457a8ef0d40fec431e79bfeaae6ed70dbf69a7be4ab78cb66","observation_id":"e66f2708-d428-452b-896a-08f7ebeccf12","resolution":{"observed_at":"2026-08-06T20:58:39.852794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:39.406483Z","title":"Nonlinear 3d face morphable model","venue":null,"work_id":"33f8bab0-b542-4f69-9926-d49cbb7464fc","year":2018},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-14T07:12:00.142810Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:29.194819Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:55b53e2b9a9d68d5498eccd60e52a77c4fc1fcf9db5f6bbf4bfa0547c17bf2d8","observation_id":"98d04961-ce78-42d9-b84f-7ae201428550","resolution":{"observed_at":"2026-08-06T20:58:39.600375Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02511","last_updated":"2024-06-04T17:32:52Z","snapshot_observed_at":"2026-08-19T07:28:01.288662Z","submitted_at":"2024-06-04T17:32:52Z","title":"V-Express: Conditional Dropout for Progressive Training of Portrait Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02511","snapshot_observed_at":"2026-08-06T20:58:29.324951Z","title":"V-express: Conditional dropout for progres- sive training of portrait video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-14T07:12:00.142810Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:29.324951Z"},"links":{"cited_paper":"/paper/2406.02511","citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:2c09873b3b89fd7805c7368425c35cb99683749a045be134db4bff4b937704c9","observation_id":"ee190d78-90bf-4f79-ad74-d0c88e692da8","resolution":{"observed_at":"2026-08-06T20:58:29.324951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:39.138768Z","title":"Progressive disentangled representation learning for fine-grained controllable talking head synthesis","venue":null,"work_id":"a48cd323-813b-4aa1-b436-5e36499dd825","year":2023},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-14T07:12:00.142810Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:29.435927Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:a6c97b208fcc3b6e12990882611ab07191ed81fc6513b015458d0bf3bbb9e83e","observation_id":"99ffb67b-0bda-43c0-9d6e-2bf9cf544c0b","resolution":{"observed_at":"2026-08-06T20:58:39.318871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:38.928686Z","title":"Seeing what you said: Talking face gen- eration guided by a lip reading expert","venue":null,"work_id":"e8b42bf3-79ce-4115-8794-67a079a05393","year":2023},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-14T07:12:00.142810Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:29.543486Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:a904fc27c1ae00d132fff39579ec8a00f0a00b758923cbf9a02a3554eb78ac51","observation_id":"1fbeee6a-3035-4a17-8af4-1c4f00409678","resolution":{"observed_at":"2026-08-06T20:58:39.034756Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:29.636580Z","title":"Lipformer: High- fidelity and generalizable talking face generation with a pre- learned facial codebook","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-14T07:12:00.142810Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:29.636580Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:f345c4df0ba20d3410e91e922299bde06cc662902163966d5c8abf4f5504dcf8","observation_id":"72634791-17c9-42a2-9019-621edc2e9e4a","resolution":{"observed_at":"2026-08-06T20:58:29.636580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:38.734080Z","title":"Mead: A large-scale audio-visual dataset for emo- tional talking-face generation","venue":null,"work_id":"928f5a7b-e387-4f64-9abe-90c334ce05a7","year":2020},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-14T07:12:00.142810Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:29.727310Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:da2289041e48b35c78ba45411db9ef9c8b4925121ac28eadce689cadd28ef6ab","observation_id":"0bc4fbf0-f1fc-477e-840d-fd165aedb2dd","resolution":{"observed_at":"2026-08-06T20:58:38.816675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:38.489972Z","title":"Audio2head: Audio-driven one-shot talking-head generation with natural head motion","venue":null,"work_id":"120987e6-3245-40fe-bc69-02cd2a063a12","year":2021},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-14T07:12:00.142810Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:29.805414Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:4606f8d5652447aa08cc677941cc9d160ed7b79cb447c5687476495d0ea4b97a","observation_id":"3ed927c6-e97b-4e08-a417-6a6429683fed","resolution":{"observed_at":"2026-08-06T20:58:38.598452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:38.233241Z","title":"Disco: Disentangled control for referring human dance generation in real world","venue":null,"work_id":"52022666-7215-4fba-adcf-529828cc6116","year":2024},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-14T07:12:00.142810Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:29.893763Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:e878248d4da44f76649caa003e95620ab7b5e2107f09601df5cbac96fcfaddc1","observation_id":"aea350c2-958e-4a8a-a74a-5b4f0822ec4c","resolution":{"observed_at":"2026-08-06T20:58:38.406625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01188","last_updated":"2024-06-03T10:51:10Z","snapshot_observed_at":"2026-08-18T22:36:33.661827Z","submitted_at":"2024-06-03T10:51:10Z","title":"UniAnimate: Taming Unified Video Diffusion Models for Consistent Human Image Animation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01188","snapshot_observed_at":"2026-08-06T20:58:29.969998Z","title":"Unianimate: Taming unified video diffusion mod- els for consistent human image animation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-14T07:12:00.142810Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:29.969998Z"},"links":{"cited_paper":"/paper/2406.01188","citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:dea828f16782be870051844831c958f7ade7f3a69634a4cd34fbeef77b5109ad","observation_id":"bab25467-5366-4cad-b580-e8b49db5d21d","resolution":{"observed_at":"2026-08-06T20:58:29.969998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:38.038096Z","title":"Latent image animator: Learning to animate im- ages via latent space navigation","venue":null,"work_id":"e89d7d9e-c6db-4b22-8bb0-d281bd672015","year":2021},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-14T07:12:00.142810Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:30.051799Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:f5d16c51faf156a5737bf1f75da5613b4c141a10cee919b94e1d265537cb23e4","observation_id":"f1f2911d-d7fd-45f2-aa6a-753bfd1a4426","resolution":{"observed_at":"2026-08-06T20:58:38.138612Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:37.833053Z","title":"Image quality assessment: from error visibility to structural similarity","venue":null,"work_id":"dd2080b6-9783-488d-b4f4-794512038ac0","year":2004},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-14T07:12:00.142810Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:30.141214Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:df282cf2f1edf5e39c62ac3d260e266b78f7b823f419070873562c198c8cd86b","observation_id":"d2d91d2a-a9aa-4d63-aa86-94125651dfc8","resolution":{"observed_at":"2026-08-06T20:58:37.928749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:37.599055Z","title":"Restoreformer: High-quality blind face restoration from undegraded key-value pairs","venue":null,"work_id":"64e515f6-d449-497e-90cb-281d8c81e110","year":2022},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-14T07:12:00.142810Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:30.228433Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:7d48478f2e5e657f3808f734ddcfa5bdd647f58f493a696058257929dd26afd0","observation_id":"534c2f23-5cda-436d-a0eb-70529f971d27","resolution":{"observed_at":"2026-08-06T20:58:37.684026Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17694","last_updated":"2024-03-26T13:35:02Z","snapshot_observed_at":"2026-08-18T10:29:36.587877Z","submitted_at":"2024-03-26T13:35:02Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17694","snapshot_observed_at":"2026-08-06T20:58:30.336835Z","title":"Aniportrait: Audio-driven synthesis of photorealistic portrait animation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-14T07:12:00.142810Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:30.336835Z"},"links":{"cited_paper":"/paper/2403.17694","citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:ddbf0089df5d0aead280315ac4153cba2fc381987cf13334313ca5eb12890b68","observation_id":"b3eff734-9988-4b39-90e7-632f17a4d897","resolution":{"observed_at":"2026-08-06T20:58:30.336835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:37.332175Z","title":"F 3a-gan: Facial flow for face animation with generative adversarial networks","venue":null,"work_id":"1b77a76c-9d57-42cb-a214-b0d994249b0e","year":null},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-14T07:12:00.142810Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:30.397592Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:535d8f05bd9e4e4ee967d684217f0a1b7ffc662b1256420b254b41b390bb6da3","observation_id":"5e8cc5b2-7334-4f99-86d0-90d1ae5c7bfd","resolution":{"observed_at":"2026-08-06T20:58:37.408365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:37.143876Z","title":"Vfhq: A high-quality dataset and bench- mark for video face super-resolution","venue":null,"work_id":"21991051-f18f-42e6-9852-2cb5ef4b6a99","year":2022},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-14T07:12:00.142810Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:30.500524Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:646c49384d55538be260811b3fd760d059c218825f5fa47d01b4c7077cd5ab82","observation_id":"1fe8539c-6dd0-497f-878e-44a5c2e4a2e4","resolution":{"observed_at":"2026-08-06T20:58:37.235525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:36.947672Z","title":"X-portrait: Expressive portrait anima- tion with hierarchical motion attention","venue":null,"work_id":"70048fff-a4f5-4b81-bef4-451901f6da3f","year":2024},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-14T07:12:00.142810Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:30.587424Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:7ed76c50b4fa3a20884043a4809e551cc3ad0161e99a38f7fbbf41466090d884","observation_id":"cb433dee-9d90-4745-9793-0096570269d7","resolution":{"observed_at":"2026-08-06T20:58:37.023590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08801","last_updated":"2024-06-16T07:10:41Z","snapshot_observed_at":"2026-08-18T10:23:27.377504Z","submitted_at":"2024-06-13T04:33:20Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08801","snapshot_observed_at":"2026-08-06T20:58:30.681138Z","title":"Hallo: Hierarchical audio-driven vi- sual synthesis for portrait image animation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-14T07:12:00.142810Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:30.681138Z"},"links":{"cited_paper":"/paper/2406.08801","citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:d34ce5939c99d0ba4199f64eca3d28f47eff71a75a8b04578f930dea2c840f67","observation_id":"7ee5b291-450d-4725-a774-594001b100eb","resolution":{"observed_at":"2026-08-06T20:58:30.681138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10667","last_updated":"2024-10-31T07:43:14Z","snapshot_observed_at":"2026-08-16T14:00:25.942097Z","submitted_at":"2024-04-16T15:43:22Z","title":"VASA-1: Lifelike Audio-Driven Talking Faces Generated in Real Time","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.10667","snapshot_observed_at":"2026-08-06T20:58:30.797463Z","title":"Vasa-1: Lifelike audio-driven talking faces generated in real time","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-14T07:12:00.142810Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:30.797463Z"},"links":{"cited_paper":"/paper/2404.10667","citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:f06d7871af42d942276ecc9c9ab0d22e35624060298c13d82a3c0a9c844887e3","observation_id":"bd6d5c86-2636-4b16-af03-b15bd429c157","resolution":{"observed_at":"2026-08-06T20:58:30.797463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16498","last_updated":"2023-11-27T18:32:31Z","snapshot_observed_at":"2026-08-19T11:17:23.556847Z","submitted_at":"2023-11-27T18:32:31Z","title":"MagicAnimate: Temporally Consistent Human Image Animation using Diffusion Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16498","snapshot_observed_at":"2026-08-06T20:58:30.864897Z","title":"Magicanimate: Temporally consistent human im- age animation using diffusion model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-14T07:12:00.142810Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:30.864897Z"},"links":{"cited_paper":"/paper/2311.16498","citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:ca16e44547d33f6bea6ee506aceddd9196fcb3dae3579bc969a55d44c991052c","observation_id":"f358ffa3-3f07-4dfb-8b15-1b8a457cd832","resolution":{"observed_at":"2026-08-06T20:58:30.864897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16216","last_updated":"2024-11-25T09:25:53Z","snapshot_observed_at":"2026-08-19T09:05:14.475283Z","submitted_at":"2024-11-25T09:25:53Z","title":"SMGDiff: Soccer Motion Generation using diffusion probabilistic models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.16216","snapshot_observed_at":"2026-08-06T20:58:30.937663Z","title":"Smgdiff: Soccer motion generation using diffusion probabilistic mod- els","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-14T07:12:00.142810Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:30.937663Z"},"links":{"cited_paper":"/paper/2411.16216","citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:f96a23c399cd30f74754e9b1bd3e95b152ff7071bc6882a024aa693a31043fb3","observation_id":"c888266b-5d39-424b-896a-7a7db9673c9f","resolution":{"observed_at":"2026-08-06T20:58:30.937663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:36.759496Z","title":"Face2face ρ: Real- time high-resolution one-shot face reenactment","venue":null,"work_id":"2b764471-8f0d-45a3-beef-783e7970e82e","year":2022},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-14T07:12:00.142810Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:30.986982Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:2a70c83215f7919b3573faf16d742f8c8e08d55c2523fefa2846b5b6f26390e7","observation_id":"041d4b38-36c0-4eb5-8e61-a2cfbd792a98","resolution":{"observed_at":"2026-08-06T20:58:36.844445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20851","last_updated":"2024-06-18T05:36:11Z","snapshot_observed_at":"2026-08-17T16:32:33.677492Z","submitted_at":"2024-05-31T14:33:13Z","title":"MegActor: Harness the Power of Raw Video for Vivid Portrait Animation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20851","snapshot_observed_at":"2026-08-06T20:58:31.076359Z","title":"Megactor: Harness the power of raw video for vivid portrait animation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-14T07:12:00.142810Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:31.076359Z"},"links":{"cited_paper":"/paper/2405.20851","citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:05b69e699c9c454e5f552809ba4e6bb40c0599955074e85fc033658d293d45e4","observation_id":"734c68aa-587f-4c4e-bccf-543d181d8d9d","resolution":{"observed_at":"2026-08-06T20:58:31.076359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.01051","last_updated":"2021-10-15T22:04:39Z","snapshot_observed_at":"2026-08-16T18:27:20.253405Z","submitted_at":"2021-05-03T17:51:09Z","title":"SUPERB: Speech processing Universal PERformance Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.01051","snapshot_observed_at":"2026-08-06T20:58:31.169287Z","title":"Superb: Speech processing universal performance benchmark.arXiv preprint arXiv:2105.01051, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-14T07:12:00.142810Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:31.169287Z"},"links":{"cited_paper":"/paper/2105.01051","citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:30a0d5da3c9449f03d9b6a0d176a637eed3fa7d0964b97aedd5593e4f3b696be","observation_id":"f4a97ade-ec12-49e6-9a14-2af222fe9663","resolution":{"observed_at":"2026-08-06T20:58:31.169287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:36.489216Z","title":"Mesh guided one-shot face reenactment using graph convo- lutional networks","venue":null,"work_id":"874e540b-a287-410b-97bb-305c981bbd17","year":2020},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-14T07:12:00.142810Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:31.258555Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:6af006bc2ef086f550af0838094a0f268fdb871fdfffcd0df62514c28c012624","observation_id":"97a29b95-7c82-4e85-89e8-27cabbab07b9","resolution":{"observed_at":"2026-08-06T20:58:36.622982Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:36.280392Z","title":"Few-shot adversarial learning of realistic neural talking head models","venue":null,"work_id":"aecca9f4-4dbb-48c7-b4f3-e66e03d06f8e","year":2019},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-14T07:12:00.142810Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:31.345409Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:1642aa7370e423cc652b7165c69cea3cd5e88a2df167f7c9a6fdcbbbbbdf5923","observation_id":"37c67c33-680e-4964-81aa-b5805b6574a1","resolution":{"observed_at":"2026-08-06T20:58:36.392325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:36.093538Z","title":"Metaportrait: Identity-preserving talking head gener- ation with fast personalized adaptation","venue":null,"work_id":"77577243-87ca-4951-8bdb-03e2d1f4d4a2","year":2023},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-14T07:12:00.142810Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:31.484833Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:ba3410dd6385a16abb7e7ac022b6c200ec07293c0ea04036fd448353272e9b04","observation_id":"edf1eeea-1cc9-45bf-ab9c-3cbf164a06af","resolution":{"observed_at":"2026-08-06T20:58:36.149735Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:31.622546Z","title":"The unreasonable effectiveness of deep features as a perceptual metric","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-14T07:12:00.142810Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:31.622546Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:e044b15aebb92c0e51547deb4366e06f44fdae6feb0d12c990a35300471ccfff","observation_id":"c9d21c2c-a648-4d50-a1e3-2baaddcab1f5","resolution":{"observed_at":"2026-08-06T20:58:31.622546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:35.873368Z","title":"Sadtalker: Learning realistic 3d motion coefficients for stylized audio- driven single image talking face animation","venue":null,"work_id":"ffb5c883-63f3-4576-b375-2cc054fb3fd7","year":2023},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-14T07:12:00.142810Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:31.714314Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:0fd343bd24fbc5602c03e409e2e8f238592bcab0e584c47e56e5db678560d08b","observation_id":"23998122-e4a8-459c-9bd5-0cb71faf8c0b","resolution":{"observed_at":"2026-08-06T20:58:35.941143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19680","last_updated":"2025-06-27T10:06:13Z","snapshot_observed_at":"2026-08-16T13:38:51.127960Z","submitted_at":"2024-06-28T06:40:53Z","title":"MimicMotion: High-Quality Human Motion Video Generation with Confidence-aware Pose Guidance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19680","snapshot_observed_at":"2026-08-06T20:58:31.799959Z","title":"Mim- icmotion: High-quality human motion video generation with confidence-aware pose guidance","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-14T07:12:00.142810Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:31.799959Z"},"links":{"cited_paper":"/paper/2406.19680","citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:3a96155aa238293c946457cab0d58971c07c22001bb52c761c5fb9102efddb3b","observation_id":"b74cd972-0564-48eb-9b7e-586f0ba90e56","resolution":{"observed_at":"2026-08-06T20:58:31.799959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:35.658743Z","title":"Flow-guided one-shot talking face generation with a high-resolution audio-visual dataset","venue":null,"work_id":"f3c74f8d-f827-461b-b248-716aae7f74c7","year":2021},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-14T07:12:00.142810Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:31.955970Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:f538ff96f86a8e482fa05ca4bea0b9efb5359b6c53f8a8616033f87857f459fb","observation_id":"0a96a28b-9d1f-46aa-9e78-fca47e338a99","resolution":{"observed_at":"2026-08-06T20:58:35.781103Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:35.461823Z","title":"Thin-plate spline motion model for image animation","venue":null,"work_id":"be774fda-1cb1-46a0-9662-044f37cb43b9","year":2022},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-14T07:12:00.142810Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:32.047722Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:a9abdab89a326aa3c3e2eaffcdc8ce42e718b8d5820a6697a6ed10eefcf864f3","observation_id":"ae71de02-63db-4621-828b-e57a83df5ead","resolution":{"observed_at":"2026-08-06T20:58:35.564029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:35.236725Z","title":"Media2face: Co-speech facial animation gen- eration with multi-modality guidance","venue":null,"work_id":"d2ca108d-ace5-4107-8d21-361871f4c856","year":2024},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-14T07:12:00.142810Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:32.154806Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:39ac78a8e44ad5eeaefd8ded6f633ce0f7d7d514fd9efeaf217cbaa9a281b6ec","observation_id":"248fe8b6-4486-4b99-b8a6-eebe0ce884ef","resolution":{"observed_at":"2026-08-06T20:58:35.326278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:35.026589Z","title":"Sparse to dense motion transfer for face image animation","venue":null,"work_id":"1177f48e-8207-4714-b865-c340a22bd9e0","year":1991},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-14T07:12:00.142810Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:32.254370Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:9e8788ed46e5e25859e4eb0033b69f19dbb803a05a8bde746003ea7f202f3f48","observation_id":"e2e0994e-c849-4a23-8191-a65b98914173","resolution":{"observed_at":"2026-08-06T20:58:35.136674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:34.792010Z","title":"Identity- preserving talking face generation with landmark and ap- pearance priors","venue":null,"work_id":"12162123-1dcf-4d6a-80d5-90e38aed2652","year":2023},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-14T07:12:00.142810Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:32.378472Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:702f5fb6784449de95596efb4fa34fed273d85cd351d36f1999a31a69a9344d3","observation_id":"24b38b98-b672-4f55-8dc5-ff3dc8e3f219","resolution":{"observed_at":"2026-08-06T20:58:34.913685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:34.583155Z","title":"Talking face generation by adversarially disentangled audio-visual representation","venue":null,"work_id":"1d428b3c-c0c1-4402-86fa-d54723b8f5c3","year":2019},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-14T07:12:00.142810Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:32.469746Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:eb774d3dc5b2c8e56d140cd5a3d5f168e9ca389cf1dadbe7cce7454b5f0f0ada","observation_id":"86d62245-8607-43dd-98f6-9a6d06df0322","resolution":{"observed_at":"2026-08-06T20:58:34.662889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:34.413669Z","title":"Makelttalk: speaker-aware talking-head animation","venue":null,"work_id":"064bd32f-ad30-4f39-a829-f2ca78108fc7","year":2020},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-14T07:12:00.142810Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:32.571705Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:1dddfdd87659bdd267bd15f4ce054bc784ba444e86049718b71d5c0f7e258cfa","observation_id":"65decd62-8445-40e4-8255-57cb9076e37d","resolution":{"observed_at":"2026-08-06T20:58:34.488488Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:32.668949Z","title":"Champ: Controllable and consistent human image animation with 3d parametric guidance","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-14T07:12:00.142810Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:32.668949Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:57c87ecc705eaaf55c2593210d1b4b4292fc261e2c311273dcc5d95a0d16acb3","observation_id":"da599dc7-6007-4580-9dc4-642d3dbee57a","resolution":{"observed_at":"2026-08-06T20:58:32.668949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:34.232175Z","title":"Face alignment in full pose range: A 3d total solution.IEEE trans- actions on pattern analysis and machine intelligence, 41(1): 78–92, 2017","venue":null,"work_id":"e29be6c7-2141-4d32-b35a-1da075c89d81","year":2017},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-14T07:12:00.142810Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:32.804437Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:d984d3dd2da4efd7fbc0bfa0b95e258bb301d24a5c1dccc721ec2a41bb19b45b","observation_id":"492f786e-81f3-44a5-afbd-1a0c0165079b","resolution":{"observed_at":"2026-08-06T20:58:34.307232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:40.216069Z","title":null,"venue":null,"work_id":"ab3c66d3-db78-4fa5-b157-33836b91c8ad","year":2025},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-14T07:12:00.142810Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":416,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:28.665882Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:c972d46748818669a51721ab98915719fb023b900913643fad5787edc11162de","observation_id":"5b9376e4-dd8a-4112-9744-5df75b1e02ee","resolution":{"observed_at":"2026-08-06T20:58:40.322472Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T07:12:00.142810Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":54,"verified_exact":3,"verified_fuzzy":42},"total_outbound_references":100},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 100 of 100 outbound references and 3 inbound Pith citation observations for arXiv:2507.01390."}