{"as_of":"2026-08-09T17:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:74108c854ec5ec352eaf84ca7ceeb21b8491632d4475930df805de05774a7ebe","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":62,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":62,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":62,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":62,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T16:47:13.080504Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T22:06:16.996788Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.08801","last_updated":"2024-06-16T07:10:41Z","snapshot_observed_at":"2026-07-06T18:30:06.570612Z","submitted_at":"2024-06-13T04:33:20Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","version":2},"cited_work":{"arxiv_id":"2406.08801","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.08801","snapshot_observed_at":"2026-07-01T22:06:16.996788Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","venue":null,"work_id":"c9aa1ca0-1c1b-4f82-99c8-f3bfda2b1e83","year":2024},"citing_paper":{"arxiv_id":"2411.16748","last_updated":"2026-05-08T09:16:59Z","snapshot_observed_at":"2026-08-04T02:06:42.093429Z","submitted_at":"2024-11-24T04:46:00Z","title":"Multimodal Diffusion Transformer with Memory Bank for Scalable Long-Duration Talking Video Generation","version":5},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-23T17:19:51.411937Z"},"links":{"cited_paper":"/paper/2406.08801","citing_paper":"/paper/2411.16748"},"observation_digest":"sha256:6a521ee0a1eb16eb2573187e3387d544ba081325e7c9918f0fade8ce34b02333","observation_id":"454d8982-09dc-40b5-b107-adef64a65c38","resolution":{"observed_at":"2026-05-23T17:23:15.339474Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08801","last_updated":"2024-06-16T07:10:41Z","snapshot_observed_at":"2026-07-06T18:30:06.570612Z","submitted_at":"2024-06-13T04:33:20Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08801","snapshot_observed_at":"2026-08-09T16:47:13.080504Z","title":"Hallo: Hierarchical audio-driven vi- sual synthesis for portrait image animation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01061","last_updated":"2025-06-30T08:26:56Z","snapshot_observed_at":"2026-08-09T16:40:37.792241Z","submitted_at":"2025-02-03T05:17:32Z","title":"OmniHuman-1: Rethinking the Scaling-Up of One-Stage Conditioned Human Animation Models","version":3},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-09T16:47:13.080504Z"},"links":{"cited_paper":"/paper/2406.08801","citing_paper":"/paper/2502.01061"},"observation_digest":"sha256:35242d5e7c91fd43d321fa45fc0c1e09fd6ac8667c473cf28ceff5ce64e26ebe","observation_id":"2b008c4d-920c-402d-aa35-c59f0be735f4","resolution":{"observed_at":"2026-08-09T16:47:13.080504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08801","last_updated":"2024-06-16T07:10:41Z","snapshot_observed_at":"2026-07-06T18:30:06.570612Z","submitted_at":"2024-06-13T04:33:20Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08801","snapshot_observed_at":"2026-08-07T21:11:25.346813Z","title":"Hallo: Hierarchical audio-driven visual synthesis for portrait image animation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09533","last_updated":"2025-02-13T17:50:23Z","snapshot_observed_at":"2026-08-07T22:10:29.240376Z","submitted_at":"2025-02-13T17:50:23Z","title":"Long-Term TalkingFace Generation via Motion-Prior Conditional Diffusion Model","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T21:11:25.346813Z"},"links":{"cited_paper":"/paper/2406.08801","citing_paper":"/paper/2502.09533"},"observation_digest":"sha256:c117251b8417faddfc020bf71a94aa4e205349ae4b4da060d8bbdc0618b965f3","observation_id":"782611a5-f612-4cd7-9bab-0569d37f67e8","resolution":{"observed_at":"2026-08-07T21:11:25.346813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08801","last_updated":"2024-06-16T07:10:41Z","snapshot_observed_at":"2026-07-06T18:30:06.570612Z","submitted_at":"2024-06-13T04:33:20Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08801","snapshot_observed_at":"2026-08-07T14:02:30.045227Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20156","last_updated":"2025-06-03T15:15:31Z","snapshot_observed_at":"2026-08-07T13:55:40.621856Z","submitted_at":"2025-05-26T15:57:27Z","title":"HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:30.045227Z"},"links":{"cited_paper":"/paper/2406.08801","citing_paper":"/paper/2505.20156"},"observation_digest":"sha256:87e164e2a878fddb34e930d9a83d17beddfc862900c1dfb785839c89cf5b2a22","observation_id":"0bc3d107-8172-44b4-a7e9-6efaf9a46f08","resolution":{"observed_at":"2026-08-07T14:02:30.045227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08801","last_updated":"2024-06-16T07:10:41Z","snapshot_observed_at":"2026-07-06T18:30:06.570612Z","submitted_at":"2024-06-13T04:33:20Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08801","snapshot_observed_at":"2026-08-07T13:49:53.135171Z","title":"Hallo: Hierarchical audio-driven vi- sual synthesis for portrait image animation.arXiv preprint arXiv:2406.08801, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20861","last_updated":"2025-05-27T08:13:38Z","snapshot_observed_at":"2026-08-08T21:09:14.127086Z","submitted_at":"2025-05-27T08:13:38Z","title":"Exploring Timeline Control for Facial Motion Generation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T13:49:53.135171Z"},"links":{"cited_paper":"/paper/2406.08801","citing_paper":"/paper/2505.20861"},"observation_digest":"sha256:49d6e152f9f862612a41848ad8d580fd5570468505be8fdf7718c1cf397bcd6d","observation_id":"2bc0af3b-65de-4f02-bee0-74fa0848f548","resolution":{"observed_at":"2026-08-07T13:49:53.135171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08801","last_updated":"2024-06-16T07:10:41Z","snapshot_observed_at":"2026-07-06T18:30:06.570612Z","submitted_at":"2024-06-13T04:33:20Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08801","snapshot_observed_at":"2026-08-07T13:21:47.698228Z","title":"Hallo: Hierarchical audio-driven visual synthesis for portrait image animation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22141","last_updated":"2025-08-27T16:33:34Z","snapshot_observed_at":"2026-08-07T20:49:32.346427Z","submitted_at":"2025-05-28T09:04:00Z","title":"FaceEditTalker: Controllable Talking Head Generation with Facial Attribute Editing","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:47.698228Z"},"links":{"cited_paper":"/paper/2406.08801","citing_paper":"/paper/2505.22141"},"observation_digest":"sha256:40a781689bea2c239dceaf97d37a9b3bfe10d31ffe34b03db4315f34874a8451","observation_id":"bda4b030-9459-4d3e-a797-136c19c67721","resolution":{"observed_at":"2026-08-07T13:21:47.698228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08801","last_updated":"2024-06-16T07:10:41Z","snapshot_observed_at":"2026-07-06T18:30:06.570612Z","submitted_at":"2024-06-13T04:33:20Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08801","snapshot_observed_at":"2026-08-07T13:07:31.440529Z","title":"Hallo: Hierarchical audio-driven visual synthesis for portrait image animation.arXiv preprint arXiv:2406.08801, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22647","last_updated":"2025-05-28T17:57:06Z","snapshot_observed_at":"2026-08-07T20:49:17.257002Z","submitted_at":"2025-05-28T17:57:06Z","title":"Let Them Talk: Audio-Driven Multi-Person Conversational Video Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:07:31.440529Z"},"links":{"cited_paper":"/paper/2406.08801","citing_paper":"/paper/2505.22647"},"observation_digest":"sha256:da5bfd5017bc0833f59b5dde70ec54fdb323394966112ca81d705e571f5f21f0","observation_id":"7ab23656-362f-4d99-bfd5-0ca9b01b2dd1","resolution":{"observed_at":"2026-08-07T13:07:31.440529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08801","last_updated":"2024-06-16T07:10:41Z","snapshot_observed_at":"2026-07-06T18:30:06.570612Z","submitted_at":"2024-06-13T04:33:20Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08801","snapshot_observed_at":"2026-08-07T11:44:16.996589Z","title":"Hallo: Hierarchical audio-driven vi- sual synthesis for portrait image animation.arXiv preprint arXiv:2406.08801, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01591","last_updated":"2025-06-02T12:26:46Z","snapshot_observed_at":"2026-08-08T09:22:03.343433Z","submitted_at":"2025-06-02T12:26:46Z","title":"Silence is Golden: Leveraging Adversarial Examples to Nullify Audio Control in LDM-based Talking-Head Generation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:16.996589Z"},"links":{"cited_paper":"/paper/2406.08801","citing_paper":"/paper/2506.01591"},"observation_digest":"sha256:af05c3dc424ad2be4bca952c7f2ab29a149272586434797f5c66517c8a34e490","observation_id":"68bc8d76-28d7-45f1-b939-899835f93638","resolution":{"observed_at":"2026-08-07T11:44:16.996589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08801","last_updated":"2024-06-16T07:10:41Z","snapshot_observed_at":"2026-07-06T18:30:06.570612Z","submitted_at":"2024-06-13T04:33:20Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08801","snapshot_observed_at":"2026-08-07T13:17:51.804052Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05368","last_updated":"2025-05-28T09:13:41Z","snapshot_observed_at":"2026-08-07T20:52:22.030249Z","submitted_at":"2025-05-28T09:13:41Z","title":"Speaking images. A novel framework for the automated self-description of artworks","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T13:17:51.804052Z"},"links":{"cited_paper":"/paper/2406.08801","citing_paper":"/paper/2506.05368"},"observation_digest":"sha256:73bc574200df803282a69d4d0bf0641ed4287f4c806529411a1dc76a281338ee","observation_id":"aabd3e5e-2151-4911-ae38-133b9270bda3","resolution":{"observed_at":"2026-08-07T13:17:51.804052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08801","last_updated":"2024-06-16T07:10:41Z","snapshot_observed_at":"2026-07-06T18:30:06.570612Z","submitted_at":"2024-06-13T04:33:20Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08801","snapshot_observed_at":"2026-08-07T10:18:24.119456Z","title":"Hallo: Hierarchical audio-driven visual synthesis for portrait image animation.arXiv preprint arXiv:2406.08801, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05806","last_updated":"2025-06-06T07:09:07Z","snapshot_observed_at":"2026-08-07T20:50:54.524255Z","submitted_at":"2025-06-06T07:09:07Z","title":"LLIA -- Enabling Low-Latency Interactive Avatars: Real-Time Audio-Driven Portrait Video Generation with Diffusion Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:24.119456Z"},"links":{"cited_paper":"/paper/2406.08801","citing_paper":"/paper/2506.05806"},"observation_digest":"sha256:38d5ad395b16d43e8f69333f37c583703c609513316137c56d6f4295f027f9f2","observation_id":"ddb92de9-fd10-43c3-beb7-8a690711cdf2","resolution":{"observed_at":"2026-08-07T10:18:24.119456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08801","last_updated":"2024-06-16T07:10:41Z","snapshot_observed_at":"2026-07-06T18:30:06.570612Z","submitted_at":"2024-06-13T04:33:20Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08801","snapshot_observed_at":"2026-08-07T00:15:44.531892Z","title":"Hallo: Hierarchical audio-driven visual synthesis for portrait image animation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14742","last_updated":"2025-06-17T17:22:12Z","snapshot_observed_at":"2026-08-07T20:51:47.320894Z","submitted_at":"2025-06-17T17:22:12Z","title":"SyncTalk++: High-Fidelity and Efficient Synchronized Talking Heads Synthesis Using Gaussian Splatting","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:44.531892Z"},"links":{"cited_paper":"/paper/2406.08801","citing_paper":"/paper/2506.14742"},"observation_digest":"sha256:9059f7c5718b3904011fc8b8d3addd447e6b3d6bc64db949aedf86081c490d07","observation_id":"3bb33f79-b67e-4935-a2f6-dd17e8501b7c","resolution":{"observed_at":"2026-08-07T00:15:44.531892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08801","last_updated":"2024-06-16T07:10:41Z","snapshot_observed_at":"2026-07-06T18:30:06.570612Z","submitted_at":"2024-06-13T04:33:20Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08801","snapshot_observed_at":"2026-08-06T22:28:22.248495Z","title":"Hallo: Hierarchical audio-driven vi- sual synthesis for portrait image animation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21513","last_updated":"2025-07-10T06:36:05Z","snapshot_observed_at":"2026-08-07T20:50:14.621861Z","submitted_at":"2025-06-26T17:37:18Z","title":"GGTalker: Talking Head Systhesis with Generalizable Gaussian Priors and Identity-Specific Adaptation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:22.248495Z"},"links":{"cited_paper":"/paper/2406.08801","citing_paper":"/paper/2506.21513"},"observation_digest":"sha256:1f06e367e8953833ca4859907ac3e3bc210972b8bbcb9530586b679a7a3d0f54","observation_id":"c3770234-4008-42b3-8d16-364b7c7e8b9f","resolution":{"observed_at":"2026-08-06T22:28:22.248495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08801","last_updated":"2024-06-16T07:10:41Z","snapshot_observed_at":"2026-07-06T18:30:06.570612Z","submitted_at":"2024-06-13T04:33:20Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08801","snapshot_observed_at":"2026-08-06T22:15:10.341196Z","title":"Hallo: Hierarchical audio-driven visual synthesis for portrait image animation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22065","last_updated":"2025-06-27T09:57:23Z","snapshot_observed_at":"2026-08-08T07:14:46.514760Z","submitted_at":"2025-06-27T09:57:23Z","title":"MirrorMe: Towards Realtime and High Fidelity Audio-Driven Halfbody Animation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:10.341196Z"},"links":{"cited_paper":"/paper/2406.08801","citing_paper":"/paper/2506.22065"},"observation_digest":"sha256:69ee7c203285dabe09db523946e8a614db088fe6bd3f43b986421ef36a7b8296","observation_id":"e33b25f5-35a6-477b-9fe0-d98e240dc3eb","resolution":{"observed_at":"2026-08-06T22:15:10.341196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08801","last_updated":"2024-06-16T07:10:41Z","snapshot_observed_at":"2026-07-06T18:30:06.570612Z","submitted_at":"2024-06-13T04:33:20Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","version":2},"cited_work":{"arxiv_id":"2406.08801","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.08801","snapshot_observed_at":"2026-07-01T22:06:16.996788Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","venue":null,"work_id":"c9aa1ca0-1c1b-4f82-99c8-f3bfda2b1e83","year":2024},"citing_paper":{"arxiv_id":"2506.23552","last_updated":"2026-05-15T04:47:28Z","snapshot_observed_at":"2026-07-06T21:49:33.849898Z","submitted_at":"2025-06-30T06:51:40Z","title":"JAM-Flow: Joint Audio-Motion Synthesis with Flow Matching","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-22T00:46:39.196042Z"},"links":{"cited_paper":"/paper/2406.08801","citing_paper":"/paper/2506.23552"},"observation_digest":"sha256:a717657945a4b81314cad43d11eec884e14b2f8fa41f6a4a0da119b057285e3f","observation_id":"c1f186e3-bbdf-4141-bd1b-e49110f87c7b","resolution":{"observed_at":"2026-05-22T00:50:51.078255Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08801","last_updated":"2024-06-16T07:10:41Z","snapshot_observed_at":"2026-07-06T18:30:06.570612Z","submitted_at":"2024-06-13T04:33:20Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08801","snapshot_observed_at":"2026-08-06T21:19:15.990935Z","title":"Hallo: Hierarchical audio-driven visual synthesis for portrait image animation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00472","last_updated":"2025-07-01T06:38:14Z","snapshot_observed_at":"2026-08-08T19:34:33.797020Z","submitted_at":"2025-07-01T06:38:14Z","title":"ARIG: Autoregressive Interactive Head Generation for Real-time Conversations","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:15.990935Z"},"links":{"cited_paper":"/paper/2406.08801","citing_paper":"/paper/2507.00472"},"observation_digest":"sha256:bfb2545e98b43117699ba7525f8b8d6c87c7457e38f98b2d0f4506e9851f3983","observation_id":"2352e022-fa20-4464-95aa-1a22924a12d1","resolution":{"observed_at":"2026-08-06T21:19:15.990935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08801","last_updated":"2024-06-16T07:10:41Z","snapshot_observed_at":"2026-07-06T18:30:06.570612Z","submitted_at":"2024-06-13T04:33:20Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08801","snapshot_observed_at":"2026-08-06T20:58:30.681138Z","title":"Hallo: Hierarchical audio-driven vi- sual synthesis for portrait image animation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-07T20:49:14.374372Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:30.681138Z"},"links":{"cited_paper":"/paper/2406.08801","citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:91b6da7cac18b891bf06f1f7f37fa26b5e65464184d0b3276f5dfe3e1c2b242c","observation_id":"7ee5b291-450d-4725-a774-594001b100eb","resolution":{"observed_at":"2026-08-06T20:58:30.681138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08801","last_updated":"2024-06-16T07:10:41Z","snapshot_observed_at":"2026-07-06T18:30:06.570612Z","submitted_at":"2024-06-13T04:33:20Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08801","snapshot_observed_at":"2026-08-06T20:23:39.562824Z","title":"Hallo: Hierarchical audio-driven visual synthesis for portrait image animation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03256","last_updated":"2025-08-08T12:58:08Z","snapshot_observed_at":"2026-08-08T02:15:29.534181Z","submitted_at":"2025-07-04T02:25:10Z","title":"MoDA: Multi-modal Diffusion Architecture for Talking Head Generation","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T20:23:39.562824Z"},"links":{"cited_paper":"/paper/2406.08801","citing_paper":"/paper/2507.03256"},"observation_digest":"sha256:70bdc7a411252680400ffe832e1549b105b84ade22f6f8a0bb451ce30bd9be09","observation_id":"8748f2a9-ef36-44b3-aa33-9157174c1930","resolution":{"observed_at":"2026-08-06T20:23:39.562824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08801","last_updated":"2024-06-16T07:10:41Z","snapshot_observed_at":"2026-07-06T18:30:06.570612Z","submitted_at":"2024-06-13T04:33:20Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08801","snapshot_observed_at":"2026-08-06T19:38:20.565284Z","title":"Hallo: Hierarchical audio-driven visual synthesis for portrait image animation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-08T14:17:46.996950Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.565284Z"},"links":{"cited_paper":"/paper/2406.08801","citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:be44e9403e5221fb0e1ef9413fdd528222a6d820c1a851d6e38bc696d578219b","observation_id":"4f8d4c40-5d73-4182-855e-64329f5e6bcd","resolution":{"observed_at":"2026-08-06T19:38:20.565284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08801","last_updated":"2024-06-16T07:10:41Z","snapshot_observed_at":"2026-07-06T18:30:06.570612Z","submitted_at":"2024-06-13T04:33:20Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08801","snapshot_observed_at":"2026-08-06T16:42:42.932426Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12761","last_updated":"2025-07-17T03:33:46Z","snapshot_observed_at":"2026-08-07T20:51:13.041685Z","submitted_at":"2025-07-17T03:33:46Z","title":"Think-Before-Draw: Decomposing Emotion Semantics & Fine-Grained Controllable Expressive Talking Head Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T16:42:42.932426Z"},"links":{"cited_paper":"/paper/2406.08801","citing_paper":"/paper/2507.12761"},"observation_digest":"sha256:7d80717a5c44099be67871f8bb57a32a141b8c477c6c66471600a6ab94340b30","observation_id":"9d2589d2-9f06-4d19-9e32-6192e00b73a8","resolution":{"observed_at":"2026-08-06T16:42:42.932426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08801","last_updated":"2024-06-16T07:10:41Z","snapshot_observed_at":"2026-07-06T18:30:06.570612Z","submitted_at":"2024-06-13T04:33:20Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08801","snapshot_observed_at":"2026-08-06T13:37:09.440363Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20368","last_updated":"2025-07-27T17:53:00Z","snapshot_observed_at":"2026-08-07T20:50:14.751272Z","submitted_at":"2025-07-27T17:53:00Z","title":"MagicAnime: A Hierarchically Annotated, Multimodal and Multitasking Dataset with Benchmarks for Cartoon Animation Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T13:37:09.440363Z"},"links":{"cited_paper":"/paper/2406.08801","citing_paper":"/paper/2507.20368"},"observation_digest":"sha256:2f3e6db8dc060ded29e864762c647007a6d46db10a7e41c10970f4c81b54d392","observation_id":"bd06b022-ed52-47f7-8dd7-2b69bb19bac8","resolution":{"observed_at":"2026-08-06T13:37:09.440363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08801","last_updated":"2024-06-16T07:10:41Z","snapshot_observed_at":"2026-07-06T18:30:06.570612Z","submitted_at":"2024-06-13T04:33:20Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08801","snapshot_observed_at":"2026-08-06T13:39:34.642522Z","title":"Hallo: Hierarchical audio-driven visual synthesis for portrait image animation.arXiv preprint arXiv:2406.08801, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-09T02:32:25.994375Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:34.642522Z"},"links":{"cited_paper":"/paper/2406.08801","citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:2bedf09084e5e0410cea935936ae42e643eeff7a469856c922549282ab63ca25","observation_id":"776c542c-0ebf-4ce1-8283-319b259dc0f0","resolution":{"observed_at":"2026-08-06T13:39:34.642522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08801","last_updated":"2024-06-16T07:10:41Z","snapshot_observed_at":"2026-07-06T18:30:06.570612Z","submitted_at":"2024-06-13T04:33:20Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08801","snapshot_observed_at":"2026-08-06T11:03:44.888102Z","title":"Facechain-imagineid: Freely crafting high-fidelity diverse talking faces from disentangled audio","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.23143","last_updated":"2025-07-30T22:46:52Z","snapshot_observed_at":"2026-08-07T20:50:58.945663Z","submitted_at":"2025-07-30T22:46:52Z","title":"X-NeMo: Expressive Neural Motion Reenactment via Disentangled Latent Attention","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T11:03:44.888102Z"},"links":{"cited_paper":"/paper/2406.08801","citing_paper":"/paper/2507.23143"},"observation_digest":"sha256:2c7297b2d6dbb7fe3b38c88c01eec5cdac20310dedb92b5ae2157540348eee49","observation_id":"f42f9ad9-2c8b-4f31-b1c6-2c9b39b12e6c","resolution":{"observed_at":"2026-08-06T11:03:44.888102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08801","last_updated":"2024-06-16T07:10:41Z","snapshot_observed_at":"2026-07-06T18:30:06.570612Z","submitted_at":"2024-06-13T04:33:20Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08801","snapshot_observed_at":"2026-08-06T05:05:49.218801Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.02362","last_updated":"2025-08-04T12:50:22Z","snapshot_observed_at":"2026-08-07T08:30:16.261665Z","submitted_at":"2025-08-04T12:50:22Z","title":"Text2Lip: Progressive Lip-Synced Talking Face Generation from Text via Viseme-Guided Rendering","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T05:05:49.218801Z"},"links":{"cited_paper":"/paper/2406.08801","citing_paper":"/paper/2508.02362"},"observation_digest":"sha256:c5ea4e244af9ce00b07801843cb165621e1adead2f718de37141b400de5d03a0","observation_id":"0c392671-72de-46ef-b7e9-d6338604c9e0","resolution":{"observed_at":"2026-08-06T05:05:49.218801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08801","last_updated":"2024-06-16T07:10:41Z","snapshot_observed_at":"2026-07-06T18:30:06.570612Z","submitted_at":"2024-06-13T04:33:20Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08801","snapshot_observed_at":"2026-08-06T12:43:23.782760Z","title":"Hallo: Hierarchical audio-driven visual synthesis for portrait image animation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:23.782760Z"},"links":{"cited_paper":"/paper/2406.08801","citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:dbfa4ff351dc9bb5b23ab55be89e977277b06be9d57ea024db14f64e5ac745cc","observation_id":"9da71d78-ef20-4e73-bb0d-8d84202ec70f","resolution":{"observed_at":"2026-08-06T12:43:23.782760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08801","last_updated":"2024-06-16T07:10:41Z","snapshot_observed_at":"2026-07-06T18:30:06.570612Z","submitted_at":"2024-06-13T04:33:20Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08801","snapshot_observed_at":"2026-08-05T19:07:42.180912Z","title":"Hallo: Hierarchical audio-driven visual synthesis for portrait image animation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.13442","last_updated":"2025-08-19T01:55:25Z","snapshot_observed_at":"2026-08-07T21:53:25.249431Z","submitted_at":"2025-08-19T01:55:25Z","title":"EDTalk++: Full Disentanglement for Controllable Talking Head Synthesis","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-05T19:07:42.180912Z"},"links":{"cited_paper":"/paper/2406.08801","citing_paper":"/paper/2508.13442"},"observation_digest":"sha256:d6cf241780b0966536838f61a1bc31cd18f6a1318cf1a6be673cc35451bedbda","observation_id":"d1361a53-2ccb-4a5e-b35b-efc01a35f5ba","resolution":{"observed_at":"2026-08-05T19:07:42.180912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08801","last_updated":"2024-06-16T07:10:41Z","snapshot_observed_at":"2026-07-06T18:30:06.570612Z","submitted_at":"2024-06-13T04:33:20Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08801","snapshot_observed_at":"2026-08-05T18:50:16.297962Z","title":"Hallo: Hierarchical audio-driven visual synthesis for portrait image animation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.14033","last_updated":"2025-08-19T17:55:23Z","snapshot_observed_at":"2026-08-05T18:50:15.388089Z","submitted_at":"2025-08-19T17:55:23Z","title":"InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T18:50:16.297962Z"},"links":{"cited_paper":"/paper/2406.08801","citing_paper":"/paper/2508.14033"},"observation_digest":"sha256:e6a4b09c65c6785b4f24d0b4f12a9e7a12daced718846cefd2b8d2356335fc05","observation_id":"19ef1e5d-8a17-44dc-b467-54d2949b301b","resolution":{"observed_at":"2026-08-05T18:50:16.297962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08801","last_updated":"2024-06-16T07:10:41Z","snapshot_observed_at":"2026-07-06T18:30:06.570612Z","submitted_at":"2024-06-13T04:33:20Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08801","snapshot_observed_at":"2026-08-05T15:19:37.259854Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-09T16:12:19.928163Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:37.259854Z"},"links":{"cited_paper":"/paper/2406.08801","citing_paper":"/paper/2508.20210"},"observation_digest":"sha256:acb886cab45c2ef2fbf55d6cb1c40ec333b5c36a0dd37cbc8606dd4078e357eb","observation_id":"62b552ec-c597-4ea0-8810-5b3f829d2845","resolution":{"observed_at":"2026-08-05T15:19:37.259854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08801","last_updated":"2024-06-16T07:10:41Z","snapshot_observed_at":"2026-07-06T18:30:06.570612Z","submitted_at":"2024-06-13T04:33:20Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08801","snapshot_observed_at":"2026-08-05T10:36:52.656632Z","title":"Hallo: Hierarchical audio-driven visual synthesis for portrait image animation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-07T20:50:00.215211Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:52.656632Z"},"links":{"cited_paper":"/paper/2406.08801","citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:c0ad7a7a72ecef8a41c0763b85dc2a99932e4d6c765836d4459ea5a05c3c2652","observation_id":"e0f06b7c-dffa-4f88-a39b-534522cb11ef","resolution":{"observed_at":"2026-08-05T10:36:52.656632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08801","last_updated":"2024-06-16T07:10:41Z","snapshot_observed_at":"2026-07-06T18:30:06.570612Z","submitted_at":"2024-06-13T04:33:20Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","version":2},"cited_work":{"arxiv_id":"2406.08801","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.08801","snapshot_observed_at":"2026-07-01T22:06:16.996788Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","venue":null,"work_id":"c9aa1ca0-1c1b-4f82-99c8-f3bfda2b1e83","year":2024},"citing_paper":{"arxiv_id":"2509.12052","last_updated":"2026-04-20T18:20:15Z","snapshot_observed_at":"2026-07-06T22:29:58.066459Z","submitted_at":"2025-09-15T15:34:02Z","title":"FluentAvatar: Flicker-Free Talking-Head Animation via Phoneme-Guided Autoregressive Modeling","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-18T16:42:25.803856Z"},"links":{"cited_paper":"/paper/2406.08801","citing_paper":"/paper/2509.12052"},"observation_digest":"sha256:5b0f3cb71bf47ff3c23c0ef788bcc11e47f2f53d09a2b62fda96974466d135e7","observation_id":"d0d0c22e-34d9-4ad0-9c96-9e2eb28e041c","resolution":{"observed_at":"2026-05-18T16:42:43.789808Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08801","last_updated":"2024-06-16T07:10:41Z","snapshot_observed_at":"2026-07-06T18:30:06.570612Z","submitted_at":"2024-06-13T04:33:20Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08801","snapshot_observed_at":"2026-08-03T16:30:39.500409Z","title":"Hallo: Hierarchical audio-driven visual synthesis for portrait image animation.arXiv preprint arXiv:2406.08801, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.13247","last_updated":"2026-07-17T19:41:30Z","snapshot_observed_at":"2026-08-07T23:01:22.712955Z","submitted_at":"2025-12-15T11:59:01Z","title":"STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-03T16:30:39.500409Z"},"links":{"cited_paper":"/paper/2406.08801","citing_paper":"/paper/2512.13247"},"observation_digest":"sha256:d4ea62a8423cb957b0b9c1818ace0d4573d04540760197f302d375f1ec14d1c2","observation_id":"697de81c-4365-4064-9772-1108bc316543","resolution":{"observed_at":"2026-08-03T16:30:39.500409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08801","last_updated":"2024-06-16T07:10:41Z","snapshot_observed_at":"2026-07-06T18:30:06.570612Z","submitted_at":"2024-06-13T04:33:20Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","version":2},"cited_work":{"arxiv_id":"2406.08801","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.08801","snapshot_observed_at":"2026-07-01T22:06:16.996788Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","venue":null,"work_id":"c9aa1ca0-1c1b-4f82-99c8-f3bfda2b1e83","year":2024},"citing_paper":{"arxiv_id":"2604.04787","last_updated":"2026-04-20T16:19:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-06T15:56:50Z","title":"AvatarPointillist: AutoRegressive 4D Gaussian Avatarization","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-10T18:47:37.605996Z"},"links":{"cited_paper":"/paper/2406.08801","citing_paper":"/paper/2604.04787"},"observation_digest":"sha256:2a032cce54d7e711c93d2693cd8ebb1ccaefc17d404d0b2e321eac49b596315b","observation_id":"17b76d59-bf52-4010-a9e8-b08a79c75706","resolution":{"observed_at":"2026-05-10T23:55:51.152270Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08801","last_updated":"2024-06-16T07:10:41Z","snapshot_observed_at":"2026-07-06T18:30:06.570612Z","submitted_at":"2024-06-13T04:33:20Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","version":2},"cited_work":{"arxiv_id":"2406.08801","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.08801","snapshot_observed_at":"2026-07-01T22:06:16.996788Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","venue":null,"work_id":"c9aa1ca0-1c1b-4f82-99c8-f3bfda2b1e83","year":2024},"citing_paper":{"arxiv_id":"2604.08405","last_updated":"2026-07-30T09:16:54Z","snapshot_observed_at":"2026-08-03T01:34:12.626353Z","submitted_at":"2026-04-09T16:03:24Z","title":"SyncBreaker:Stage-Aware Multimodal Adversarial Attacks on Audio-Driven Talking Head Generation","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-10T17:30:36.462567Z"},"links":{"cited_paper":"/paper/2406.08801","citing_paper":"/paper/2604.08405"},"observation_digest":"sha256:9637cf982b2110ccaafb013c96145f533096d5671437ba648cc4e11269d794e3","observation_id":"0e727eef-15e8-4aac-b21d-edae96a3c738","resolution":{"observed_at":"2026-05-11T06:41:25.776975Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08801","last_updated":"2024-06-16T07:10:41Z","snapshot_observed_at":"2026-07-06T18:30:06.570612Z","submitted_at":"2024-06-13T04:33:20Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08801","snapshot_observed_at":"2026-08-02T16:38:16.303378Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.08405","last_updated":"2026-07-30T09:16:54Z","snapshot_observed_at":"2026-08-03T01:34:12.626353Z","submitted_at":"2026-04-09T16:03:24Z","title":"SyncBreaker:Stage-Aware Multimodal Adversarial Attacks on Audio-Driven Talking Head Generation","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-02T16:38:16.303378Z"},"links":{"cited_paper":"/paper/2406.08801","citing_paper":"/paper/2604.08405"},"observation_digest":"sha256:35acf8395fc5f94023d229b2650df8e6c761971138cca3ec2dd2192072423900","observation_id":"205693a5-d40b-47e9-9cea-eadd417d5a37","resolution":{"observed_at":"2026-08-02T16:38:16.303378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08801","last_updated":"2024-06-16T07:10:41Z","snapshot_observed_at":"2026-07-06T18:30:06.570612Z","submitted_at":"2024-06-13T04:33:20Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","version":2},"cited_work":{"arxiv_id":"2406.08801","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.08801","snapshot_observed_at":"2026-07-01T22:06:16.996788Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","venue":null,"work_id":"c9aa1ca0-1c1b-4f82-99c8-f3bfda2b1e83","year":2024},"citing_paper":{"arxiv_id":"2604.10367","last_updated":"2026-04-11T22:34:21Z","snapshot_observed_at":"2026-08-04T17:39:32.698422Z","submitted_at":"2026-04-11T22:34:21Z","title":"Beyond Monologue: Interactive Talking-Listening Avatar Generation with Conversational Audio Context-Aware Kernels","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-10T15:16:53.603971Z"},"links":{"cited_paper":"/paper/2406.08801","citing_paper":"/paper/2604.10367"},"observation_digest":"sha256:b5addc4996f6e6f2b32c933db7fafb3e8fc55c3aace6835f84db6522d7d77478","observation_id":"b7ead486-41cd-413e-8ce4-48e880f4463d","resolution":{"observed_at":"2026-05-11T10:56:01.763121Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08801","last_updated":"2024-06-16T07:10:41Z","snapshot_observed_at":"2026-07-06T18:30:06.570612Z","submitted_at":"2024-06-13T04:33:20Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","version":2},"cited_work":{"arxiv_id":"2406.08801","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.08801","snapshot_observed_at":"2026-07-01T22:06:16.996788Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","venue":null,"work_id":"c9aa1ca0-1c1b-4f82-99c8-f3bfda2b1e83","year":2024},"citing_paper":{"arxiv_id":"2604.12941","last_updated":"2026-04-14T16:35:04Z","snapshot_observed_at":"2026-08-02T20:19:44.512770Z","submitted_at":"2026-04-14T16:35:04Z","title":"Direct Discrepancy Replay: Distribution-Discrepancy Condensation and Manifold-Consistent Replay for Continual Face Forgery Detection","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-10T14:50:39.077649Z"},"links":{"cited_paper":"/paper/2406.08801","citing_paper":"/paper/2604.12941"},"observation_digest":"sha256:c4bd5e102fd8e5e3c582f1ef41fcf3a851f68d3e068d6409fc46c3b09356cbab","observation_id":"898331d4-11ad-4304-b41f-de82d2d0d867","resolution":{"observed_at":"2026-05-11T11:31:01.252071Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08801","last_updated":"2024-06-16T07:10:41Z","snapshot_observed_at":"2026-07-06T18:30:06.570612Z","submitted_at":"2024-06-13T04:33:20Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","version":2},"cited_work":{"arxiv_id":"2406.08801","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.08801","snapshot_observed_at":"2026-07-01T22:06:16.996788Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","venue":null,"work_id":"c9aa1ca0-1c1b-4f82-99c8-f3bfda2b1e83","year":2024},"citing_paper":{"arxiv_id":"2604.14541","last_updated":"2026-04-16T02:16:36Z","snapshot_observed_at":"2026-08-03T11:44:21.453831Z","submitted_at":"2026-04-16T02:16:36Z","title":"Giving Faces Their Feelings Back: Explicit Emotion Control for Feedforward Single-Image 3D Head Avatars","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-05-10T11:47:42.039240Z"},"links":{"cited_paper":"/paper/2406.08801","citing_paper":"/paper/2604.14541"},"observation_digest":"sha256:bb58d732cb3164bdcd371dce7e7d1ac8cd806c8fd076b7f628f922f675bbbfa7","observation_id":"1b4cb1a1-22f5-4bab-8424-996a9907d853","resolution":{"observed_at":"2026-05-10T11:50:20.275679Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08801","last_updated":"2024-06-16T07:10:41Z","snapshot_observed_at":"2026-07-06T18:30:06.570612Z","submitted_at":"2024-06-13T04:33:20Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","version":2},"cited_work":{"arxiv_id":"2406.08801","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.08801","snapshot_observed_at":"2026-07-01T22:06:16.996788Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","venue":null,"work_id":"c9aa1ca0-1c1b-4f82-99c8-f3bfda2b1e83","year":2024},"citing_paper":{"arxiv_id":"2604.14580","last_updated":"2026-05-05T22:56:58Z","snapshot_observed_at":"2026-07-06T23:02:18.425249Z","submitted_at":"2026-04-16T03:19:29Z","title":"TurboTalk: Progressive Distillation for One-Step Audio-Driven Talking Avatar Generation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T11:13:27.689539Z"},"links":{"cited_paper":"/paper/2406.08801","citing_paper":"/paper/2604.14580"},"observation_digest":"sha256:96ff47a579afef0de00f76a7b55779b57c29b50e6d0e6ef8546418c36fc3b82e","observation_id":"ed2442b5-6753-4c39-b7af-53b558c18d0d","resolution":{"observed_at":"2026-05-10T11:15:10.394608Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08801","last_updated":"2024-06-16T07:10:41Z","snapshot_observed_at":"2026-07-06T18:30:06.570612Z","submitted_at":"2024-06-13T04:33:20Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","version":2},"cited_work":{"arxiv_id":"2406.08801","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.08801","snapshot_observed_at":"2026-07-01T22:06:16.996788Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","venue":null,"work_id":"c9aa1ca0-1c1b-4f82-99c8-f3bfda2b1e83","year":2024},"citing_paper":{"arxiv_id":"2604.19679","last_updated":"2026-06-29T16:38:23Z","snapshot_observed_at":"2026-07-06T23:06:16.972438Z","submitted_at":"2026-04-21T16:57:23Z","title":"MMControl: Unified Multi-Modal Control for Joint Audio-Video Generation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T02:55:09.008954Z"},"links":{"cited_paper":"/paper/2406.08801","citing_paper":"/paper/2604.19679"},"observation_digest":"sha256:f29b35883d9e635e74db22d12af316feb7fb588c3a790102407e5198e0467b4a","observation_id":"c6fe6c3d-71db-4fad-9345-e425bcfd5ca5","resolution":{"observed_at":"2026-05-11T12:46:28.097078Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08801","last_updated":"2024-06-16T07:10:41Z","snapshot_observed_at":"2026-07-06T18:30:06.570612Z","submitted_at":"2024-06-13T04:33:20Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","version":2},"cited_work":{"arxiv_id":"2406.08801","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.08801","snapshot_observed_at":"2026-07-01T22:06:16.996788Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","venue":null,"work_id":"c9aa1ca0-1c1b-4f82-99c8-f3bfda2b1e83","year":2024},"citing_paper":{"arxiv_id":"2604.22865","last_updated":"2026-04-23T09:01:27Z","snapshot_observed_at":"2026-07-06T23:09:10.050398Z","submitted_at":"2026-04-23T09:01:27Z","title":"MeshLAM: Feed-Forward One-Shot Animatable Textured Mesh Avatar Reconstruction","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-09T22:06:58.480052Z"},"links":{"cited_paper":"/paper/2406.08801","citing_paper":"/paper/2604.22865"},"observation_digest":"sha256:b7ecb054a1cff24e0188cc371e5638a478258ba2fe6f84e6cd86bee8df0db70e","observation_id":"c2658e7b-c65f-431d-be8b-547f74962c57","resolution":{"observed_at":"2026-05-11T14:16:27.786083Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08801","last_updated":"2024-06-16T07:10:41Z","snapshot_observed_at":"2026-07-06T18:30:06.570612Z","submitted_at":"2024-06-13T04:33:20Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","version":2},"cited_work":{"arxiv_id":"2406.08801","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.08801","snapshot_observed_at":"2026-07-01T22:06:16.996788Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","venue":null,"work_id":"c9aa1ca0-1c1b-4f82-99c8-f3bfda2b1e83","year":2024},"citing_paper":{"arxiv_id":"2604.23586","last_updated":"2026-08-04T09:15:37Z","snapshot_observed_at":"2026-08-07T23:09:24.588848Z","submitted_at":"2026-04-26T07:48:47Z","title":"Talker-T2AV: Joint Talking Audio-Video Generation with Autoregressive Diffusion Modeling","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-08T06:44:36.000353Z"},"links":{"cited_paper":"/paper/2406.08801","citing_paper":"/paper/2604.23586"},"observation_digest":"sha256:e025aac67b1b94b28bccd4deb8c4aa587ff2807f0abc201962f76bd3e71f1688","observation_id":"6178aacc-2956-4397-afa6-f704ee068401","resolution":{"observed_at":"2026-05-11T21:06:14.299885Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08801","last_updated":"2024-06-16T07:10:41Z","snapshot_observed_at":"2026-07-06T18:30:06.570612Z","submitted_at":"2024-06-13T04:33:20Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","version":2},"cited_work":{"arxiv_id":"2406.08801","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.08801","snapshot_observed_at":"2026-07-01T22:06:16.996788Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","venue":null,"work_id":"c9aa1ca0-1c1b-4f82-99c8-f3bfda2b1e83","year":2024},"citing_paper":{"arxiv_id":"2604.23632","last_updated":"2026-04-26T09:46:58Z","snapshot_observed_at":"2026-07-06T23:09:48.137856Z","submitted_at":"2026-04-26T09:46:58Z","title":"Hallo-Live: Real-Time Streaming Joint Audio-Video Avatar Generation with Asynchronous Dual-Stream and Human-Centric Preference Distillation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-08T06:56:19.795651Z"},"links":{"cited_paper":"/paper/2406.08801","citing_paper":"/paper/2604.23632"},"observation_digest":"sha256:7997b0829f5230077dc3fd11c659e2dd15a95806d473f14ea93817a32c0e474b","observation_id":"f0d3deec-29e2-4350-b3ab-4b1dd035a100","resolution":{"observed_at":"2026-05-11T21:06:12.720703Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08801","last_updated":"2024-06-16T07:10:41Z","snapshot_observed_at":"2026-07-06T18:30:06.570612Z","submitted_at":"2024-06-13T04:33:20Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","version":2},"cited_work":{"arxiv_id":"2406.08801","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.08801","snapshot_observed_at":"2026-07-01T22:06:16.996788Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","venue":null,"work_id":"c9aa1ca0-1c1b-4f82-99c8-f3bfda2b1e83","year":2024},"citing_paper":{"arxiv_id":"2604.23688","last_updated":"2026-04-26T13:04:33Z","snapshot_observed_at":"2026-08-06T14:16:42.517893Z","submitted_at":"2026-04-26T13:04:33Z","title":"Do Protective Perturbations Really Protect Portrait Privacy under Real-world Image Transformations?","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-08T06:42:31.456648Z"},"links":{"cited_paper":"/paper/2406.08801","citing_paper":"/paper/2604.23688"},"observation_digest":"sha256:4304d990e6ae61bc0269fd4cc162a7f9ad04318fee94248532a1d4e59f0e0519","observation_id":"a13e0a97-4797-4d0e-95fa-2842b1557e0b","resolution":{"observed_at":"2026-05-11T21:06:14.711337Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08801","last_updated":"2024-06-16T07:10:41Z","snapshot_observed_at":"2026-07-06T18:30:06.570612Z","submitted_at":"2024-06-13T04:33:20Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","version":2},"cited_work":{"arxiv_id":"2406.08801","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.08801","snapshot_observed_at":"2026-07-01T22:06:16.996788Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","venue":null,"work_id":"c9aa1ca0-1c1b-4f82-99c8-f3bfda2b1e83","year":2024},"citing_paper":{"arxiv_id":"2604.27918","last_updated":"2026-04-30T14:22:27Z","snapshot_observed_at":"2026-07-06T23:13:20.516759Z","submitted_at":"2026-04-30T14:22:27Z","title":"Generate Your Talking Avatar from Video Reference","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-07T05:32:04.519820Z"},"links":{"cited_paper":"/paper/2406.08801","citing_paper":"/paper/2604.27918"},"observation_digest":"sha256:dbe30fc183cad9593f64afb2d57eb76640ed7af1ebb394f48e4d61c2909f06ef","observation_id":"91275adb-8fef-4224-9e85-f1acd0d5c7ad","resolution":{"observed_at":"2026-05-12T10:36:29.833106Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08801","last_updated":"2024-06-16T07:10:41Z","snapshot_observed_at":"2026-07-06T18:30:06.570612Z","submitted_at":"2024-06-13T04:33:20Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","version":2},"cited_work":{"arxiv_id":"2406.08801","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.08801","snapshot_observed_at":"2026-07-01T22:06:16.996788Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","venue":null,"work_id":"c9aa1ca0-1c1b-4f82-99c8-f3bfda2b1e83","year":2024},"citing_paper":{"arxiv_id":"2605.02948","last_updated":"2026-05-11T03:04:55Z","snapshot_observed_at":"2026-08-08T22:18:14.048236Z","submitted_at":"2026-05-01T16:38:06Z","title":"AsymTalker: Identity-Consistent Long-Term Talking Head Generation via Asymmetric Distillation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-09T20:19:39.565157Z"},"links":{"cited_paper":"/paper/2406.08801","citing_paper":"/paper/2605.02948"},"observation_digest":"sha256:ae2f445ddc1044fc158491f2bfdb16c0568567efb0aac95739f48effa6c5623b","observation_id":"bd95ef94-b0d9-4823-b202-c18502e0671e","resolution":{"observed_at":"2026-05-11T15:16:11.240985Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08801","last_updated":"2024-06-16T07:10:41Z","snapshot_observed_at":"2026-07-06T18:30:06.570612Z","submitted_at":"2024-06-13T04:33:20Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","version":2},"cited_work":{"arxiv_id":"2406.08801","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.08801","snapshot_observed_at":"2026-07-01T22:06:16.996788Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","venue":null,"work_id":"c9aa1ca0-1c1b-4f82-99c8-f3bfda2b1e83","year":2024},"citing_paper":{"arxiv_id":"2605.02948","last_updated":"2026-05-11T03:04:55Z","snapshot_observed_at":"2026-08-08T22:18:14.048236Z","submitted_at":"2026-05-01T16:38:06Z","title":"AsymTalker: Identity-Consistent Long-Term Talking Head Generation via Asymmetric Distillation","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-11T02:18:58.996355Z"},"links":{"cited_paper":"/paper/2406.08801","citing_paper":"/paper/2605.02948"},"observation_digest":"sha256:02c29d3a9da0454a2f35e5342af89a50448d0723c10ce9b7a94c7a27578dcfcc","observation_id":"93601e6a-008c-4ed1-b8af-6296ce99a58b","resolution":{"observed_at":"2026-05-11T03:45:57.523880Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08801","last_updated":"2024-06-16T07:10:41Z","snapshot_observed_at":"2026-07-06T18:30:06.570612Z","submitted_at":"2024-06-13T04:33:20Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","version":2},"cited_work":{"arxiv_id":"2406.08801","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.08801","snapshot_observed_at":"2026-07-01T22:06:16.996788Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","venue":null,"work_id":"c9aa1ca0-1c1b-4f82-99c8-f3bfda2b1e83","year":2024},"citing_paper":{"arxiv_id":"2605.06280","last_updated":"2026-07-12T05:10:37Z","snapshot_observed_at":"2026-07-16T23:18:43.140861Z","submitted_at":"2026-05-07T13:53:31Z","title":"Eulerian Motion Guidance: Robust Image Animation via Bidirectional Geometric Consistency","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-08T13:30:47.547011Z"},"links":{"cited_paper":"/paper/2406.08801","citing_paper":"/paper/2605.06280"},"observation_digest":"sha256:b2c7691f0505bd42d1a661df535ca9b8811e24bba7fba96da0c63b8270797c34","observation_id":"09b818d7-6573-4f55-936e-f1ba2c36e39e","resolution":{"observed_at":"2026-05-11T18:51:08.915687Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08801","last_updated":"2024-06-16T07:10:41Z","snapshot_observed_at":"2026-07-06T18:30:06.570612Z","submitted_at":"2024-06-13T04:33:20Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","version":2},"cited_work":{"arxiv_id":"2406.08801","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.08801","snapshot_observed_at":"2026-07-01T22:06:16.996788Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","venue":null,"work_id":"c9aa1ca0-1c1b-4f82-99c8-f3bfda2b1e83","year":2024},"citing_paper":{"arxiv_id":"2605.06280","last_updated":"2026-07-12T05:10:37Z","snapshot_observed_at":"2026-07-16T23:18:43.140861Z","submitted_at":"2026-05-07T13:53:31Z","title":"Eulerian Motion Guidance: Robust Image Animation via Bidirectional Geometric Consistency","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-11T02:10:23.616363Z"},"links":{"cited_paper":"/paper/2406.08801","citing_paper":"/paper/2605.06280"},"observation_digest":"sha256:84024ab699e4e0d53c2401181d29c41679aa46229069b268d094ac18a446cd71","observation_id":"86e8d2fc-022b-4df2-8423-3a3f04da3434","resolution":{"observed_at":"2026-05-11T03:55:54.099448Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08801","last_updated":"2024-06-16T07:10:41Z","snapshot_observed_at":"2026-07-06T18:30:06.570612Z","submitted_at":"2024-06-13T04:33:20Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","version":2},"cited_work":{"arxiv_id":"2406.08801","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.08801","snapshot_observed_at":"2026-07-01T22:06:16.996788Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","venue":null,"work_id":"c9aa1ca0-1c1b-4f82-99c8-f3bfda2b1e83","year":2024},"citing_paper":{"arxiv_id":"2605.06280","last_updated":"2026-07-12T05:10:37Z","snapshot_observed_at":"2026-07-16T23:18:43.140861Z","submitted_at":"2026-05-07T13:53:31Z","title":"Eulerian Motion Guidance: Robust Image Animation via Bidirectional Geometric Consistency","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-13T06:58:57.520289Z"},"links":{"cited_paper":"/paper/2406.08801","citing_paper":"/paper/2605.06280"},"observation_digest":"sha256:bdeef4971d4899907fd8f0968907e8ccc3d2d3472a5d48f8706b667f7d1da9d7","observation_id":"cae1bfc1-313a-4c5a-abd6-e0c6a72ec99c","resolution":{"observed_at":"2026-05-13T07:02:27.640716Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08801","last_updated":"2024-06-16T07:10:41Z","snapshot_observed_at":"2026-07-06T18:30:06.570612Z","submitted_at":"2024-06-13T04:33:20Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","version":2},"cited_work":{"arxiv_id":"2406.08801","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.08801","snapshot_observed_at":"2026-07-01T22:06:16.996788Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","venue":null,"work_id":"c9aa1ca0-1c1b-4f82-99c8-f3bfda2b1e83","year":2024},"citing_paper":{"arxiv_id":"2605.06280","last_updated":"2026-07-12T05:10:37Z","snapshot_observed_at":"2026-07-16T23:18:43.140861Z","submitted_at":"2026-05-07T13:53:31Z","title":"Eulerian Motion Guidance: Robust Image Animation via Bidirectional Geometric Consistency","version":4},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-30T23:25:13.965611Z"},"links":{"cited_paper":"/paper/2406.08801","citing_paper":"/paper/2605.06280"},"observation_digest":"sha256:b4954de09129859bae89bf9669f752bd3ca37fb84f82f0c98a29d69b6d76ddb2","observation_id":"92272046-ae8d-4b36-a705-39063cb981dd","resolution":{"observed_at":"2026-07-01T13:25:44.775363Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08801","last_updated":"2024-06-16T07:10:41Z","snapshot_observed_at":"2026-07-06T18:30:06.570612Z","submitted_at":"2024-06-13T04:33:20Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","version":2},"cited_work":{"arxiv_id":"2406.08801","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.08801","snapshot_observed_at":"2026-07-01T22:06:16.996788Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","venue":null,"work_id":"c9aa1ca0-1c1b-4f82-99c8-f3bfda2b1e83","year":2024},"citing_paper":{"arxiv_id":"2605.16918","last_updated":"2026-05-16T10:20:52Z","snapshot_observed_at":"2026-07-06T23:28:02.429673Z","submitted_at":"2026-05-16T10:20:52Z","title":"HighSync: High-Quality Lip Synchronization via Latent Diffusion Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-19T21:14:25.606097Z"},"links":{"cited_paper":"/paper/2406.08801","citing_paper":"/paper/2605.16918"},"observation_digest":"sha256:35e5ce62db0e7014f81777d9667380a009136c5f127422d28afa8a3a4ffddea4","observation_id":"10a4157b-6876-4985-9995-0de49e6314b6","resolution":{"observed_at":"2026-05-19T21:17:48.650577Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08801","last_updated":"2024-06-16T07:10:41Z","snapshot_observed_at":"2026-07-06T18:30:06.570612Z","submitted_at":"2024-06-13T04:33:20Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","version":2},"cited_work":{"arxiv_id":"2406.08801","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.08801","snapshot_observed_at":"2026-07-01T22:06:16.996788Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","venue":null,"work_id":"c9aa1ca0-1c1b-4f82-99c8-f3bfda2b1e83","year":2024},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"cited_paper":"/paper/2406.08801","citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:f030d1ce44d6ec4efb5bc78aa1364218a7575914d7d7855552731b3bf5cb5e7c","observation_id":"08535c7e-7e6c-4f05-835b-ab2fd1ed2a52","resolution":{"observed_at":"2026-05-20T15:08:24.871201Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08801","last_updated":"2024-06-16T07:10:41Z","snapshot_observed_at":"2026-07-06T18:30:06.570612Z","submitted_at":"2024-06-13T04:33:20Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","version":2},"cited_work":{"arxiv_id":"2406.08801","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.08801","snapshot_observed_at":"2026-07-01T22:06:16.996788Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","venue":null,"work_id":"c9aa1ca0-1c1b-4f82-99c8-f3bfda2b1e83","year":2024},"citing_paper":{"arxiv_id":"2605.24176","last_updated":"2026-05-22T19:54:37Z","snapshot_observed_at":"2026-08-02T13:05:06.490316Z","submitted_at":"2026-05-22T19:54:37Z","title":"Loki: Representation over Architecture for Diffusion-Based Portrait Animation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-30T15:23:48.899214Z"},"links":{"cited_paper":"/paper/2406.08801","citing_paper":"/paper/2605.24176"},"observation_digest":"sha256:89b25ad05e5e8170d495562c6e3f43f2d590c2b429c44fce31a9a514f3dac1ed","observation_id":"f34ed0c2-6d49-439c-9a29-b38f52266d0d","resolution":{"observed_at":"2026-06-30T15:24:49.848910Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08801","last_updated":"2024-06-16T07:10:41Z","snapshot_observed_at":"2026-07-06T18:30:06.570612Z","submitted_at":"2024-06-13T04:33:20Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","version":2},"cited_work":{"arxiv_id":"2406.08801","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.08801","snapshot_observed_at":"2026-07-01T22:06:16.996788Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","venue":null,"work_id":"c9aa1ca0-1c1b-4f82-99c8-f3bfda2b1e83","year":2024},"citing_paper":{"arxiv_id":"2605.25488","last_updated":"2026-05-25T06:45:29Z","snapshot_observed_at":"2026-08-02T09:17:40.384654Z","submitted_at":"2026-05-25T06:45:29Z","title":"Test-Time Self-Adaptive Conditioning for Stable Audio-Driven Talking-Head Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-29T22:36:53.138354Z"},"links":{"cited_paper":"/paper/2406.08801","citing_paper":"/paper/2605.25488"},"observation_digest":"sha256:d7b467f88af5d38d49125926b6c32261cc4866dc4b7ace5251fe495290ebec67","observation_id":"4d58aa8a-0465-4083-80dd-4555587343bd","resolution":{"observed_at":"2026-06-29T22:44:01.687595Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08801","last_updated":"2024-06-16T07:10:41Z","snapshot_observed_at":"2026-07-06T18:30:06.570612Z","submitted_at":"2024-06-13T04:33:20Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","version":2},"cited_work":{"arxiv_id":"2406.08801","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.08801","snapshot_observed_at":"2026-07-01T22:06:16.996788Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","venue":null,"work_id":"c9aa1ca0-1c1b-4f82-99c8-f3bfda2b1e83","year":2024},"citing_paper":{"arxiv_id":"2605.30230","last_updated":"2026-05-28T17:00:37Z","snapshot_observed_at":"2026-08-09T16:21:39.696026Z","submitted_at":"2026-05-28T17:00:37Z","title":"IP-Adapter Is All You Need: Towards Fine-Tuning-Free Diffusion-Based Talking Face Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-29T07:50:56.947671Z"},"links":{"cited_paper":"/paper/2406.08801","citing_paper":"/paper/2605.30230"},"observation_digest":"sha256:5971e811f755cd1da70015ee811bdf8bc71fdd61cd4a232d107ef5d9aa96a2c1","observation_id":"a89fcbd1-5187-4cb5-abf3-3dc878572ccf","resolution":{"observed_at":"2026-06-29T07:53:13.366896Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08801","last_updated":"2024-06-16T07:10:41Z","snapshot_observed_at":"2026-07-06T18:30:06.570612Z","submitted_at":"2024-06-13T04:33:20Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","version":2},"cited_work":{"arxiv_id":"2406.08801","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.08801","snapshot_observed_at":"2026-07-01T22:06:16.996788Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","venue":null,"work_id":"c9aa1ca0-1c1b-4f82-99c8-f3bfda2b1e83","year":2024},"citing_paper":{"arxiv_id":"2606.01031","last_updated":"2026-05-31T05:44:42Z","snapshot_observed_at":"2026-07-06T23:41:39.172310Z","submitted_at":"2026-05-31T05:44:42Z","title":"Temporally-Aligned Evaluation for Audio-Driven Talking Head Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-28T16:19:55.048831Z"},"links":{"cited_paper":"/paper/2406.08801","citing_paper":"/paper/2606.01031"},"observation_digest":"sha256:0df7b17e6d87dd1e75c4a3e6f483ca18e7fbab406d387704a8f477ed8f64af9e","observation_id":"210e1107-9f6b-4bd8-b811-d59d4911bc8e","resolution":{"observed_at":"2026-07-01T21:46:15.588139Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08801","last_updated":"2024-06-16T07:10:41Z","snapshot_observed_at":"2026-07-06T18:30:06.570612Z","submitted_at":"2024-06-13T04:33:20Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","version":2},"cited_work":{"arxiv_id":"2406.08801","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.08801","snapshot_observed_at":"2026-07-01T22:06:16.996788Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","venue":null,"work_id":"c9aa1ca0-1c1b-4f82-99c8-f3bfda2b1e83","year":2024},"citing_paper":{"arxiv_id":"2606.01620","last_updated":"2026-06-01T03:12:23Z","snapshot_observed_at":"2026-08-07T22:55:26.112965Z","submitted_at":"2026-06-01T03:12:23Z","title":"Real-Time Generation of Streamable Talking Portrait Video with Reference-Guided Deep Compression VAEs","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-06-28T15:41:59.683979Z"},"links":{"cited_paper":"/paper/2406.08801","citing_paper":"/paper/2606.01620"},"observation_digest":"sha256:78ca1be1b306f3b6d2d077bc748eca5d9c791dee7d84d22b134098678c072749","observation_id":"1a0bf6b9-050b-4aae-9500-3c2f8ad4609f","resolution":{"observed_at":"2026-07-01T22:06:16.998665Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08801","last_updated":"2024-06-16T07:10:41Z","snapshot_observed_at":"2026-07-06T18:30:06.570612Z","submitted_at":"2024-06-13T04:33:20Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","version":2},"cited_work":{"arxiv_id":"2406.08801","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.08801","snapshot_observed_at":"2026-07-01T22:06:16.996788Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","venue":null,"work_id":"c9aa1ca0-1c1b-4f82-99c8-f3bfda2b1e83","year":2024},"citing_paper":{"arxiv_id":"2606.30849","last_updated":"2026-06-29T19:26:13Z","snapshot_observed_at":"2026-08-02T00:44:38.626792Z","submitted_at":"2026-06-29T19:26:13Z","title":"SyncCache: Exploiting Asymmetric Dynamics for Fast Audio-Driven Portrait Animation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-01T06:13:11.504526Z"},"links":{"cited_paper":"/paper/2406.08801","citing_paper":"/paper/2606.30849"},"observation_digest":"sha256:ba2da64144eab7e0924aef50617117a3c23bcda98b2c5e599023a2965e4f111a","observation_id":"9344f1e9-3dae-430c-a33d-06ccf449486f","resolution":{"observed_at":"2026-07-01T09:45:40.302530Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08801","last_updated":"2024-06-16T07:10:41Z","snapshot_observed_at":"2026-07-06T18:30:06.570612Z","submitted_at":"2024-06-13T04:33:20Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08801","snapshot_observed_at":"2026-08-01T09:02:19.386267Z","title":"Hallo: Hierarchical audio-driven visual synthesis for portrait image animation.arXiv preprint arXiv:2406.08801, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20922","last_updated":"2026-07-23T04:57:22Z","snapshot_observed_at":"2026-08-07T13:16:14.837746Z","submitted_at":"2026-07-23T04:57:22Z","title":"FA-LAM: Focus-Aware Large Avatar Model for One-Shot 4D Animatable Gaussian Head","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T09:02:19.386267Z"},"links":{"cited_paper":"/paper/2406.08801","citing_paper":"/paper/2607.20922"},"observation_digest":"sha256:a13a76bc198629128fc20b349fbb732ef0f83348015eed28ed492bc1a2edfcf8","observation_id":"b493bb94-9218-4ea3-8a09-b0dfb81ca557","resolution":{"observed_at":"2026-08-01T09:02:19.386267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08801","last_updated":"2024-06-16T07:10:41Z","snapshot_observed_at":"2026-07-06T18:30:06.570612Z","submitted_at":"2024-06-13T04:33:20Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08801","snapshot_observed_at":"2026-07-31T23:01:32.039915Z","title":"11 Hallo: Hierarchical audio-driven visual synthesis for portrait image animation.arXiv preprint arXiv:2406.08801, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24124","last_updated":"2026-07-27T08:06:29Z","snapshot_observed_at":"2026-08-06T21:24:01.524756Z","submitted_at":"2026-07-27T08:06:29Z","title":"ViDS: Video Diffusion Shader using 3D Face Tracking","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-07-31T23:01:32.039915Z"},"links":{"cited_paper":"/paper/2406.08801","citing_paper":"/paper/2607.24124"},"observation_digest":"sha256:635cedbb728df2925918ee6d7d9b166afab22347abac5884b238bca04dcff0a6","observation_id":"6038c66d-f163-47bc-bfd3-a30d05155090","resolution":{"observed_at":"2026-07-31T23:01:32.039915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08801","last_updated":"2024-06-16T07:10:41Z","snapshot_observed_at":"2026-07-06T18:30:06.570612Z","submitted_at":"2024-06-13T04:33:20Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08801","snapshot_observed_at":"2026-07-31T17:08:14.198579Z","title":"arXiv preprint arXiv:2406.08801 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24359","last_updated":"2026-07-27T12:35:32Z","snapshot_observed_at":"2026-08-07T12:24:27.014006Z","submitted_at":"2026-07-27T12:35:32Z","title":"TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-07-31T17:08:14.198579Z"},"links":{"cited_paper":"/paper/2406.08801","citing_paper":"/paper/2607.24359"},"observation_digest":"sha256:daac3580bcd065d97cc80317bc93038085dbe432d16ccaaf2195b41f4ad34445","observation_id":"44928e9b-9bca-4652-8a70-7e1e460e7b88","resolution":{"observed_at":"2026-07-31T17:08:14.198579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08801","last_updated":"2024-06-16T07:10:41Z","snapshot_observed_at":"2026-07-06T18:30:06.570612Z","submitted_at":"2024-06-13T04:33:20Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08801","snapshot_observed_at":"2026-08-04T01:03:13.201630Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.00663","last_updated":"2026-08-01T13:33:38Z","snapshot_observed_at":"2026-08-09T14:14:53.900226Z","submitted_at":"2026-08-01T13:33:38Z","title":"Geometry-guided Emotion Modulation for Controllable and Photorealistic Emotional Talking Face Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-04T01:03:13.201630Z"},"links":{"cited_paper":"/paper/2406.08801","citing_paper":"/paper/2608.00663"},"observation_digest":"sha256:b368969edb345520ee6d3d7f28c6606fb347d61524d77f5c5ca9b8b285a520cf","observation_id":"8192666c-149d-491b-9cfc-40000194f655","resolution":{"observed_at":"2026-08-04T01:03:13.201630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08801","last_updated":"2024-06-16T07:10:41Z","snapshot_observed_at":"2026-07-06T18:30:06.570612Z","submitted_at":"2024-06-13T04:33:20Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08801","snapshot_observed_at":"2026-08-06T18:28:59.349570Z","title":"arXiv preprint arXiv:2406.08801 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04709","last_updated":"2026-08-05T11:23:40Z","snapshot_observed_at":"2026-08-08T23:12:20.276843Z","submitted_at":"2026-08-05T11:23:40Z","title":"EmpaAva: An Open-source Agentic 3D-Avatar Empathetic Live Chatbot","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T18:28:59.349570Z"},"links":{"cited_paper":"/paper/2406.08801","citing_paper":"/paper/2608.04709"},"observation_digest":"sha256:88335a06ad72ee00b1e87eb40380ff242eae8b90bba089226cff9b461baa6328","observation_id":"b22aefd0-67be-4417-bbb4-4566ef4c7540","resolution":{"observed_at":"2026-08-06T18:28:59.349570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2406.08801/citation-record","integrity":"/paper/2406.08801/integrity","json":"/paper/2406.08801/citation-record.json","paper":"/paper/2406.08801"},"outbound":[],"paper":{"arxiv_id":"2406.08801","last_updated":"2024-06-16T07:10:41Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T18:30:06.570612Z","submitted_at":"2024-06-13T04:33:20Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 62 inbound Pith citation observations for arXiv:2406.08801."}