{"as_of":"2026-08-08T22:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8c1201151838c5002d9a2769dfe960eeb606aacaf862919276bc507ec1da92f1","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":32,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:21:48.598479Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T21:46:15.594455Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.07718","last_updated":"2024-10-14T13:35:17Z","snapshot_observed_at":"2026-08-05T03:23:39.587839Z","submitted_at":"2024-10-10T08:34:41Z","title":"Hallo2: Long-Duration and High-Resolution Audio-Driven Portrait Image Animation","version":2},"cited_work":{"arxiv_id":"2410.07718","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.07718","snapshot_observed_at":"2026-07-01T21:46:15.594455Z","title":"Hallo2: Long-Duration and High-Resolution Audio-Driven Portrait Image Animation","venue":null,"work_id":"a36f46e1-e536-4499-b2bc-ed760196c9cf","year":2024},"citing_paper":{"arxiv_id":"2411.09209","last_updated":"2026-04-16T07:45:17Z","snapshot_observed_at":"2026-08-07T12:05:21.397143Z","submitted_at":"2024-11-14T06:13:05Z","title":"JoyVASA: Portrait and Animal Image Animation with Diffusion-Based Audio-Driven Facial Dynamics and Head Motion Generation","version":5},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-23T16:59:57.727035Z"},"links":{"cited_paper":"/paper/2410.07718","citing_paper":"/paper/2411.09209"},"observation_digest":"sha256:410ba4f832838cafe0fb6fa6ff5fe67285bf1cef8cb6abcc83f7ec4098981c65","observation_id":"af259182-f475-49fb-915f-2c93f8bd620b","resolution":{"observed_at":"2026-05-23T17:03:12.594476Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07718","last_updated":"2024-10-14T13:35:17Z","snapshot_observed_at":"2026-08-05T03:23:39.587839Z","submitted_at":"2024-10-10T08:34:41Z","title":"Hallo2: Long-Duration and High-Resolution Audio-Driven Portrait Image Animation","version":2},"cited_work":{"arxiv_id":"2410.07718","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.07718","snapshot_observed_at":"2026-07-01T21:46:15.594455Z","title":"Hallo2: Long-Duration and High-Resolution Audio-Driven Portrait Image Animation","venue":null,"work_id":"a36f46e1-e536-4499-b2bc-ed760196c9cf","year":2024},"citing_paper":{"arxiv_id":"2411.16748","last_updated":"2026-05-08T09:16:59Z","snapshot_observed_at":"2026-08-04T02:06:42.093429Z","submitted_at":"2024-11-24T04:46:00Z","title":"Multimodal Diffusion Transformer with Memory Bank for Scalable Long-Duration Talking Video Generation","version":5},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-23T17:19:51.411937Z"},"links":{"cited_paper":"/paper/2410.07718","citing_paper":"/paper/2411.16748"},"observation_digest":"sha256:7e6c1b71fbcd932e24d53ab4c7b2d81828d707c22000decbe8270c78a7317185","observation_id":"540aa358-8131-4303-a544-84b8682291ea","resolution":{"observed_at":"2026-05-23T17:23:15.413183Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07718","last_updated":"2024-10-14T13:35:17Z","snapshot_observed_at":"2026-08-05T03:23:39.587839Z","submitted_at":"2024-10-10T08:34:41Z","title":"Hallo2: Long-Duration and High-Resolution Audio-Driven Portrait Image Animation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07718","snapshot_observed_at":"2026-08-07T13:21:48.598479Z","title":"Hallo2: Long-duration and high-resolution audio-driven portrait image animation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22141","last_updated":"2025-08-27T16:33:34Z","snapshot_observed_at":"2026-08-07T20:49:32.346427Z","submitted_at":"2025-05-28T09:04:00Z","title":"FaceEditTalker: Controllable Talking Head Generation with Facial Attribute Editing","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:48.598479Z"},"links":{"cited_paper":"/paper/2410.07718","citing_paper":"/paper/2505.22141"},"observation_digest":"sha256:ae41e3b3ac0ea60f157ed4dc11b995971d3e129130769f20c3e8f8c42a849a84","observation_id":"37f544e3-304c-43f3-8bd9-67c2d5868aa3","resolution":{"observed_at":"2026-08-07T13:21:48.598479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07718","last_updated":"2024-10-14T13:35:17Z","snapshot_observed_at":"2026-08-05T03:23:39.587839Z","submitted_at":"2024-10-10T08:34:41Z","title":"Hallo2: Long-Duration and High-Resolution Audio-Driven Portrait Image Animation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07718","snapshot_observed_at":"2026-08-07T11:44:14.997364Z","title":"Hallo2: Long-duration and high-resolution audio-driven portrait im- age animation.arXiv preprint arXiv:2410.07718, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.01591","last_updated":"2025-06-02T12:26:46Z","snapshot_observed_at":"2026-08-08T09:22:03.343433Z","submitted_at":"2025-06-02T12:26:46Z","title":"Silence is Golden: Leveraging Adversarial Examples to Nullify Audio Control in LDM-based Talking-Head Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:14.997364Z"},"links":{"cited_paper":"/paper/2410.07718","citing_paper":"/paper/2506.01591"},"observation_digest":"sha256:4ef44dec02b87b87f0882ad377a97169d064ce01de3eb3cc39149a05d35070f5","observation_id":"a20423a8-e28c-4b29-acda-c0bfd3d5fe90","resolution":{"observed_at":"2026-08-07T11:44:14.997364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07718","last_updated":"2024-10-14T13:35:17Z","snapshot_observed_at":"2026-08-05T03:23:39.587839Z","submitted_at":"2024-10-10T08:34:41Z","title":"Hallo2: Long-Duration and High-Resolution Audio-Driven Portrait Image Animation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07718","snapshot_observed_at":"2026-08-07T10:18:24.230525Z","title":"Hallo2: Long-duration and high-resolution audio-driven portrait image animation.arXiv preprint arXiv:2410.07718, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05806","last_updated":"2025-06-06T07:09:07Z","snapshot_observed_at":"2026-08-07T20:50:54.524255Z","submitted_at":"2025-06-06T07:09:07Z","title":"LLIA -- Enabling Low-Latency Interactive Avatars: Real-Time Audio-Driven Portrait Video Generation with Diffusion Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:24.230525Z"},"links":{"cited_paper":"/paper/2410.07718","citing_paper":"/paper/2506.05806"},"observation_digest":"sha256:bfc254704b915a39416dfd18531aae388e9486fff28846f0fcff948f2b6f863d","observation_id":"be5e88b4-c072-4605-8b1e-ab752b2d2f3e","resolution":{"observed_at":"2026-08-07T10:18:24.230525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07718","last_updated":"2024-10-14T13:35:17Z","snapshot_observed_at":"2026-08-05T03:23:39.587839Z","submitted_at":"2024-10-10T08:34:41Z","title":"Hallo2: Long-Duration and High-Resolution Audio-Driven Portrait Image Animation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07718","snapshot_observed_at":"2026-08-06T20:58:22.630703Z","title":"Hallo2: Long-duration and high-resolution audio-driven portrait im- age animation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-07T20:49:14.374372Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:22.630703Z"},"links":{"cited_paper":"/paper/2410.07718","citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:506a66d5e812f626e1a55c74d02e77d0c785f1e1da0f6955ff3d289422e95a68","observation_id":"5c6c34f5-2787-48e5-ad04-0801b8d182cd","resolution":{"observed_at":"2026-08-06T20:58:22.630703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07718","last_updated":"2024-10-14T13:35:17Z","snapshot_observed_at":"2026-08-05T03:23:39.587839Z","submitted_at":"2024-10-10T08:34:41Z","title":"Hallo2: Long-Duration and High-Resolution Audio-Driven Portrait Image Animation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07718","snapshot_observed_at":"2026-08-06T20:23:36.635274Z","title":"Hallo2: Long-duration and high-resolution audio-driven portrait image animation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03256","last_updated":"2025-08-08T12:58:08Z","snapshot_observed_at":"2026-08-08T02:15:29.534181Z","submitted_at":"2025-07-04T02:25:10Z","title":"MoDA: Multi-modal Diffusion Architecture for Talking Head Generation","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T20:23:36.635274Z"},"links":{"cited_paper":"/paper/2410.07718","citing_paper":"/paper/2507.03256"},"observation_digest":"sha256:d45dc564279e1a6d98b965db6573e8170a59aef46bd5b3559ebf3e0eb27ddce4","observation_id":"cec8a8b6-10be-41a7-9d75-4004084d69cc","resolution":{"observed_at":"2026-08-06T20:23:36.635274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07718","last_updated":"2024-10-14T13:35:17Z","snapshot_observed_at":"2026-08-05T03:23:39.587839Z","submitted_at":"2024-10-10T08:34:41Z","title":"Hallo2: Long-Duration and High-Resolution Audio-Driven Portrait Image Animation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07718","snapshot_observed_at":"2026-08-06T13:37:09.496598Z","title":"Hallo2: Long-Duration and High-Resolution Audio- Driven Portrait Image Animation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20368","last_updated":"2025-07-27T17:53:00Z","snapshot_observed_at":"2026-08-07T20:50:14.751272Z","submitted_at":"2025-07-27T17:53:00Z","title":"MagicAnime: A Hierarchically Annotated, Multimodal and Multitasking Dataset with Benchmarks for Cartoon Animation Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T13:37:09.496598Z"},"links":{"cited_paper":"/paper/2410.07718","citing_paper":"/paper/2507.20368"},"observation_digest":"sha256:7e5e79e63320f4859d248514a4f2bffe36824e10ba76fed001dc88e14c0fca7b","observation_id":"a7b439a7-1d1e-4ba2-b41d-1aee06fb9b23","resolution":{"observed_at":"2026-08-06T13:37:09.496598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07718","last_updated":"2024-10-14T13:35:17Z","snapshot_observed_at":"2026-08-05T03:23:39.587839Z","submitted_at":"2024-10-10T08:34:41Z","title":"Hallo2: Long-Duration and High-Resolution Audio-Driven Portrait Image Animation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07718","snapshot_observed_at":"2026-08-06T13:07:28.271561Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20987","last_updated":"2025-07-29T04:13:25Z","snapshot_observed_at":"2026-08-08T08:14:38.727576Z","submitted_at":"2025-07-28T16:47:44Z","title":"JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:28.271561Z"},"links":{"cited_paper":"/paper/2410.07718","citing_paper":"/paper/2507.20987"},"observation_digest":"sha256:7848340d38a51705b4afe07b702d73a2bca8c8f8758ec8782f71889f15c5ed33","observation_id":"9ba859d9-ee81-4060-baff-24242d4ea042","resolution":{"observed_at":"2026-08-06T13:07:28.271561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07718","last_updated":"2024-10-14T13:35:17Z","snapshot_observed_at":"2026-08-05T03:23:39.587839Z","submitted_at":"2024-10-10T08:34:41Z","title":"Hallo2: Long-Duration and High-Resolution Audio-Driven Portrait Image Animation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07718","snapshot_observed_at":"2026-08-06T04:46:04.054306Z","title":"Hallo2: Long-duration and high-resolution audio-driven portrait image animation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.03050","last_updated":"2025-08-05T03:54:18Z","snapshot_observed_at":"2026-08-08T04:36:40.339708Z","submitted_at":"2025-08-05T03:54:18Z","title":"Multi-human Interactive Talking Dataset","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T04:46:04.054306Z"},"links":{"cited_paper":"/paper/2410.07718","citing_paper":"/paper/2508.03050"},"observation_digest":"sha256:6bcb0a9feb474e7b44228d00b169b8761c787db072a184749419fd454a508200","observation_id":"6e201cba-1307-4505-960c-56ce975e0a70","resolution":{"observed_at":"2026-08-06T04:46:04.054306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07718","last_updated":"2024-10-14T13:35:17Z","snapshot_observed_at":"2026-08-05T03:23:39.587839Z","submitted_at":"2024-10-10T08:34:41Z","title":"Hallo2: Long-Duration and High-Resolution Audio-Driven Portrait Image Animation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07718","snapshot_observed_at":"2026-08-05T22:04:35.524525Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07603","last_updated":"2025-08-11T04:13:32Z","snapshot_observed_at":"2026-08-05T22:04:28.461734Z","submitted_at":"2025-08-11T04:13:32Z","title":"LaVieID: Local Autoregressive Diffusion Transformers for Identity-Preserving Video Creation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T22:04:35.524525Z"},"links":{"cited_paper":"/paper/2410.07718","citing_paper":"/paper/2508.07603"},"observation_digest":"sha256:24c6f03071d70609baf00bc4711ec4da656630eb08e0739dea7d7df4892c805c","observation_id":"9f083c3b-e679-4d2b-a94e-7e0b14ac67c1","resolution":{"observed_at":"2026-08-05T22:04:35.524525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07718","last_updated":"2024-10-14T13:35:17Z","snapshot_observed_at":"2026-08-05T03:23:39.587839Z","submitted_at":"2024-10-10T08:34:41Z","title":"Hallo2: Long-Duration and High-Resolution Audio-Driven Portrait Image Animation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07718","snapshot_observed_at":"2026-08-05T21:24:05.595256Z","title":"Hallo2: Long-duration and high-resolution audio-driven portrait im- age animation.arXiv preprint arXiv:2410.07718, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.08891","last_updated":"2025-08-12T12:25:56Z","snapshot_observed_at":"2026-08-07T05:22:38.697912Z","submitted_at":"2025-08-12T12:25:56Z","title":"Preview WB-DH: Towards Whole Body Digital Human Bench for the Generation of Whole-body Talking Avatar Videos","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T21:24:05.595256Z"},"links":{"cited_paper":"/paper/2410.07718","citing_paper":"/paper/2508.08891"},"observation_digest":"sha256:7165bb1a33d0c56584c97720c03da05b1d2551ddc85b308bb121727b40691396","observation_id":"9d7248bf-9fae-4233-a7e6-de05a57562a0","resolution":{"observed_at":"2026-08-05T21:24:05.595256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07718","last_updated":"2024-10-14T13:35:17Z","snapshot_observed_at":"2026-08-05T03:23:39.587839Z","submitted_at":"2024-10-10T08:34:41Z","title":"Hallo2: Long-Duration and High-Resolution Audio-Driven Portrait Image Animation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07718","snapshot_observed_at":"2026-08-05T20:59:03.295020Z","title":"Hallo2: Long-duration and high-resolution audio-driven portrait im- age animation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.09631","last_updated":"2025-08-13T09:06:59Z","snapshot_observed_at":"2026-08-05T20:58:59.951103Z","submitted_at":"2025-08-13T09:06:59Z","title":"AmbiGraph-Eval: Can LLMs Effectively Handle Ambiguous Graph Queries?","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T20:59:03.295020Z"},"links":{"cited_paper":"/paper/2410.07718","citing_paper":"/paper/2508.09631"},"observation_digest":"sha256:df9268de819aad4c96d3c5424f7a7a8d7faf63806c336e3d9e57530de824b077","observation_id":"46f63307-f076-434f-bf9f-f48a8a94d3b3","resolution":{"observed_at":"2026-08-05T20:59:03.295020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07718","last_updated":"2024-10-14T13:35:17Z","snapshot_observed_at":"2026-08-05T03:23:39.587839Z","submitted_at":"2024-10-10T08:34:41Z","title":"Hallo2: Long-Duration and High-Resolution Audio-Driven Portrait Image Animation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07718","snapshot_observed_at":"2026-08-05T19:07:35.245952Z","title":"Hallo2: Long-duration and high-resolution audio-driven portrait image animation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.13442","last_updated":"2025-08-19T01:55:25Z","snapshot_observed_at":"2026-08-07T21:53:25.249431Z","submitted_at":"2025-08-19T01:55:25Z","title":"EDTalk++: Full Disentanglement for Controllable Talking Head Synthesis","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-05T19:07:35.245952Z"},"links":{"cited_paper":"/paper/2410.07718","citing_paper":"/paper/2508.13442"},"observation_digest":"sha256:71b00f3b04144f38dae86b434902e50f15969bae3e27096b159ab8342626b813","observation_id":"7fe0c64d-6286-45f3-9383-cf10ce733cd4","resolution":{"observed_at":"2026-08-05T19:07:35.245952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07718","last_updated":"2024-10-14T13:35:17Z","snapshot_observed_at":"2026-08-05T03:23:39.587839Z","submitted_at":"2024-10-10T08:34:41Z","title":"Hallo2: Long-Duration and High-Resolution Audio-Driven Portrait Image Animation","version":2},"cited_work":{"arxiv_id":"2410.07718","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.07718","snapshot_observed_at":"2026-07-01T21:46:15.594455Z","title":"Hallo2: Long-Duration and High-Resolution Audio-Driven Portrait Image Animation","venue":null,"work_id":"a36f46e1-e536-4499-b2bc-ed760196c9cf","year":2024},"citing_paper":{"arxiv_id":"2509.12052","last_updated":"2026-04-20T18:20:15Z","snapshot_observed_at":"2026-07-06T22:29:58.066459Z","submitted_at":"2025-09-15T15:34:02Z","title":"FluentAvatar: Flicker-Free Talking-Head Animation via Phoneme-Guided Autoregressive Modeling","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-18T16:42:25.803856Z"},"links":{"cited_paper":"/paper/2410.07718","citing_paper":"/paper/2509.12052"},"observation_digest":"sha256:c4d9094c649a57a5f1f2ff88037c8c861976de6bda48ecbdc6b3d58b924c0c3b","observation_id":"9609bc2f-afc8-4286-a2df-7655518844d9","resolution":{"observed_at":"2026-05-18T16:42:43.835012Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07718","last_updated":"2024-10-14T13:35:17Z","snapshot_observed_at":"2026-08-05T03:23:39.587839Z","submitted_at":"2024-10-10T08:34:41Z","title":"Hallo2: Long-Duration and High-Resolution Audio-Driven Portrait Image Animation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07718","snapshot_observed_at":"2026-08-03T16:30:32.718987Z","title":"Hallo2: Long-duration and high-resolution audio-driven portrait im- age animation.arXiv preprint arXiv:2410.07718, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.13247","last_updated":"2026-07-17T19:41:30Z","snapshot_observed_at":"2026-08-07T23:01:22.712955Z","submitted_at":"2025-12-15T11:59:01Z","title":"STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T16:30:32.718987Z"},"links":{"cited_paper":"/paper/2410.07718","citing_paper":"/paper/2512.13247"},"observation_digest":"sha256:4002253fd0fe5d4d7931c10a84e8970376dc5aef36d977ddb2e4caeddb92e2dd","observation_id":"0b127765-b937-43a6-9ef4-c84c1a3a5510","resolution":{"observed_at":"2026-08-03T16:30:32.718987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07718","last_updated":"2024-10-14T13:35:17Z","snapshot_observed_at":"2026-08-05T03:23:39.587839Z","submitted_at":"2024-10-10T08:34:41Z","title":"Hallo2: Long-Duration and High-Resolution Audio-Driven Portrait Image Animation","version":2},"cited_work":{"arxiv_id":"2410.07718","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.07718","snapshot_observed_at":"2026-07-01T21:46:15.594455Z","title":"Hallo2: Long-Duration and High-Resolution Audio-Driven Portrait Image Animation","venue":null,"work_id":"a36f46e1-e536-4499-b2bc-ed760196c9cf","year":2024},"citing_paper":{"arxiv_id":"2604.08405","last_updated":"2026-07-30T09:16:54Z","snapshot_observed_at":"2026-08-03T01:34:12.626353Z","submitted_at":"2026-04-09T16:03:24Z","title":"SyncBreaker:Stage-Aware Multimodal Adversarial Attacks on Audio-Driven Talking Head Generation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T17:30:36.462567Z"},"links":{"cited_paper":"/paper/2410.07718","citing_paper":"/paper/2604.08405"},"observation_digest":"sha256:81df33d824b03de10474cfd3a0e1a4bb377fa6348578521b6fffbdce9b75f7f1","observation_id":"ae42507f-bdfc-4b0b-bbe1-d07c187da44e","resolution":{"observed_at":"2026-05-11T06:41:26.836265Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07718","last_updated":"2024-10-14T13:35:17Z","snapshot_observed_at":"2026-08-05T03:23:39.587839Z","submitted_at":"2024-10-10T08:34:41Z","title":"Hallo2: Long-Duration and High-Resolution Audio-Driven Portrait Image Animation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07718","snapshot_observed_at":"2026-08-02T16:38:16.042209Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.08405","last_updated":"2026-07-30T09:16:54Z","snapshot_observed_at":"2026-08-03T01:34:12.626353Z","submitted_at":"2026-04-09T16:03:24Z","title":"SyncBreaker:Stage-Aware Multimodal Adversarial Attacks on Audio-Driven Talking Head Generation","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T16:38:16.042209Z"},"links":{"cited_paper":"/paper/2410.07718","citing_paper":"/paper/2604.08405"},"observation_digest":"sha256:a394d7cd6a4d702f53c8a4466a2db6dc3a04da3b10dcc479e9678d46cdf509c7","observation_id":"a82d69aa-9a65-4f55-8e25-a7a934cdff73","resolution":{"observed_at":"2026-08-02T16:38:16.042209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07718","last_updated":"2024-10-14T13:35:17Z","snapshot_observed_at":"2026-08-05T03:23:39.587839Z","submitted_at":"2024-10-10T08:34:41Z","title":"Hallo2: Long-Duration and High-Resolution Audio-Driven Portrait Image Animation","version":2},"cited_work":{"arxiv_id":"2410.07718","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.07718","snapshot_observed_at":"2026-07-01T21:46:15.594455Z","title":"Hallo2: Long-Duration and High-Resolution Audio-Driven Portrait Image Animation","venue":null,"work_id":"a36f46e1-e536-4499-b2bc-ed760196c9cf","year":2024},"citing_paper":{"arxiv_id":"2604.22865","last_updated":"2026-04-23T09:01:27Z","snapshot_observed_at":"2026-07-06T23:09:10.050398Z","submitted_at":"2026-04-23T09:01:27Z","title":"MeshLAM: Feed-Forward One-Shot Animatable Textured Mesh Avatar Reconstruction","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-09T22:06:58.480052Z"},"links":{"cited_paper":"/paper/2410.07718","citing_paper":"/paper/2604.22865"},"observation_digest":"sha256:87b4d7bb1ae45085bb67f51e8916d6efcff1aac8813529499854900621685331","observation_id":"811af94f-3d20-4d2a-83f4-1265b283c766","resolution":{"observed_at":"2026-05-11T14:16:28.578744Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07718","last_updated":"2024-10-14T13:35:17Z","snapshot_observed_at":"2026-08-05T03:23:39.587839Z","submitted_at":"2024-10-10T08:34:41Z","title":"Hallo2: Long-Duration and High-Resolution Audio-Driven Portrait Image Animation","version":2},"cited_work":{"arxiv_id":"2410.07718","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.07718","snapshot_observed_at":"2026-07-01T21:46:15.594455Z","title":"Hallo2: Long-Duration and High-Resolution Audio-Driven Portrait Image Animation","venue":null,"work_id":"a36f46e1-e536-4499-b2bc-ed760196c9cf","year":2024},"citing_paper":{"arxiv_id":"2604.23325","last_updated":"2026-04-25T14:29:58Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T14:29:58Z","title":"EAD-Net: Emotion-Aware Talking Head Generation with Spatial Refinement and Temporal Coherence","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-08T08:27:41.839123Z"},"links":{"cited_paper":"/paper/2410.07718","citing_paper":"/paper/2604.23325"},"observation_digest":"sha256:d95f7d70db6391373be05d0e02ca703b9b236a722e73a0ac2aa22f0acf6cef4e","observation_id":"c1750b6d-025e-4cae-9526-91bc8104f0bd","resolution":{"observed_at":"2026-05-11T20:36:11.198187Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07718","last_updated":"2024-10-14T13:35:17Z","snapshot_observed_at":"2026-08-05T03:23:39.587839Z","submitted_at":"2024-10-10T08:34:41Z","title":"Hallo2: Long-Duration and High-Resolution Audio-Driven Portrait Image Animation","version":2},"cited_work":{"arxiv_id":"2410.07718","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.07718","snapshot_observed_at":"2026-07-01T21:46:15.594455Z","title":"Hallo2: Long-Duration and High-Resolution Audio-Driven Portrait Image Animation","venue":null,"work_id":"a36f46e1-e536-4499-b2bc-ed760196c9cf","year":2024},"citing_paper":{"arxiv_id":"2604.23586","last_updated":"2026-08-04T09:15:37Z","snapshot_observed_at":"2026-08-07T23:09:24.588848Z","submitted_at":"2026-04-26T07:48:47Z","title":"Talker-T2AV: Joint Talking Audio-Video Generation with Autoregressive Diffusion Modeling","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-08T06:44:36.000353Z"},"links":{"cited_paper":"/paper/2410.07718","citing_paper":"/paper/2604.23586"},"observation_digest":"sha256:7c634f57d57f52965d6ca9d141b57664b856278790d77fb2de3785c53f2f66d1","observation_id":"6e8726f5-ca6b-4469-bbdd-86eb19d08c1c","resolution":{"observed_at":"2026-05-11T21:06:14.180854Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07718","last_updated":"2024-10-14T13:35:17Z","snapshot_observed_at":"2026-08-05T03:23:39.587839Z","submitted_at":"2024-10-10T08:34:41Z","title":"Hallo2: Long-Duration and High-Resolution Audio-Driven Portrait Image Animation","version":2},"cited_work":{"arxiv_id":"2410.07718","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.07718","snapshot_observed_at":"2026-07-01T21:46:15.594455Z","title":"Hallo2: Long-Duration and High-Resolution Audio-Driven Portrait Image Animation","venue":null,"work_id":"a36f46e1-e536-4499-b2bc-ed760196c9cf","year":2024},"citing_paper":{"arxiv_id":"2604.23632","last_updated":"2026-04-26T09:46:58Z","snapshot_observed_at":"2026-07-06T23:09:48.137856Z","submitted_at":"2026-04-26T09:46:58Z","title":"Hallo-Live: Real-Time Streaming Joint Audio-Video Avatar Generation with Asynchronous Dual-Stream and Human-Centric Preference Distillation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-08T06:56:19.795651Z"},"links":{"cited_paper":"/paper/2410.07718","citing_paper":"/paper/2604.23632"},"observation_digest":"sha256:0ebd1e173fabe2578c6735cbb874854c747f3892157e4963bcc82e912433c99d","observation_id":"b82dc350-6589-4fd9-ae47-fee333ec6da1","resolution":{"observed_at":"2026-05-11T21:06:12.812027Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07718","last_updated":"2024-10-14T13:35:17Z","snapshot_observed_at":"2026-08-05T03:23:39.587839Z","submitted_at":"2024-10-10T08:34:41Z","title":"Hallo2: Long-Duration and High-Resolution Audio-Driven Portrait Image Animation","version":2},"cited_work":{"arxiv_id":"2410.07718","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.07718","snapshot_observed_at":"2026-07-01T21:46:15.594455Z","title":"Hallo2: Long-Duration and High-Resolution Audio-Driven Portrait Image Animation","venue":null,"work_id":"a36f46e1-e536-4499-b2bc-ed760196c9cf","year":2024},"citing_paper":{"arxiv_id":"2605.02948","last_updated":"2026-05-11T03:04:55Z","snapshot_observed_at":"2026-08-08T22:18:14.048236Z","submitted_at":"2026-05-01T16:38:06Z","title":"AsymTalker: Identity-Consistent Long-Term Talking Head Generation via Asymmetric Distillation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-09T20:19:39.565157Z"},"links":{"cited_paper":"/paper/2410.07718","citing_paper":"/paper/2605.02948"},"observation_digest":"sha256:bbf8dcaaddaba11b9a9552e7f8a59e594100578f854953aecc984582a16b4e7f","observation_id":"2fe91509-114e-4f7b-b718-75bea44c002c","resolution":{"observed_at":"2026-05-11T15:16:11.446098Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07718","last_updated":"2024-10-14T13:35:17Z","snapshot_observed_at":"2026-08-05T03:23:39.587839Z","submitted_at":"2024-10-10T08:34:41Z","title":"Hallo2: Long-Duration and High-Resolution Audio-Driven Portrait Image Animation","version":2},"cited_work":{"arxiv_id":"2410.07718","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.07718","snapshot_observed_at":"2026-07-01T21:46:15.594455Z","title":"Hallo2: Long-Duration and High-Resolution Audio-Driven Portrait Image Animation","venue":null,"work_id":"a36f46e1-e536-4499-b2bc-ed760196c9cf","year":2024},"citing_paper":{"arxiv_id":"2605.02948","last_updated":"2026-05-11T03:04:55Z","snapshot_observed_at":"2026-08-08T22:18:14.048236Z","submitted_at":"2026-05-01T16:38:06Z","title":"AsymTalker: Identity-Consistent Long-Term Talking Head Generation via Asymmetric Distillation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-11T02:18:58.996355Z"},"links":{"cited_paper":"/paper/2410.07718","citing_paper":"/paper/2605.02948"},"observation_digest":"sha256:3242333724c080404b1bd8ea3d6f63f2c8e1d5b0ebf87d8754d22d1eaa669ad1","observation_id":"df2841fd-a245-42a7-889f-8565b1735a39","resolution":{"observed_at":"2026-05-11T03:45:57.382344Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07718","last_updated":"2024-10-14T13:35:17Z","snapshot_observed_at":"2026-08-05T03:23:39.587839Z","submitted_at":"2024-10-10T08:34:41Z","title":"Hallo2: Long-Duration and High-Resolution Audio-Driven Portrait Image Animation","version":2},"cited_work":{"arxiv_id":"2410.07718","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.07718","snapshot_observed_at":"2026-07-01T21:46:15.594455Z","title":"Hallo2: Long-Duration and High-Resolution Audio-Driven Portrait Image Animation","venue":null,"work_id":"a36f46e1-e536-4499-b2bc-ed760196c9cf","year":2024},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"cited_paper":"/paper/2410.07718","citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:658fc6f1118b0eeac75d4d07329daf2c96680b21544f9d3dd4c0c32fb00145b2","observation_id":"ae3e1715-0ae4-4eb5-ae40-1be6464048d9","resolution":{"observed_at":"2026-05-20T15:08:24.973274Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07718","last_updated":"2024-10-14T13:35:17Z","snapshot_observed_at":"2026-08-05T03:23:39.587839Z","submitted_at":"2024-10-10T08:34:41Z","title":"Hallo2: Long-Duration and High-Resolution Audio-Driven Portrait Image Animation","version":2},"cited_work":{"arxiv_id":"2410.07718","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.07718","snapshot_observed_at":"2026-07-01T21:46:15.594455Z","title":"Hallo2: Long-Duration and High-Resolution Audio-Driven Portrait Image Animation","venue":null,"work_id":"a36f46e1-e536-4499-b2bc-ed760196c9cf","year":2024},"citing_paper":{"arxiv_id":"2605.25488","last_updated":"2026-05-25T06:45:29Z","snapshot_observed_at":"2026-08-02T09:17:40.384654Z","submitted_at":"2026-05-25T06:45:29Z","title":"Test-Time Self-Adaptive Conditioning for Stable Audio-Driven Talking-Head Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-29T22:36:53.138354Z"},"links":{"cited_paper":"/paper/2410.07718","citing_paper":"/paper/2605.25488"},"observation_digest":"sha256:0b48aaab1098a2ebe3fc42472eb73110d5d140413f4d039f2ffb68a636704269","observation_id":"04324c47-4557-4776-a937-9738122cda53","resolution":{"observed_at":"2026-06-29T22:44:01.682150Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07718","last_updated":"2024-10-14T13:35:17Z","snapshot_observed_at":"2026-08-05T03:23:39.587839Z","submitted_at":"2024-10-10T08:34:41Z","title":"Hallo2: Long-Duration and High-Resolution Audio-Driven Portrait Image Animation","version":2},"cited_work":{"arxiv_id":"2410.07718","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.07718","snapshot_observed_at":"2026-07-01T21:46:15.594455Z","title":"Hallo2: Long-Duration and High-Resolution Audio-Driven Portrait Image Animation","venue":null,"work_id":"a36f46e1-e536-4499-b2bc-ed760196c9cf","year":2024},"citing_paper":{"arxiv_id":"2606.01031","last_updated":"2026-05-31T05:44:42Z","snapshot_observed_at":"2026-07-06T23:41:39.172310Z","submitted_at":"2026-05-31T05:44:42Z","title":"Temporally-Aligned Evaluation for Audio-Driven Talking Head Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-28T16:19:55.048831Z"},"links":{"cited_paper":"/paper/2410.07718","citing_paper":"/paper/2606.01031"},"observation_digest":"sha256:1463ecf66e361544a82c5dfc8423ca2c335a424c66f212c7644bd7e0b2416049","observation_id":"f94e1102-ae94-45f9-a924-002237519f39","resolution":{"observed_at":"2026-07-01T21:46:15.595923Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07718","last_updated":"2024-10-14T13:35:17Z","snapshot_observed_at":"2026-08-05T03:23:39.587839Z","submitted_at":"2024-10-10T08:34:41Z","title":"Hallo2: Long-Duration and High-Resolution Audio-Driven Portrait Image Animation","version":2},"cited_work":{"arxiv_id":"2410.07718","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.07718","snapshot_observed_at":"2026-07-01T21:46:15.594455Z","title":"Hallo2: Long-Duration and High-Resolution Audio-Driven Portrait Image Animation","venue":null,"work_id":"a36f46e1-e536-4499-b2bc-ed760196c9cf","year":2024},"citing_paper":{"arxiv_id":"2606.30019","last_updated":"2026-06-29T09:23:53Z","snapshot_observed_at":"2026-08-08T11:09:46.118421Z","submitted_at":"2026-06-29T09:23:53Z","title":"OmniDance: Multimodal Driven Dance Video Generation with Large-scale Internet Data","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-30T06:35:58.943585Z"},"links":{"cited_paper":"/paper/2410.07718","citing_paper":"/paper/2606.30019"},"observation_digest":"sha256:ab42a2de17d340b4b3878ef46badadcde211c0b92814864814173c383faab3b5","observation_id":"5ebf10fb-1614-4105-a973-0a5927c1d4d1","resolution":{"observed_at":"2026-06-30T06:44:19.601000Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07718","last_updated":"2024-10-14T13:35:17Z","snapshot_observed_at":"2026-08-05T03:23:39.587839Z","submitted_at":"2024-10-10T08:34:41Z","title":"Hallo2: Long-Duration and High-Resolution Audio-Driven Portrait Image Animation","version":2},"cited_work":{"arxiv_id":"2410.07718","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.07718","snapshot_observed_at":"2026-07-01T21:46:15.594455Z","title":"Hallo2: Long-Duration and High-Resolution Audio-Driven Portrait Image Animation","venue":null,"work_id":"a36f46e1-e536-4499-b2bc-ed760196c9cf","year":2024},"citing_paper":{"arxiv_id":"2606.31088","last_updated":"2026-07-29T10:27:50Z","snapshot_observed_at":"2026-08-02T09:27:54.270412Z","submitted_at":"2026-06-30T03:27:23Z","title":"Towards Flexible, Natural, Efficient Interaction for Conversational Talking Face Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-01T06:26:20.283349Z"},"links":{"cited_paper":"/paper/2410.07718","citing_paper":"/paper/2606.31088"},"observation_digest":"sha256:8af05a1ff61ff5582997609d4deff097bb184e9ef3eb09d047655be7bb38b637","observation_id":"0f139d01-4afd-452c-a170-dc951abaa70b","resolution":{"observed_at":"2026-07-01T09:35:40.322410Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07718","last_updated":"2024-10-14T13:35:17Z","snapshot_observed_at":"2026-08-05T03:23:39.587839Z","submitted_at":"2024-10-10T08:34:41Z","title":"Hallo2: Long-Duration and High-Resolution Audio-Driven Portrait Image Animation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07718","snapshot_observed_at":"2026-08-02T09:27:55.261808Z","title":"arXiv preprint arXiv:2410.07718 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.31088","last_updated":"2026-07-29T10:27:50Z","snapshot_observed_at":"2026-08-02T09:27:54.270412Z","submitted_at":"2026-06-30T03:27:23Z","title":"Towards Flexible, Natural, Efficient Interaction for Conversational Talking Face Generation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T09:27:55.261808Z"},"links":{"cited_paper":"/paper/2410.07718","citing_paper":"/paper/2606.31088"},"observation_digest":"sha256:53a3e31ac037e05c88e88229672530230627bcc36a67411953a24fc681a83927","observation_id":"e92832fa-9631-44af-a48d-dd43c8172355","resolution":{"observed_at":"2026-08-02T09:27:55.261808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07718","last_updated":"2024-10-14T13:35:17Z","snapshot_observed_at":"2026-08-05T03:23:39.587839Z","submitted_at":"2024-10-10T08:34:41Z","title":"Hallo2: Long-Duration and High-Resolution Audio-Driven Portrait Image Animation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07718","snapshot_observed_at":"2026-08-01T09:02:19.214740Z","title":"Hallo2: Long-duration and high-resolution audio-driven portrait image animation.arXiv preprint arXiv:2410.07718, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20922","last_updated":"2026-07-23T04:57:22Z","snapshot_observed_at":"2026-08-07T13:16:14.837746Z","submitted_at":"2026-07-23T04:57:22Z","title":"FA-LAM: Focus-Aware Large Avatar Model for One-Shot 4D Animatable Gaussian Head","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T09:02:19.214740Z"},"links":{"cited_paper":"/paper/2410.07718","citing_paper":"/paper/2607.20922"},"observation_digest":"sha256:f93abf6de8a0617ed3f4207299713a1e24697c65fc22d78badb6209dd48b1390","observation_id":"73216a48-287c-4f7c-90d1-e3f5260b229a","resolution":{"observed_at":"2026-08-01T09:02:19.214740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07718","last_updated":"2024-10-14T13:35:17Z","snapshot_observed_at":"2026-08-05T03:23:39.587839Z","submitted_at":"2024-10-10T08:34:41Z","title":"Hallo2: Long-Duration and High-Resolution Audio-Driven Portrait Image Animation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07718","snapshot_observed_at":"2026-08-04T17:26:50.715253Z","title":"arXiv preprint arXiv:2410.07718 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01978","last_updated":"2026-08-03T09:41:59Z","snapshot_observed_at":"2026-08-07T15:34:09.476468Z","submitted_at":"2026-08-03T09:41:59Z","title":"Proxy Avatar Meets Low-Rank Caching: Real-Time One-Shot Emotion-Controllable Portrait Animation","version":1},"reference_index":109,"source":"arxiv_source","source_observed_at":"2026-08-04T17:26:50.715253Z"},"links":{"cited_paper":"/paper/2410.07718","citing_paper":"/paper/2608.01978"},"observation_digest":"sha256:5868ae82aa9877922353a1b714b4e1d05d294ec5ca74a05cf99e727831547ef3","observation_id":"3b449691-410d-4e27-a27a-9c37f1d6f9d1","resolution":{"observed_at":"2026-08-04T17:26:50.715253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2410.07718/citation-record","integrity":"/paper/2410.07718/integrity","json":"/paper/2410.07718/citation-record.json","paper":"/paper/2410.07718"},"outbound":[],"paper":{"arxiv_id":"2410.07718","last_updated":"2024-10-14T13:35:17Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-05T03:23:39.587839Z","submitted_at":"2024-10-10T08:34:41Z","title":"Hallo2: Long-Duration and High-Resolution Audio-Driven Portrait Image Animation"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 32 inbound Pith citation observations for arXiv:2410.07718."}