{"as_of":"2026-08-17T18:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:93f0d6b2760a9ab9abefc4ce7c0611d40626a9d785c0db9d8e89f8d5bd2ed2ea","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:18:27.810835Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T06:45:49.611770Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-17T01:58:51.404766Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.05806","last_updated":"2025-06-06T07:09:07Z","snapshot_observed_at":"2026-08-07T20:50:54.524255Z","submitted_at":"2025-06-06T07:09:07Z","title":"LLIA -- Enabling Low-Latency Interactive Avatars: Real-Time Audio-Driven Portrait Video Generation with Diffusion Models","version":1},"cited_work":{"arxiv_id":"2506.05806","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05806","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llia–enabling low-latency interactive avatars: Real-time audio-driven portrait video generation with diffusion models","venue":null,"work_id":"94be5fa7-10f4-4d43-b623-37373f210233","year":2025},"citing_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-13T11:03:16.956715Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":5},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-17T01:56:44.123092Z"},"links":{"cited_paper":"/paper/2506.05806","citing_paper":"/paper/2512.04677"},"observation_digest":"sha256:ebf9e756e60f072a208a32d09a79d0f152eb97cd9b5aa724589d960046da4e86","observation_id":"d188d4fa-de9f-4e3e-9ba6-660af4482247","resolution":{"observed_at":"2026-05-17T01:58:51.407987Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05806","last_updated":"2025-06-06T07:09:07Z","snapshot_observed_at":"2026-08-07T20:50:54.524255Z","submitted_at":"2025-06-06T07:09:07Z","title":"LLIA -- Enabling Low-Latency Interactive Avatars: Real-Time Audio-Driven Portrait Video Generation with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05806","snapshot_observed_at":"2026-08-03T18:39:43.646679Z","title":"Llia–enabling low-latency interactive avatars: Real-time audio-driven portrait video generation with diffusion models.arXiv preprint arXiv:2506.05806, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-13T11:03:16.956715Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":6},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-03T18:39:43.646679Z"},"links":{"cited_paper":"/paper/2506.05806","citing_paper":"/paper/2512.04677"},"observation_digest":"sha256:546b55992eef4a74bac935ca8178f094a546eedc8077c17e4e7b926d29cf4c96","observation_id":"fb09a11e-2136-4d79-978a-df66026497ea","resolution":{"observed_at":"2026-08-03T18:39:43.646679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05806","last_updated":"2025-06-06T07:09:07Z","snapshot_observed_at":"2026-08-07T20:50:54.524255Z","submitted_at":"2025-06-06T07:09:07Z","title":"LLIA -- Enabling Low-Latency Interactive Avatars: Real-Time Audio-Driven Portrait Video Generation with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05806","snapshot_observed_at":"2026-08-04T06:45:49.611770Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02474","last_updated":"2026-08-12T03:12:13Z","snapshot_observed_at":"2026-08-15T23:09:36.449539Z","submitted_at":"2026-08-03T16:42:54Z","title":"EchoCache: Energy-Guided Cross-Modal Caching for Efficient Audio-Driven Video Generation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-04T06:45:49.611770Z"},"links":{"cited_paper":"/paper/2506.05806","citing_paper":"/paper/2608.02474"},"observation_digest":"sha256:33bcbc6bde12279e5bea202a1e574de25645d6e09f2d7f6be3307b476cec44d7","observation_id":"72ceac6e-82b4-470d-b963-349472f310d9","resolution":{"observed_at":"2026-08-04T06:45:49.611770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.05806/citation-record","integrity":"/paper/2506.05806/integrity","json":"/paper/2506.05806/citation-record.json","paper":"/paper/2506.05806"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:23.196349Z","title":"A lip sync expert is all you need for speech to lip generation in the wild","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.05806","last_updated":"2025-06-06T07:09:07Z","snapshot_observed_at":"2026-08-07T20:50:54.524255Z","submitted_at":"2025-06-06T07:09:07Z","title":"LLIA -- Enabling Low-Latency Interactive Avatars: Real-Time Audio-Driven Portrait Video Generation with Diffusion Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:23.196349Z"},"links":{"citing_paper":"/paper/2506.05806"},"observation_digest":"sha256:83afde7b27b89826930c2003d1c12626cc64cf4428db1638923e565d1dc718b0","observation_id":"ca17bc80-f60d-4a04-98ef-1412b9481454","resolution":{"observed_at":"2026-08-07T10:18:23.196349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:23.303790Z","title":"Emo: Emote portrait alive generating expressive portrait videos with audio2video diffusion model under weak conditions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05806","last_updated":"2025-06-06T07:09:07Z","snapshot_observed_at":"2026-08-07T20:50:54.524255Z","submitted_at":"2025-06-06T07:09:07Z","title":"LLIA -- Enabling Low-Latency Interactive Avatars: Real-Time Audio-Driven Portrait Video Generation with Diffusion Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:23.303790Z"},"links":{"citing_paper":"/paper/2506.05806"},"observation_digest":"sha256:752c25bb02d3c03a8050f1ca7a76a4a22f5f24a91871e50e6e850ec0ca7998ab","observation_id":"414366dc-3bdd-410c-bb28-36aa5f59796e","resolution":{"observed_at":"2026-08-07T10:18:23.303790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:23.353953Z","title":"Vasa-1: Lifelike audio-driven talking faces generated in real time.Advances in Neural Information Processing Systems, 37:660–684, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05806","last_updated":"2025-06-06T07:09:07Z","snapshot_observed_at":"2026-08-07T20:50:54.524255Z","submitted_at":"2025-06-06T07:09:07Z","title":"LLIA -- Enabling Low-Latency Interactive Avatars: Real-Time Audio-Driven Portrait Video Generation with Diffusion Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:23.353953Z"},"links":{"citing_paper":"/paper/2506.05806"},"observation_digest":"sha256:a67973c846b949a7811da66a4e403b9d9bcf8f13aee4134cbc8e08797901aa21","observation_id":"f43dcb10-69d6-49e7-bdeb-7d8b0775adde","resolution":{"observed_at":"2026-08-07T10:18:23.353953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:29.618673Z","title":"Sadtalker: Learning realistic 3d motion coefficients for stylized audio-driven single image talking face animation","venue":null,"work_id":"2b0572b2-3675-44d9-a4d1-50ca13e90cc2","year":2023},"citing_paper":{"arxiv_id":"2506.05806","last_updated":"2025-06-06T07:09:07Z","snapshot_observed_at":"2026-08-07T20:50:54.524255Z","submitted_at":"2025-06-06T07:09:07Z","title":"LLIA -- Enabling Low-Latency Interactive Avatars: Real-Time Audio-Driven Portrait Video Generation with Diffusion Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:23.468957Z"},"links":{"citing_paper":"/paper/2506.05806"},"observation_digest":"sha256:3c50b190b7a501dd6f97a3b2f8d98b8d08bc34a2276e2d060086fdf0236ed1bf","observation_id":"bff6e7e8-659e-4164-a4ff-5516565eb2fe","resolution":{"observed_at":"2026-08-07T10:18:29.735534Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-08-11T15:38:14.931716Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-07T10:18:23.581989Z","title":"Denoising diffusion implicit models.arXiv preprint arXiv:2010.02502, 2020","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.05806","last_updated":"2025-06-06T07:09:07Z","snapshot_observed_at":"2026-08-07T20:50:54.524255Z","submitted_at":"2025-06-06T07:09:07Z","title":"LLIA -- Enabling Low-Latency Interactive Avatars: Real-Time Audio-Driven Portrait Video Generation with Diffusion Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:23.581989Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2506.05806"},"observation_digest":"sha256:95822112f35f5d2b9fe01fdde8c9612cd8dd71f5b9a36f284a8177b6109259d8","observation_id":"67a55ddd-daf9-4f89-b61c-93d999784cdc","resolution":{"observed_at":"2026-08-07T10:18:23.581989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:23.702045Z","title":"Denoising diffusion probabilistic models.Advances in neural information processing systems, 33:6840–6851, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.05806","last_updated":"2025-06-06T07:09:07Z","snapshot_observed_at":"2026-08-07T20:50:54.524255Z","submitted_at":"2025-06-06T07:09:07Z","title":"LLIA -- Enabling Low-Latency Interactive Avatars: Real-Time Audio-Driven Portrait Video Generation with Diffusion Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:23.702045Z"},"links":{"citing_paper":"/paper/2506.05806"},"observation_digest":"sha256:4070e21424d3d5d11025350ae46728d9e29cad9927153fa9d0a74dba7b82f138","observation_id":"c55c8c15-75b7-4eff-bc7f-ef6a04219bd3","resolution":{"observed_at":"2026-08-07T10:18:23.702045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-07T10:18:23.849703Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets.arXiv preprint arXiv:2311.15127, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05806","last_updated":"2025-06-06T07:09:07Z","snapshot_observed_at":"2026-08-07T20:50:54.524255Z","submitted_at":"2025-06-06T07:09:07Z","title":"LLIA -- Enabling Low-Latency Interactive Avatars: Real-Time Audio-Driven Portrait Video Generation with Diffusion Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:23.849703Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2506.05806"},"observation_digest":"sha256:3de393a9cd1e289a406d56f2a0607de6afe95414f08211b83e4ab00d119dcb68","observation_id":"3dd28e69-e6fd-4311-9756-8f0bc0ac0d65","resolution":{"observed_at":"2026-08-07T10:18:23.849703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:29.384683Z","title":"Megaportraits: One-shot megapixel neural head avatars","venue":null,"work_id":"be0f7b03-3285-4533-8d82-118d2d0305d4","year":2022},"citing_paper":{"arxiv_id":"2506.05806","last_updated":"2025-06-06T07:09:07Z","snapshot_observed_at":"2026-08-07T20:50:54.524255Z","submitted_at":"2025-06-06T07:09:07Z","title":"LLIA -- Enabling Low-Latency Interactive Avatars: Real-Time Audio-Driven Portrait Video Generation with Diffusion Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:23.901840Z"},"links":{"citing_paper":"/paper/2506.05806"},"observation_digest":"sha256:d0080572ed9eaa285c5e201e7fe59d7cb1d42732c6ea693cb60119db9be1ecdf","observation_id":"7d26a6e7-3c58-4ad6-a627-9edd312330b6","resolution":{"observed_at":"2026-08-07T10:18:29.479575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04037","last_updated":"2024-12-05T10:20:34Z","snapshot_observed_at":"2026-08-17T16:29:09.905221Z","submitted_at":"2024-12-05T10:20:34Z","title":"INFP: Audio-Driven Interactive Head Generation in Dyadic Conversations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04037","snapshot_observed_at":"2026-08-07T10:18:23.943246Z","title":"Infp: Audio-driven interactive head generation in dyadic conversations.arXiv preprint arXiv:2412.04037, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05806","last_updated":"2025-06-06T07:09:07Z","snapshot_observed_at":"2026-08-07T20:50:54.524255Z","submitted_at":"2025-06-06T07:09:07Z","title":"LLIA -- Enabling Low-Latency Interactive Avatars: Real-Time Audio-Driven Portrait Video Generation with Diffusion Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:23.943246Z"},"links":{"cited_paper":"/paper/2412.04037","citing_paper":"/paper/2506.05806"},"observation_digest":"sha256:8d86d3e99bc84b301677ceb765b728712d3eb5b908c06c11e65076b52b2cdc2c","observation_id":"bc068e31-25cc-4c12-bd41-c1c26721d8de","resolution":{"observed_at":"2026-08-07T10:18:23.943246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:24.000147Z","title":"Echomimic: Lifelike audio-driven portrait animations through editable landmark conditions","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05806","last_updated":"2025-06-06T07:09:07Z","snapshot_observed_at":"2026-08-07T20:50:54.524255Z","submitted_at":"2025-06-06T07:09:07Z","title":"LLIA -- Enabling Low-Latency Interactive Avatars: Real-Time Audio-Driven Portrait Video Generation with Diffusion Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:24.000147Z"},"links":{"citing_paper":"/paper/2506.05806"},"observation_digest":"sha256:d0982bad7a7610ee4892dc47f453ba784893095fcbb610ed918fd3e4a5b9fd58","observation_id":"81f47936-4d82-4270-8276-134aa87531d0","resolution":{"observed_at":"2026-08-07T10:18:24.000147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08801","last_updated":"2024-06-16T07:10:41Z","snapshot_observed_at":"2026-08-16T13:43:29.827089Z","submitted_at":"2024-06-13T04:33:20Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08801","snapshot_observed_at":"2026-08-07T10:18:24.119456Z","title":"Hallo: Hierarchical audio-driven visual synthesis for portrait image animation.arXiv preprint arXiv:2406.08801, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05806","last_updated":"2025-06-06T07:09:07Z","snapshot_observed_at":"2026-08-07T20:50:54.524255Z","submitted_at":"2025-06-06T07:09:07Z","title":"LLIA -- Enabling Low-Latency Interactive Avatars: Real-Time Audio-Driven Portrait Video Generation with Diffusion Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:24.119456Z"},"links":{"cited_paper":"/paper/2406.08801","citing_paper":"/paper/2506.05806"},"observation_digest":"sha256:496e56f389d495c7eebb2ee85774df25d45f568bcf5d62c3d5e6baa9fb85b093","observation_id":"ddb92de9-fd10-43c3-beb7-8a690711cdf2","resolution":{"observed_at":"2026-08-07T10:18:24.119456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07718","last_updated":"2024-10-14T13:35:17Z","snapshot_observed_at":"2026-08-17T16:29:54.166371Z","submitted_at":"2024-10-10T08:34:41Z","title":"Hallo2: Long-Duration and High-Resolution Audio-Driven Portrait Image Animation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07718","snapshot_observed_at":"2026-08-07T10:18:24.230525Z","title":"Hallo2: Long-duration and high-resolution audio-driven portrait image animation.arXiv preprint arXiv:2410.07718, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05806","last_updated":"2025-06-06T07:09:07Z","snapshot_observed_at":"2026-08-07T20:50:54.524255Z","submitted_at":"2025-06-06T07:09:07Z","title":"LLIA -- Enabling Low-Latency Interactive Avatars: Real-Time Audio-Driven Portrait Video Generation with Diffusion Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:24.230525Z"},"links":{"cited_paper":"/paper/2410.07718","citing_paper":"/paper/2506.05806"},"observation_digest":"sha256:c4b3e315e2c765f704999106bdc37935fe02919c8934f6445dc4a079d38dfdbd","observation_id":"be5e88b4-c072-4605-8b1e-ab752b2d2f3e","resolution":{"observed_at":"2026-08-07T10:18:24.230525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00733","last_updated":"2025-03-13T08:23:27Z","snapshot_observed_at":"2026-08-12T11:06:26.827328Z","submitted_at":"2024-12-01T08:54:30Z","title":"Hallo3: Highly Dynamic and Realistic Portrait Image Animation with Video Diffusion Transformer","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00733","snapshot_observed_at":"2026-08-07T10:18:24.346992Z","title":"Hallo3: Highly dynamic and realistic portrait image animation with video diffusion transformer.arXiv preprint arXiv:2412.00733, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05806","last_updated":"2025-06-06T07:09:07Z","snapshot_observed_at":"2026-08-07T20:50:54.524255Z","submitted_at":"2025-06-06T07:09:07Z","title":"LLIA -- Enabling Low-Latency Interactive Avatars: Real-Time Audio-Driven Portrait Video Generation with Diffusion Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:24.346992Z"},"links":{"cited_paper":"/paper/2412.00733","citing_paper":"/paper/2506.05806"},"observation_digest":"sha256:c940c6389052efd59e5e80bd51bea3919ed467ededd2d66efe9b74c0faef846f","observation_id":"e92e6c34-72c1-457f-94e0-37c71a4b7bc5","resolution":{"observed_at":"2026-08-07T10:18:24.346992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17694","last_updated":"2024-03-26T13:35:02Z","snapshot_observed_at":"2026-08-16T14:06:16.545839Z","submitted_at":"2024-03-26T13:35:02Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17694","snapshot_observed_at":"2026-08-07T10:18:24.450551Z","title":"Aniportrait: Audio-driven synthesis of photorealistic portrait animation.arXiv preprint arXiv:2403.17694, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05806","last_updated":"2025-06-06T07:09:07Z","snapshot_observed_at":"2026-08-07T20:50:54.524255Z","submitted_at":"2025-06-06T07:09:07Z","title":"LLIA -- Enabling Low-Latency Interactive Avatars: Real-Time Audio-Driven Portrait Video Generation with Diffusion Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:24.450551Z"},"links":{"cited_paper":"/paper/2403.17694","citing_paper":"/paper/2506.05806"},"observation_digest":"sha256:948636e6723355d5149e21b63a8f1fa8a651cc04c3317e21c7c7365395a880fa","observation_id":"8dce6ce4-191d-456a-94f1-149be2ffcbab","resolution":{"observed_at":"2026-08-07T10:18:24.450551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01876","last_updated":"2025-04-05T05:31:38Z","snapshot_observed_at":"2026-08-16T13:21:46.801247Z","submitted_at":"2024-09-03T13:19:31Z","title":"CyberHost: Taming Audio-driven Avatar Diffusion Model with Region Codebook Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.01876","snapshot_observed_at":"2026-08-07T10:18:24.579865Z","title":"Cyberhost: Taming audio-driven avatar diffusion model with region codebook attention.arXiv preprint arXiv:2409.01876, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05806","last_updated":"2025-06-06T07:09:07Z","snapshot_observed_at":"2026-08-07T20:50:54.524255Z","submitted_at":"2025-06-06T07:09:07Z","title":"LLIA -- Enabling Low-Latency Interactive Avatars: Real-Time Audio-Driven Portrait Video Generation with Diffusion Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:24.579865Z"},"links":{"cited_paper":"/paper/2409.01876","citing_paper":"/paper/2506.05806"},"observation_digest":"sha256:02c716fb35eb1ac057c00d47bf0a12a945b9c40dd544b6140a6cbef5cafac54b","observation_id":"4a76ebc3-cbf2-4246-8763-529b4b596b24","resolution":{"observed_at":"2026-08-07T10:18:24.579865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02634","last_updated":"2025-04-04T05:13:40Z","snapshot_observed_at":"2026-08-17T16:32:16.739621Z","submitted_at":"2024-09-04T11:55:14Z","title":"Loopy: Taming Audio-Driven Portrait Avatar with Long-Term Motion Dependency","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02634","snapshot_observed_at":"2026-08-07T10:18:24.712720Z","title":"Loopy: Taming audio- driven portrait avatar with long-term motion dependency.arXiv preprint arXiv:2409.02634, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05806","last_updated":"2025-06-06T07:09:07Z","snapshot_observed_at":"2026-08-07T20:50:54.524255Z","submitted_at":"2025-06-06T07:09:07Z","title":"LLIA -- Enabling Low-Latency Interactive Avatars: Real-Time Audio-Driven Portrait Video Generation with Diffusion Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:24.712720Z"},"links":{"cited_paper":"/paper/2409.02634","citing_paper":"/paper/2506.05806"},"observation_digest":"sha256:2861ecdf7e0f87bb6979c14d7913cc496b81ce0da7bf19fe1cab677f7a70d9a7","observation_id":"33133a8a-1ce5-4dcc-8d69-a991d324d416","resolution":{"observed_at":"2026-08-07T10:18:24.712720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:24.846533Z","title":"Consistency models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05806","last_updated":"2025-06-06T07:09:07Z","snapshot_observed_at":"2026-08-07T20:50:54.524255Z","submitted_at":"2025-06-06T07:09:07Z","title":"LLIA -- Enabling Low-Latency Interactive Avatars: Real-Time Audio-Driven Portrait Video Generation with Diffusion Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:24.846533Z"},"links":{"citing_paper":"/paper/2506.05806"},"observation_digest":"sha256:7bad8358d78a90af551436b47abdf3dd7cbd56529c4baf06649df15905f13620","observation_id":"697f31a6-831e-4965-8661-c50adda35c8e","resolution":{"observed_at":"2026-08-07T10:18:24.846533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:24.944161Z","title":"Animate anyone: Consistent and controllable image-to-video synthesis for character animation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05806","last_updated":"2025-06-06T07:09:07Z","snapshot_observed_at":"2026-08-07T20:50:54.524255Z","submitted_at":"2025-06-06T07:09:07Z","title":"LLIA -- Enabling Low-Latency Interactive Avatars: Real-Time Audio-Driven Portrait Video Generation with Diffusion Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:24.944161Z"},"links":{"citing_paper":"/paper/2506.05806"},"observation_digest":"sha256:b0ba10dbed6e6fe927093f62664a0efffc2f6acedb90a32a282456052b323d6f","observation_id":"bc55c5a8-c0ba-4577-ae14-afadc0db8298","resolution":{"observed_at":"2026-08-07T10:18:24.944161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03168","last_updated":"2025-02-28T14:39:17Z","snapshot_observed_at":"2026-08-16T13:37:21.852780Z","submitted_at":"2024-07-03T14:41:39Z","title":"LivePortrait: Efficient Portrait Animation with Stitching and Retargeting Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.03168","snapshot_observed_at":"2026-08-07T10:18:25.039278Z","title":"Liveportrait: Efficient portrait animation with stitching and retargeting control.arXiv preprint arXiv:2407.03168, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05806","last_updated":"2025-06-06T07:09:07Z","snapshot_observed_at":"2026-08-07T20:50:54.524255Z","submitted_at":"2025-06-06T07:09:07Z","title":"LLIA -- Enabling Low-Latency Interactive Avatars: Real-Time Audio-Driven Portrait Video Generation with Diffusion Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:25.039278Z"},"links":{"cited_paper":"/paper/2407.03168","citing_paper":"/paper/2506.05806"},"observation_digest":"sha256:7cf37107ed913fc84a57b682e08d005429347a2e4a64edc3982b80f290499571","observation_id":"e5eaeb69-6529-43ee-972c-34fcf1bf1952","resolution":{"observed_at":"2026-08-07T10:18:25.039278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:29.128284Z","title":"X-portrait: Expressive portrait animation with hierarchical motion attention","venue":null,"work_id":"4be34f58-f0cf-4b6c-8065-1334c0d44bca","year":2024},"citing_paper":{"arxiv_id":"2506.05806","last_updated":"2025-06-06T07:09:07Z","snapshot_observed_at":"2026-08-07T20:50:54.524255Z","submitted_at":"2025-06-06T07:09:07Z","title":"LLIA -- Enabling Low-Latency Interactive Avatars: Real-Time Audio-Driven Portrait Video Generation with Diffusion Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:25.147513Z"},"links":{"citing_paper":"/paper/2506.05806"},"observation_digest":"sha256:3f3d071aa7fd1b00477e8f4fd6ee5bed10b295955b34882f756a09ab8ae79ae0","observation_id":"39e9e265-0112-47c7-9195-558aaf3c522d","resolution":{"observed_at":"2026-08-07T10:18:29.186798Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04725","last_updated":"2024-02-08T18:08:57Z","snapshot_observed_at":"2026-08-17T14:04:31.230742Z","submitted_at":"2023-07-10T17:34:16Z","title":"AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04725","snapshot_observed_at":"2026-08-07T10:18:25.256345Z","title":"Animatediff: Animate your personalized text-to-image diffusion models without specific tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05806","last_updated":"2025-06-06T07:09:07Z","snapshot_observed_at":"2026-08-07T20:50:54.524255Z","submitted_at":"2025-06-06T07:09:07Z","title":"LLIA -- Enabling Low-Latency Interactive Avatars: Real-Time Audio-Driven Portrait Video Generation with Diffusion Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:25.256345Z"},"links":{"cited_paper":"/paper/2307.04725","citing_paper":"/paper/2506.05806"},"observation_digest":"sha256:7b84cfb3dec99e587758798773fc3375e5f846c989013f035203f6fa88492be3","observation_id":"f43c7580-7b67-4ca7-ace9-e864facf826f","resolution":{"observed_at":"2026-08-07T10:18:25.256345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:25.377340Z","title":"First order motion model for image animation.Advances in neural information processing systems, 32, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.05806","last_updated":"2025-06-06T07:09:07Z","snapshot_observed_at":"2026-08-07T20:50:54.524255Z","submitted_at":"2025-06-06T07:09:07Z","title":"LLIA -- Enabling Low-Latency Interactive Avatars: Real-Time Audio-Driven Portrait Video Generation with Diffusion Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:25.377340Z"},"links":{"citing_paper":"/paper/2506.05806"},"observation_digest":"sha256:34fffae486cd21e90047248f3c350ceabbd7f063cd51357a9bf27b8153579c98","observation_id":"1dc0c154-2846-459b-86c5-c2fdb5b91be2","resolution":{"observed_at":"2026-08-07T10:18:25.377340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02433","last_updated":"2025-06-03T09:10:14Z","snapshot_observed_at":"2026-08-16T12:44:19.929157Z","submitted_at":"2025-04-03T09:48:13Z","title":"OmniTalker: One-shot Real-time Text-Driven Talking Audio-Video Generation With Multimodal Style Mimicking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.02433","snapshot_observed_at":"2026-08-07T10:18:25.487102Z","title":"Omnitalker: Real-time text-driven talking head generation with in-context audio-visual style replication.arXiv preprint arXiv:2504.02433, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05806","last_updated":"2025-06-06T07:09:07Z","snapshot_observed_at":"2026-08-07T20:50:54.524255Z","submitted_at":"2025-06-06T07:09:07Z","title":"LLIA -- Enabling Low-Latency Interactive Avatars: Real-Time Audio-Driven Portrait Video Generation with Diffusion Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:25.487102Z"},"links":{"cited_paper":"/paper/2504.02433","citing_paper":"/paper/2506.05806"},"observation_digest":"sha256:e0b049314d79866e80cca12d85f66da92fc6ed82f3fd0d74ed05c7b39ecb6b29","observation_id":"8c23bccc-b356-4b6b-bf42-54674df3b85a","resolution":{"observed_at":"2026-08-07T10:18:25.487102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21144","last_updated":"2025-03-27T04:18:53Z","snapshot_observed_at":"2026-08-16T12:46:25.842535Z","submitted_at":"2025-03-27T04:18:53Z","title":"ChatAnyone: Stylized Real-time Portrait Video Generation with Hierarchical Motion Diffusion Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21144","snapshot_observed_at":"2026-08-07T10:18:25.637600Z","title":"Chatanyone: Stylized real-time portrait video generation with hierarchical motion diffusion model.arXiv preprint arXiv:2503.21144, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05806","last_updated":"2025-06-06T07:09:07Z","snapshot_observed_at":"2026-08-07T20:50:54.524255Z","submitted_at":"2025-06-06T07:09:07Z","title":"LLIA -- Enabling Low-Latency Interactive Avatars: Real-Time Audio-Driven Portrait Video Generation with Diffusion Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:25.637600Z"},"links":{"cited_paper":"/paper/2503.21144","citing_paper":"/paper/2506.05806"},"observation_digest":"sha256:56e2a5dc71b8f3698fa6ebbbd87c20aca97d6605f446720c72fd8c4546432885","observation_id":"adf63a13-6dec-4a02-bbb7-b95d647a2d93","resolution":{"observed_at":"2026-08-07T10:18:25.637600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:25.735445Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.05806","last_updated":"2025-06-06T07:09:07Z","snapshot_observed_at":"2026-08-07T20:50:54.524255Z","submitted_at":"2025-06-06T07:09:07Z","title":"LLIA -- Enabling Low-Latency Interactive Avatars: Real-Time Audio-Driven Portrait Video Generation with Diffusion Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:25.735445Z"},"links":{"citing_paper":"/paper/2506.05806"},"observation_digest":"sha256:be0d52052f98523839c098c1e6d62708b51b600847be97382c5bacd0b323f19c","observation_id":"717ece2f-dd5b-439a-aad0-e5076817d8f4","resolution":{"observed_at":"2026-08-07T10:18:25.735445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-08-15T14:02:47.366139Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T10:18:25.836802Z","title":"Gpt-4o system card.arXiv preprint arXiv:2410.21276, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05806","last_updated":"2025-06-06T07:09:07Z","snapshot_observed_at":"2026-08-07T20:50:54.524255Z","submitted_at":"2025-06-06T07:09:07Z","title":"LLIA -- Enabling Low-Latency Interactive Avatars: Real-Time Audio-Driven Portrait Video Generation with Diffusion Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:25.836802Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2506.05806"},"observation_digest":"sha256:4bfa16f55970aadcc5efd04e89edc25811f6bd70de879ade375d1b071f6951be","observation_id":"0717dae3-1cfa-4ab1-995d-90e61e9b060a","resolution":{"observed_at":"2026-08-07T10:18:25.836802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:25.969650Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representations.Advances in neural information processing systems, 33:12449– 12460, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.05806","last_updated":"2025-06-06T07:09:07Z","snapshot_observed_at":"2026-08-07T20:50:54.524255Z","submitted_at":"2025-06-06T07:09:07Z","title":"LLIA -- Enabling Low-Latency Interactive Avatars: Real-Time Audio-Driven Portrait Video Generation with Diffusion Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:25.969650Z"},"links":{"citing_paper":"/paper/2506.05806"},"observation_digest":"sha256:3be78a760ea400496f3c0273c65de850b6b0a77cc7bf11dda7b1136c9b8b3ba4","observation_id":"968c5f37-a31d-4231-9f4e-a29f2ae3147a","resolution":{"observed_at":"2026-08-07T10:18:25.969650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.05862","last_updated":"2019-09-11T08:19:49Z","snapshot_observed_at":"2026-08-17T12:28:40.241678Z","submitted_at":"2019-04-11T17:29:30Z","title":"wav2vec: Unsupervised Pre-training for Speech Recognition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.05862","snapshot_observed_at":"2026-08-07T10:18:26.115489Z","title":"wav2vec: Unsupervised pre-training for speech recognition.arXiv preprint arXiv:1904.05862, 2019","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2506.05806","last_updated":"2025-06-06T07:09:07Z","snapshot_observed_at":"2026-08-07T20:50:54.524255Z","submitted_at":"2025-06-06T07:09:07Z","title":"LLIA -- Enabling Low-Latency Interactive Avatars: Real-Time Audio-Driven Portrait Video Generation with Diffusion Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:26.115489Z"},"links":{"cited_paper":"/paper/1904.05862","citing_paper":"/paper/2506.05806"},"observation_digest":"sha256:536e6bed3890377395407adfd50101df0ff94a65b3a42cc3bc976f0e75c040d4","observation_id":"fbf8f96b-d270-49c2-93b7-92681762c5ff","resolution":{"observed_at":"2026-08-07T10:18:26.115489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:28.937509Z","title":"chinese speech pretrain, 2022","venue":null,"work_id":"d23efee2-9558-4769-82f2-12eaa72e1dd5","year":2022},"citing_paper":{"arxiv_id":"2506.05806","last_updated":"2025-06-06T07:09:07Z","snapshot_observed_at":"2026-08-07T20:50:54.524255Z","submitted_at":"2025-06-06T07:09:07Z","title":"LLIA -- Enabling Low-Latency Interactive Avatars: Real-Time Audio-Driven Portrait Video Generation with Diffusion Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:26.276961Z"},"links":{"citing_paper":"/paper/2506.05806"},"observation_digest":"sha256:c9aa29eb3ac2677ee9ff5eea6232863382447ed20719672feac55f1a15697e65","observation_id":"5943c728-876a-4f5d-874f-dffb4ad6e053","resolution":{"observed_at":"2026-08-07T10:18:29.032142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:28.730536Z","title":"Hsemotion: High-speed emotion recognition library.Software Impacts, 14:100433, 2022","venue":null,"work_id":"f644d851-20a7-4f0a-a6ec-b1e376b21887","year":2022},"citing_paper":{"arxiv_id":"2506.05806","last_updated":"2025-06-06T07:09:07Z","snapshot_observed_at":"2026-08-07T20:50:54.524255Z","submitted_at":"2025-06-06T07:09:07Z","title":"LLIA -- Enabling Low-Latency Interactive Avatars: Real-Time Audio-Driven Portrait Video Generation with Diffusion Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:26.409346Z"},"links":{"citing_paper":"/paper/2506.05806"},"observation_digest":"sha256:bfabe2bc8312e3a10410a28a425cc93c465e89620d5c79f35e9b2f687879a07e","observation_id":"2b9f9eef-7a4e-4e63-a5ac-b45a97da4f5b","resolution":{"observed_at":"2026-08-07T10:18:28.831253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12706","last_updated":"2024-03-19T13:08:54Z","snapshot_observed_at":"2026-08-16T14:08:24.768726Z","submitted_at":"2024-03-19T13:08:54Z","title":"AnimateDiff-Lightning: Cross-Model Diffusion Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12706","snapshot_observed_at":"2026-08-07T10:18:26.580353Z","title":"Animatediff-lightning: Cross-model diffusion distillation.arXiv preprint arXiv:2403.12706, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05806","last_updated":"2025-06-06T07:09:07Z","snapshot_observed_at":"2026-08-07T20:50:54.524255Z","submitted_at":"2025-06-06T07:09:07Z","title":"LLIA -- Enabling Low-Latency Interactive Avatars: Real-Time Audio-Driven Portrait Video Generation with Diffusion Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:26.580353Z"},"links":{"cited_paper":"/paper/2403.12706","citing_paper":"/paper/2506.05806"},"observation_digest":"sha256:c8980b5b35e7fbb794ac49aee2992f2e7ce1ac7b16d16a48fe01ed8a0c71f679","observation_id":"a47c9991-4a64-4092-987f-714aa37a07b6","resolution":{"observed_at":"2026-08-07T10:18:26.580353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13929","last_updated":"2024-03-02T09:09:32Z","snapshot_observed_at":"2026-08-12T13:08:43.602176Z","submitted_at":"2024-02-21T16:51:05Z","title":"SDXL-Lightning: Progressive Adversarial Diffusion Distillation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13929","snapshot_observed_at":"2026-08-07T10:18:26.743525Z","title":"Sdxl-lightning: Progressive adversarial diffusion distillation.arXiv preprint arXiv:2402.13929, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05806","last_updated":"2025-06-06T07:09:07Z","snapshot_observed_at":"2026-08-07T20:50:54.524255Z","submitted_at":"2025-06-06T07:09:07Z","title":"LLIA -- Enabling Low-Latency Interactive Avatars: Real-Time Audio-Driven Portrait Video Generation with Diffusion Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:26.743525Z"},"links":{"cited_paper":"/paper/2402.13929","citing_paper":"/paper/2506.05806"},"observation_digest":"sha256:682cb349f0cde24426cda49038169dc3ddacd16283a9c3ea14ccf17e3d81fd7e","observation_id":"50b578e2-7349-4c67-9925-0e2ecbd5ec06","resolution":{"observed_at":"2026-08-07T10:18:26.743525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:26.967027Z","title":"Generative adversarial networks.Communications of the ACM, 63(11):139–144, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.05806","last_updated":"2025-06-06T07:09:07Z","snapshot_observed_at":"2026-08-07T20:50:54.524255Z","submitted_at":"2025-06-06T07:09:07Z","title":"LLIA -- Enabling Low-Latency Interactive Avatars: Real-Time Audio-Driven Portrait Video Generation with Diffusion Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:26.967027Z"},"links":{"citing_paper":"/paper/2506.05806"},"observation_digest":"sha256:686c805eb254ed57ac3c1465ba81096cd352e1721959df04195710ab19f23ab8","observation_id":"b2e01aa1-ed59-4949-a6f3-8843792ae7a4","resolution":{"observed_at":"2026-08-07T10:18:26.967027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:28.483517Z","title":"Animatelcm: Computation-efficient personalized style video generation without personalized video data","venue":null,"work_id":"d9f1454a-d11b-4af3-927b-eb04422bdecc","year":2024},"citing_paper":{"arxiv_id":"2506.05806","last_updated":"2025-06-06T07:09:07Z","snapshot_observed_at":"2026-08-07T20:50:54.524255Z","submitted_at":"2025-06-06T07:09:07Z","title":"LLIA -- Enabling Low-Latency Interactive Avatars: Real-Time Audio-Driven Portrait Video Generation with Diffusion Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:27.146314Z"},"links":{"citing_paper":"/paper/2506.05806"},"observation_digest":"sha256:744a341abba6a38cae2f301fa7fa0dd656257fd7a4212edba5539dfdbeee9abb","observation_id":"7dacbc6b-1c76-4e54-a9b1-191da6f89350","resolution":{"observed_at":"2026-08-07T10:18:28.603473Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04378","last_updated":"2023-10-06T17:11:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-06T17:11:58Z","title":"Latent Consistency Models: Synthesizing High-Resolution Images with Few-Step Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04378","snapshot_observed_at":"2026-08-07T10:18:27.295219Z","title":"Latent consistency models: Synthesizing high-resolution images with few-step inference.arXiv preprint arXiv:2310.04378, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05806","last_updated":"2025-06-06T07:09:07Z","snapshot_observed_at":"2026-08-07T20:50:54.524255Z","submitted_at":"2025-06-06T07:09:07Z","title":"LLIA -- Enabling Low-Latency Interactive Avatars: Real-Time Audio-Driven Portrait Video Generation with Diffusion Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:27.295219Z"},"links":{"cited_paper":"/paper/2310.04378","citing_paper":"/paper/2506.05806"},"observation_digest":"sha256:c0819d6d858bd89c7bffef07c41605614ed1307d125e9e93215055948d65f42a","observation_id":"e31a5c23-a23b-4ce4-9c00-b9aefb053ddf","resolution":{"observed_at":"2026-08-07T10:18:27.295219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:28.280428Z","title":"Mead: A large-scale audio-visual dataset for emotional talking-face generation","venue":null,"work_id":"ce8eee67-4a0b-46ae-8e2b-439657e80002","year":2020},"citing_paper":{"arxiv_id":"2506.05806","last_updated":"2025-06-06T07:09:07Z","snapshot_observed_at":"2026-08-07T20:50:54.524255Z","submitted_at":"2025-06-06T07:09:07Z","title":"LLIA -- Enabling Low-Latency Interactive Avatars: Real-Time Audio-Driven Portrait Video Generation with Diffusion Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:27.412988Z"},"links":{"citing_paper":"/paper/2506.05806"},"observation_digest":"sha256:785515dddd0414f410f6c507a45031fd4f0b661a28dd5c3eab72190554569b31","observation_id":"dac69101-cd27-46dd-8147-7781b68b1b9a","resolution":{"observed_at":"2026-08-07T10:18:28.369641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1806.05622","last_updated":"2018-06-27T01:49:17Z","snapshot_observed_at":"2026-08-15T02:39:00.334605Z","submitted_at":"2018-06-14T15:59:12Z","title":"VoxCeleb2: Deep Speaker Recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.05622","snapshot_observed_at":"2026-08-07T10:18:27.509209Z","title":"V oxceleb2: Deep speaker recognition.arXiv preprint arXiv:1806.05622, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.05806","last_updated":"2025-06-06T07:09:07Z","snapshot_observed_at":"2026-08-07T20:50:54.524255Z","submitted_at":"2025-06-06T07:09:07Z","title":"LLIA -- Enabling Low-Latency Interactive Avatars: Real-Time Audio-Driven Portrait Video Generation with Diffusion Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:27.509209Z"},"links":{"cited_paper":"/paper/1806.05622","citing_paper":"/paper/2506.05806"},"observation_digest":"sha256:3db334b57619198dd1589cc9a78c3c6dc628543958c7eeacf195e252f1cb1dfd","observation_id":"6fab25fc-0325-4226-9fef-b30f63d9c48c","resolution":{"observed_at":"2026-08-07T10:18:27.509209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:27.601101Z","title":"Celebv-hq: A large-scale video facial attributes dataset","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05806","last_updated":"2025-06-06T07:09:07Z","snapshot_observed_at":"2026-08-07T20:50:54.524255Z","submitted_at":"2025-06-06T07:09:07Z","title":"LLIA -- Enabling Low-Latency Interactive Avatars: Real-Time Audio-Driven Portrait Video Generation with Diffusion Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:27.601101Z"},"links":{"citing_paper":"/paper/2506.05806"},"observation_digest":"sha256:3bbbf2136b8733d1402770a0ff99452d8b52f25c34ce145ed668adcf82e8ce7d","observation_id":"e97bcf03-adde-49d0-9043-b325031729a4","resolution":{"observed_at":"2026-08-07T10:18:27.601101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.05586","last_updated":"2023-01-13T14:46:46Z","snapshot_observed_at":"2026-08-16T16:02:36.130874Z","submitted_at":"2023-01-13T14:46:46Z","title":"YOLOv6 v3.0: A Full-Scale Reloading","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.05586","snapshot_observed_at":"2026-08-07T10:18:27.700080Z","title":"Yolov6 v3","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05806","last_updated":"2025-06-06T07:09:07Z","snapshot_observed_at":"2026-08-07T20:50:54.524255Z","submitted_at":"2025-06-06T07:09:07Z","title":"LLIA -- Enabling Low-Latency Interactive Avatars: Real-Time Audio-Driven Portrait Video Generation with Diffusion Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:27.700080Z"},"links":{"cited_paper":"/paper/2301.05586","citing_paper":"/paper/2506.05806"},"observation_digest":"sha256:fae5c41a23ecfe8bd3a70f11a2eb39affc724e2ac8355cf8f14db66163d1c3f9","observation_id":"548058e6-ad0b-41b6-8251-ab0ed6dd69a3","resolution":{"observed_at":"2026-08-07T10:18:27.700080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.08172","last_updated":"2019-06-14T05:49:22Z","snapshot_observed_at":"2026-08-15T17:22:09.610128Z","submitted_at":"2019-06-14T05:49:22Z","title":"MediaPipe: A Framework for Building Perception Pipelines","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.08172","snapshot_observed_at":"2026-08-07T10:18:27.810835Z","title":"Mediapipe: A framework for building perception pipelines.arXiv preprint arXiv:1906.08172, 2019","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2506.05806","last_updated":"2025-06-06T07:09:07Z","snapshot_observed_at":"2026-08-07T20:50:54.524255Z","submitted_at":"2025-06-06T07:09:07Z","title":"LLIA -- Enabling Low-Latency Interactive Avatars: Real-Time Audio-Driven Portrait Video Generation with Diffusion Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:27.810835Z"},"links":{"cited_paper":"/paper/1906.08172","citing_paper":"/paper/2506.05806"},"observation_digest":"sha256:57c8b6671c555d8781aea39675d7aec4590aabcf27da2668757a96092b2aa68f","observation_id":"b2da14e8-311a-41ca-a8be-501cc43112c5","resolution":{"observed_at":"2026-08-07T10:18:27.810835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.05806","last_updated":"2025-06-06T07:09:07Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T20:50:54.524255Z","submitted_at":"2025-06-06T07:09:07Z","title":"LLIA -- Enabling Low-Latency Interactive Avatars: Real-Time Audio-Driven Portrait Video Generation with Diffusion Models"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":33,"verified_exact":0,"verified_fuzzy":7},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 3 inbound Pith citation observations for arXiv:2506.05806."}