{"as_of":"2026-08-10T12:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f1fc2d046bfd92fd2e8cab3d3586152c4af31b5d7095e7c25044daca0722a3d6","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:07:35.362688Z","state":"measured"},{"denominator":62,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":62,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":16,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":16,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T16:39:35.477467Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T10:09:44.572116Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.22647","last_updated":"2025-05-28T17:57:06Z","snapshot_observed_at":"2026-08-07T20:49:17.257002Z","submitted_at":"2025-05-28T17:57:06Z","title":"Let Them Talk: Audio-Driven Multi-Person Conversational Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22647","snapshot_observed_at":"2026-08-06T16:39:35.477467Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.12956","last_updated":"2025-07-17T09:50:43Z","snapshot_observed_at":"2026-08-10T05:19:16.514953Z","submitted_at":"2025-07-17T09:50:43Z","title":"FantasyPortrait: Enhancing Multi-Character Portrait Animation with Expression-Augmented Diffusion Transformers","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T16:39:35.477467Z"},"links":{"cited_paper":"/paper/2505.22647","citing_paper":"/paper/2507.12956"},"observation_digest":"sha256:204d9653a27ec865c22e8ac858640c6be349ed28512b49e55aa4aaa4ca16ff69","observation_id":"e616d77c-07ab-44ad-94e3-9d28ef19142c","resolution":{"observed_at":"2026-08-06T16:39:35.477467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22647","last_updated":"2025-05-28T17:57:06Z","snapshot_observed_at":"2026-08-07T20:49:17.257002Z","submitted_at":"2025-05-28T17:57:06Z","title":"Let Them Talk: Audio-Driven Multi-Person Conversational Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22647","snapshot_observed_at":"2026-08-05T20:06:47.005370Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.11255","last_updated":"2025-08-15T06:43:46Z","snapshot_observed_at":"2026-08-08T07:02:19.422958Z","submitted_at":"2025-08-15T06:43:46Z","title":"FantasyTalking2: Timestep-Layer Adaptive Preference Optimization for Audio-Driven Portrait Animation","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-05T20:06:47.005370Z"},"links":{"cited_paper":"/paper/2505.22647","citing_paper":"/paper/2508.11255"},"observation_digest":"sha256:67ab02da6fb69d77e73ee6579e612281e0b692eb73d78c98ad31eb1f3348d848","observation_id":"8b35010b-3fba-47ee-be13-7448fe47632f","resolution":{"observed_at":"2026-08-05T20:06:47.005370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22647","last_updated":"2025-05-28T17:57:06Z","snapshot_observed_at":"2026-08-07T20:49:17.257002Z","submitted_at":"2025-05-28T17:57:06Z","title":"Let Them Talk: Audio-Driven Multi-Person Conversational Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22647","snapshot_observed_at":"2026-08-05T18:50:16.246901Z","title":"Let them talk: Audio-driven multi-person conversational video generation.arXiv preprint arXiv:2505.22647, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.14033","last_updated":"2025-08-19T17:55:23Z","snapshot_observed_at":"2026-08-05T18:50:15.388089Z","submitted_at":"2025-08-19T17:55:23Z","title":"InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T18:50:16.246901Z"},"links":{"cited_paper":"/paper/2505.22647","citing_paper":"/paper/2508.14033"},"observation_digest":"sha256:e6c4d2720de20687ef74bdd2e613b9917bd0727537d04788d94e48b92b90bf31","observation_id":"dc40bea0-8f73-4da4-a842-e54029d6a5f6","resolution":{"observed_at":"2026-08-05T18:50:16.246901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22647","last_updated":"2025-05-28T17:57:06Z","snapshot_observed_at":"2026-08-07T20:49:17.257002Z","submitted_at":"2025-05-28T17:57:06Z","title":"Let Them Talk: Audio-Driven Multi-Person Conversational Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22647","snapshot_observed_at":"2026-08-05T16:01:30.762208Z","title":"Let them talk: Audio-driven multi-person conversational video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.19320","last_updated":"2025-08-28T09:15:43Z","snapshot_observed_at":"2026-08-09T02:00:04.850473Z","submitted_at":"2025-08-26T14:00:16Z","title":"MIDAS: Multimodal Interactive Digital-humAn Synthesis via Real-time Autoregressive Video Generation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:30.762208Z"},"links":{"cited_paper":"/paper/2505.22647","citing_paper":"/paper/2508.19320"},"observation_digest":"sha256:811ade0cc86457b45797207b8a4cb6ad184f16b8e9189d86b818750f89976234","observation_id":"b7dc1f40-57f5-44e4-a77f-f664e284d62b","resolution":{"observed_at":"2026-08-05T16:01:30.762208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22647","last_updated":"2025-05-28T17:57:06Z","snapshot_observed_at":"2026-08-07T20:49:17.257002Z","submitted_at":"2025-05-28T17:57:06Z","title":"Let Them Talk: Audio-Driven Multi-Person Conversational Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22647","snapshot_observed_at":"2026-08-05T15:19:37.168237Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-09T16:12:19.928163Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:37.168237Z"},"links":{"cited_paper":"/paper/2505.22647","citing_paper":"/paper/2508.20210"},"observation_digest":"sha256:e1ed0b30e1e6b0c949bad9493e706d7f6eb647265b5111cc980224e40379d30d","observation_id":"2b649be8-018a-4de3-b28b-05f9b18454b2","resolution":{"observed_at":"2026-08-05T15:19:37.168237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22647","last_updated":"2025-05-28T17:57:06Z","snapshot_observed_at":"2026-08-07T20:49:17.257002Z","submitted_at":"2025-05-28T17:57:06Z","title":"Let Them Talk: Audio-Driven Multi-Person Conversational Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22647","snapshot_observed_at":"2026-08-04T06:47:05.973725Z","title":"Let them talk: Audio-driven multi-person conversa- tional video generation.arXiv preprint arXiv:2505.22647,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.20635","last_updated":"2026-08-02T05:27:14Z","snapshot_observed_at":"2026-08-08T05:22:59.737639Z","submitted_at":"2025-11-25T18:54:16Z","title":"iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:05.973725Z"},"links":{"cited_paper":"/paper/2505.22647","citing_paper":"/paper/2511.20635"},"observation_digest":"sha256:e29a0c8aaae9e03fac3241d60d40fb97046de4ef7a65c9f29b6fa7f34777d110","observation_id":"8a4458db-a56d-4c30-b58b-9acbacd29f39","resolution":{"observed_at":"2026-08-04T06:47:05.973725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22647","last_updated":"2025-05-28T17:57:06Z","snapshot_observed_at":"2026-08-07T20:49:17.257002Z","submitted_at":"2025-05-28T17:57:06Z","title":"Let Them Talk: Audio-Driven Multi-Person Conversational Video Generation","version":1},"cited_work":{"arxiv_id":"2505.22647","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22647","snapshot_observed_at":"2026-07-04T10:09:44.572116Z","title":"Let them talk: Audio-driven multi-person conversational video generation","venue":null,"work_id":"b6c07d96-7a45-4c6f-9ca7-641329c5a3b5","year":2025},"citing_paper":{"arxiv_id":"2602.09534","last_updated":"2026-05-10T13:50:44Z","snapshot_observed_at":"2026-08-09T23:39:03.326127Z","submitted_at":"2026-02-10T08:45:51Z","title":"AUHead: Realistic Emotional Talking Head Generation via Action Units Control","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-16T05:49:15.734418Z"},"links":{"cited_paper":"/paper/2505.22647","citing_paper":"/paper/2602.09534"},"observation_digest":"sha256:3ea257310ef90af06a7eaa4cc29f00d6deb3b6258ca3d3828aace56287ab2f11","observation_id":"e141d963-46eb-4e0b-9dd4-a4da10d6e3bc","resolution":{"observed_at":"2026-05-16T05:50:40.255880Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22647","last_updated":"2025-05-28T17:57:06Z","snapshot_observed_at":"2026-08-07T20:49:17.257002Z","submitted_at":"2025-05-28T17:57:06Z","title":"Let Them Talk: Audio-Driven Multi-Person Conversational Video Generation","version":1},"cited_work":{"arxiv_id":"2505.22647","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22647","snapshot_observed_at":"2026-07-04T10:09:44.572116Z","title":"Let them talk: Audio-driven multi-person conversational video generation","venue":null,"work_id":"b6c07d96-7a45-4c6f-9ca7-641329c5a3b5","year":2025},"citing_paper":{"arxiv_id":"2604.11804","last_updated":"2026-04-17T08:08:09Z","snapshot_observed_at":"2026-08-06T16:53:42.723002Z","submitted_at":"2026-04-13T17:59:12Z","title":"OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:02.727887Z"},"links":{"cited_paper":"/paper/2505.22647","citing_paper":"/paper/2604.11804"},"observation_digest":"sha256:15eec1dd056eb590a865461f027916cd4ead105687bbc8baec6dea662bb83506","observation_id":"8a522e79-6f7f-40c3-9027-d8ac000648e5","resolution":{"observed_at":"2026-05-11T11:06:05.818834Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22647","last_updated":"2025-05-28T17:57:06Z","snapshot_observed_at":"2026-08-07T20:49:17.257002Z","submitted_at":"2025-05-28T17:57:06Z","title":"Let Them Talk: Audio-Driven Multi-Person Conversational Video Generation","version":1},"cited_work":{"arxiv_id":"2505.22647","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22647","snapshot_observed_at":"2026-07-04T10:09:44.572116Z","title":"Let them talk: Audio-driven multi-person conversational video generation","venue":null,"work_id":"b6c07d96-7a45-4c6f-9ca7-641329c5a3b5","year":2025},"citing_paper":{"arxiv_id":"2604.14580","last_updated":"2026-05-05T22:56:58Z","snapshot_observed_at":"2026-07-06T23:02:18.425249Z","submitted_at":"2026-04-16T03:19:29Z","title":"TurboTalk: Progressive Distillation for One-Step Audio-Driven Talking Avatar Generation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T11:13:27.689539Z"},"links":{"cited_paper":"/paper/2505.22647","citing_paper":"/paper/2604.14580"},"observation_digest":"sha256:7929a0038676e68a753ed8852847438e3b7b0df6718e20b6b0ecd6cf9daaa821","observation_id":"f203a03a-a1d4-41f3-8e1a-4be122b0e434","resolution":{"observed_at":"2026-05-10T11:15:10.341482Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22647","last_updated":"2025-05-28T17:57:06Z","snapshot_observed_at":"2026-08-07T20:49:17.257002Z","submitted_at":"2025-05-28T17:57:06Z","title":"Let Them Talk: Audio-Driven Multi-Person Conversational Video Generation","version":1},"cited_work":{"arxiv_id":"2505.22647","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22647","snapshot_observed_at":"2026-07-04T10:09:44.572116Z","title":"Let them talk: Audio-driven multi-person conversational video generation","venue":null,"work_id":"b6c07d96-7a45-4c6f-9ca7-641329c5a3b5","year":2025},"citing_paper":{"arxiv_id":"2605.11363","last_updated":"2026-05-12T00:32:24Z","snapshot_observed_at":"2026-07-06T23:23:11.928199Z","submitted_at":"2026-05-12T00:32:24Z","title":"PresentAgent-2: Towards Generalist Multimodal Presentation Agents","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-13T02:29:42.157339Z"},"links":{"cited_paper":"/paper/2505.22647","citing_paper":"/paper/2605.11363"},"observation_digest":"sha256:0fff683e99b75342c41591f09903f5879a0ff0a1f3d3f7c6e2d43c1bfdedd106","observation_id":"e91fb8d3-1b09-4292-9d6b-8aa21c96918c","resolution":{"observed_at":"2026-05-13T02:32:06.441607Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22647","last_updated":"2025-05-28T17:57:06Z","snapshot_observed_at":"2026-08-07T20:49:17.257002Z","submitted_at":"2025-05-28T17:57:06Z","title":"Let Them Talk: Audio-Driven Multi-Person Conversational Video Generation","version":1},"cited_work":{"arxiv_id":"2505.22647","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22647","snapshot_observed_at":"2026-07-04T10:09:44.572116Z","title":"Let them talk: Audio-driven multi-person conversational video generation","venue":null,"work_id":"b6c07d96-7a45-4c6f-9ca7-641329c5a3b5","year":2025},"citing_paper":{"arxiv_id":"2605.25488","last_updated":"2026-05-25T06:45:29Z","snapshot_observed_at":"2026-08-02T09:17:40.384654Z","submitted_at":"2026-05-25T06:45:29Z","title":"Test-Time Self-Adaptive Conditioning for Stable Audio-Driven Talking-Head Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-29T22:36:53.138354Z"},"links":{"cited_paper":"/paper/2505.22647","citing_paper":"/paper/2605.25488"},"observation_digest":"sha256:654997c9a7a66036b798c1b15fa1eea4e0a0aa98d6013594ee8b5b037125ebca","observation_id":"4465b051-f896-42db-a793-18df0d46d9ca","resolution":{"observed_at":"2026-06-29T22:44:01.724087Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22647","last_updated":"2025-05-28T17:57:06Z","snapshot_observed_at":"2026-08-07T20:49:17.257002Z","submitted_at":"2025-05-28T17:57:06Z","title":"Let Them Talk: Audio-Driven Multi-Person Conversational Video Generation","version":1},"cited_work":{"arxiv_id":"2505.22647","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22647","snapshot_observed_at":"2026-07-04T10:09:44.572116Z","title":"Let them talk: Audio-driven multi-person conversational video generation","venue":null,"work_id":"b6c07d96-7a45-4c6f-9ca7-641329c5a3b5","year":2025},"citing_paper":{"arxiv_id":"2606.22905","last_updated":"2026-06-30T08:27:33Z","snapshot_observed_at":"2026-08-05T18:57:39.905774Z","submitted_at":"2026-06-22T06:41:17Z","title":"InteractiveAvatar: Real-Time Streaming Video Generation for Consistent and Intent-Aware Avatars","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-26T09:09:06.925645Z"},"links":{"cited_paper":"/paper/2505.22647","citing_paper":"/paper/2606.22905"},"observation_digest":"sha256:9f41757178b154841b9be0b53bfa135112f8dea2efa7b70286cb3e7734201edb","observation_id":"4373d6ea-fa3d-45f8-8968-bf36cdb2981b","resolution":{"observed_at":"2026-07-04T10:09:44.573639Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22647","last_updated":"2025-05-28T17:57:06Z","snapshot_observed_at":"2026-08-07T20:49:17.257002Z","submitted_at":"2025-05-28T17:57:06Z","title":"Let Them Talk: Audio-Driven Multi-Person Conversational Video Generation","version":1},"cited_work":{"arxiv_id":"2505.22647","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22647","snapshot_observed_at":"2026-07-04T10:09:44.572116Z","title":"Let them talk: Audio-driven multi-person conversational video generation","venue":null,"work_id":"b6c07d96-7a45-4c6f-9ca7-641329c5a3b5","year":2025},"citing_paper":{"arxiv_id":"2606.22905","last_updated":"2026-06-30T08:27:33Z","snapshot_observed_at":"2026-08-05T18:57:39.905774Z","submitted_at":"2026-06-22T06:41:17Z","title":"InteractiveAvatar: Real-Time Streaming Video Generation for Consistent and Intent-Aware Avatars","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-01T07:00:53.496569Z"},"links":{"cited_paper":"/paper/2505.22647","citing_paper":"/paper/2606.22905"},"observation_digest":"sha256:35a5398b6da503ae5cfe2387e60bf49bcd707a88b6c1f50aeffc3e53ffe4bd5a","observation_id":"5b418ee3-d410-4682-877f-e5aac23dcbe5","resolution":{"observed_at":"2026-07-01T07:05:29.129385Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22647","last_updated":"2025-05-28T17:57:06Z","snapshot_observed_at":"2026-08-07T20:49:17.257002Z","submitted_at":"2025-05-28T17:57:06Z","title":"Let Them Talk: Audio-Driven Multi-Person Conversational Video Generation","version":1},"cited_work":{"arxiv_id":"2505.22647","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22647","snapshot_observed_at":"2026-07-04T10:09:44.572116Z","title":"Let them talk: Audio-driven multi-person conversational video generation","venue":null,"work_id":"b6c07d96-7a45-4c6f-9ca7-641329c5a3b5","year":2025},"citing_paper":{"arxiv_id":"2606.31088","last_updated":"2026-07-29T10:27:50Z","snapshot_observed_at":"2026-08-09T02:45:38.145106Z","submitted_at":"2026-06-30T03:27:23Z","title":"Towards Flexible, Natural, Efficient Interaction for Conversational Talking Face Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-01T06:26:20.283349Z"},"links":{"cited_paper":"/paper/2505.22647","citing_paper":"/paper/2606.31088"},"observation_digest":"sha256:3cd0a956178a2163ba334926ce4dfdd8c927b53cf2e1fb46709be98dc8935cd3","observation_id":"46353343-5273-4f76-8a0e-0cb7f3a567fe","resolution":{"observed_at":"2026-07-01T09:35:40.311712Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22647","last_updated":"2025-05-28T17:57:06Z","snapshot_observed_at":"2026-08-07T20:49:17.257002Z","submitted_at":"2025-05-28T17:57:06Z","title":"Let Them Talk: Audio-Driven Multi-Person Conversational Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22647","snapshot_observed_at":"2026-08-02T09:27:55.316754Z","title":"arXiv preprint arXiv:2505.22647 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.31088","last_updated":"2026-07-29T10:27:50Z","snapshot_observed_at":"2026-08-09T02:45:38.145106Z","submitted_at":"2026-06-30T03:27:23Z","title":"Towards Flexible, Natural, Efficient Interaction for Conversational Talking Face Generation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T09:27:55.316754Z"},"links":{"cited_paper":"/paper/2505.22647","citing_paper":"/paper/2606.31088"},"observation_digest":"sha256:a435303599e36b48a6476bd0e849162442430add47f13a342238406139836e0e","observation_id":"fb4228e5-dd58-4905-9692-3d1b0e345dce","resolution":{"observed_at":"2026-08-02T09:27:55.316754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22647","last_updated":"2025-05-28T17:57:06Z","snapshot_observed_at":"2026-08-07T20:49:17.257002Z","submitted_at":"2025-05-28T17:57:06Z","title":"Let Them Talk: Audio-Driven Multi-Person Conversational Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22647","snapshot_observed_at":"2026-08-01T03:52:55.358485Z","title":"arXiv preprint arXiv:2505.22647 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23023","last_updated":"2026-07-28T02:01:27Z","snapshot_observed_at":"2026-08-06T04:02:53.538330Z","submitted_at":"2026-07-25T03:42:52Z","title":"OmniMate: Open-Ended Real-Time Streaming Audio-Visual Generation for Interactive Avatars","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-01T03:52:55.358485Z"},"links":{"cited_paper":"/paper/2505.22647","citing_paper":"/paper/2607.23023"},"observation_digest":"sha256:57b69077cac781d57ddb7bd53b4947e9679b91144a73653d533a72ec093955e4","observation_id":"e825ffa0-523b-44a7-ac06-98abd718733f","resolution":{"observed_at":"2026-08-01T03:52:55.358485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.22647/citation-record","integrity":"/paper/2505.22647/integrity","json":"/paper/2505.22647/citation-record.json","paper":"/paper/2505.22647"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:07:31.369913Z","title":"Emo: Emote portrait alive generating expressive portrait videos with audio2video diffusion model under weak conditions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22647","last_updated":"2025-05-28T17:57:06Z","snapshot_observed_at":"2026-08-07T20:49:17.257002Z","submitted_at":"2025-05-28T17:57:06Z","title":"Let Them Talk: Audio-Driven Multi-Person Conversational Video Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:07:31.369913Z"},"links":{"citing_paper":"/paper/2505.22647"},"observation_digest":"sha256:57007617187112e4e92ea26c35e2375936259be84be1c133ca6d87ad7652b7a6","observation_id":"e4bf8d19-192d-4813-9711-d75132ca8e69","resolution":{"observed_at":"2026-08-07T13:07:31.369913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08801","last_updated":"2024-06-16T07:10:41Z","snapshot_observed_at":"2026-07-06T18:30:06.570612Z","submitted_at":"2024-06-13T04:33:20Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08801","snapshot_observed_at":"2026-08-07T13:07:31.440529Z","title":"Hallo: Hierarchical audio-driven visual synthesis for portrait image animation.arXiv preprint arXiv:2406.08801, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22647","last_updated":"2025-05-28T17:57:06Z","snapshot_observed_at":"2026-08-07T20:49:17.257002Z","submitted_at":"2025-05-28T17:57:06Z","title":"Let Them Talk: Audio-Driven Multi-Person Conversational Video Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:07:31.440529Z"},"links":{"cited_paper":"/paper/2406.08801","citing_paper":"/paper/2505.22647"},"observation_digest":"sha256:da5bfd5017bc0833f59b5dde70ec54fdb323394966112ca81d705e571f5f21f0","observation_id":"7ab23656-362f-4d99-bfd5-0ca9b01b2dd1","resolution":{"observed_at":"2026-08-07T13:07:31.440529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00733","last_updated":"2025-03-13T08:23:27Z","snapshot_observed_at":"2026-08-10T07:07:34.103841Z","submitted_at":"2024-12-01T08:54:30Z","title":"Hallo3: Highly Dynamic and Realistic Portrait Image Animation with Video Diffusion Transformer","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00733","snapshot_observed_at":"2026-08-07T13:07:31.596042Z","title":"Hallo3: Highly dynamic and realistic portrait image animation with video diffusion transformer.arXiv preprint arXiv:2412.00733, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22647","last_updated":"2025-05-28T17:57:06Z","snapshot_observed_at":"2026-08-07T20:49:17.257002Z","submitted_at":"2025-05-28T17:57:06Z","title":"Let Them Talk: Audio-Driven Multi-Person Conversational Video Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:07:31.596042Z"},"links":{"cited_paper":"/paper/2412.00733","citing_paper":"/paper/2505.22647"},"observation_digest":"sha256:5078924f1d2244f3d2be29131b4cd8427e46efd37ce114180500a7e7dda073f5","observation_id":"126822ad-cdb2-4732-b1c0-b087d9131350","resolution":{"observed_at":"2026-08-07T13:07:31.596042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:07:38.386499Z","title":"Echomimic: Lifelike audio-driven portrait animations through editable landmark conditions","venue":null,"work_id":"ad666d51-0a5c-4eaa-b98b-d82b6c313912","year":2025},"citing_paper":{"arxiv_id":"2505.22647","last_updated":"2025-05-28T17:57:06Z","snapshot_observed_at":"2026-08-07T20:49:17.257002Z","submitted_at":"2025-05-28T17:57:06Z","title":"Let Them Talk: Audio-Driven Multi-Person Conversational Video Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:07:31.759871Z"},"links":{"citing_paper":"/paper/2505.22647"},"observation_digest":"sha256:2197c8f91ce9095bed69c862581396714218780edb9ab114bd1ee0fd39e5b0f1","observation_id":"83457919-cecf-463f-8ee5-730e3cc5059c","resolution":{"observed_at":"2026-08-07T13:07:38.450148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09262","last_updated":"2025-03-13T09:17:52Z","snapshot_observed_at":"2026-08-07T20:59:22.905615Z","submitted_at":"2024-12-12T13:20:52Z","title":"LatentSync: Taming Audio-Conditioned Latent Diffusion Models for Lip Sync with SyncNet Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09262","snapshot_observed_at":"2026-08-07T13:07:31.880403Z","title":"Latentsync: Audio conditioned latent diffusion models for lip sync.arXiv preprint arXiv:2412.09262, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22647","last_updated":"2025-05-28T17:57:06Z","snapshot_observed_at":"2026-08-07T20:49:17.257002Z","submitted_at":"2025-05-28T17:57:06Z","title":"Let Them Talk: Audio-Driven Multi-Person Conversational Video Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:07:31.880403Z"},"links":{"cited_paper":"/paper/2412.09262","citing_paper":"/paper/2505.22647"},"observation_digest":"sha256:8a704a06f9619e359890ad8935a80b841fbfd7497bb40cd5a3f6239dcf903b0d","observation_id":"8f6b2128-93cc-4554-990d-7c199ea931a3","resolution":{"observed_at":"2026-08-07T13:07:31.880403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02634","last_updated":"2025-04-04T05:13:40Z","snapshot_observed_at":"2026-08-05T07:44:02.175955Z","submitted_at":"2024-09-04T11:55:14Z","title":"Loopy: Taming Audio-Driven Portrait Avatar with Long-Term Motion Dependency","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02634","snapshot_observed_at":"2026-08-07T13:07:31.988771Z","title":"Loopy: Taming audio-driven portrait avatar with long-term motion dependency.arXiv preprint arXiv:2409.02634, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22647","last_updated":"2025-05-28T17:57:06Z","snapshot_observed_at":"2026-08-07T20:49:17.257002Z","submitted_at":"2025-05-28T17:57:06Z","title":"Let Them Talk: Audio-Driven Multi-Person Conversational Video Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T13:07:31.988771Z"},"links":{"cited_paper":"/paper/2409.02634","citing_paper":"/paper/2505.22647"},"observation_digest":"sha256:23a21e6df94274459405922717262e37cb6904af95972d7e9ec23449d3a39600","observation_id":"54b61ee0-15ce-4696-8d2b-805a45979bb4","resolution":{"observed_at":"2026-08-07T13:07:31.988771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:07:38.206917Z","title":"Cyberhost: A one-stage diffusion framework for audio-driven talking body generation","venue":null,"work_id":"d423cd97-a9d5-4634-9823-0d28a2f2094d","year":null},"citing_paper":{"arxiv_id":"2505.22647","last_updated":"2025-05-28T17:57:06Z","snapshot_observed_at":"2026-08-07T20:49:17.257002Z","submitted_at":"2025-05-28T17:57:06Z","title":"Let Them Talk: Audio-Driven Multi-Person Conversational Video Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:07:32.073177Z"},"links":{"citing_paper":"/paper/2505.22647"},"observation_digest":"sha256:c7d05641eaa046ea980d8d3140b44f7279b74bacb65383b529abe6435b9a07cb","observation_id":"603278bc-f543-4d50-9d0a-4cb48ffa9b45","resolution":{"observed_at":"2026-08-07T13:07:38.322693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01061","last_updated":"2025-06-30T08:26:56Z","snapshot_observed_at":"2026-08-09T16:40:37.792241Z","submitted_at":"2025-02-03T05:17:32Z","title":"OmniHuman-1: Rethinking the Scaling-Up of One-Stage Conditioned Human Animation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01061","snapshot_observed_at":"2026-08-07T13:07:32.220659Z","title":"Omnihuman-1: Rethinking the scaling-up of one-stage conditioned human animation models.arXiv preprint arXiv:2502.01061, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22647","last_updated":"2025-05-28T17:57:06Z","snapshot_observed_at":"2026-08-07T20:49:17.257002Z","submitted_at":"2025-05-28T17:57:06Z","title":"Let Them Talk: Audio-Driven Multi-Person Conversational Video Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:07:32.220659Z"},"links":{"cited_paper":"/paper/2502.01061","citing_paper":"/paper/2505.22647"},"observation_digest":"sha256:442194358176d4a9eb91be68bd5278944b075a81a58a0c90a488189d5d24a30c","observation_id":"146516e4-b405-484e-8be2-5eff66dcbb08","resolution":{"observed_at":"2026-08-07T13:07:32.220659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.10687","last_updated":"2025-01-18T07:51:29Z","snapshot_observed_at":"2026-08-08T20:25:42.487197Z","submitted_at":"2025-01-18T07:51:29Z","title":"EMO2: End-Effector Guided Audio-Driven Avatar Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.10687","snapshot_observed_at":"2026-08-07T13:07:32.372279Z","title":"Emo2: End-effector guided audio-driven avatar video generation.arXiv preprint arXiv:2501.10687, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22647","last_updated":"2025-05-28T17:57:06Z","snapshot_observed_at":"2026-08-07T20:49:17.257002Z","submitted_at":"2025-05-28T17:57:06Z","title":"Let Them Talk: Audio-Driven Multi-Person Conversational Video Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:07:32.372279Z"},"links":{"cited_paper":"/paper/2501.10687","citing_paper":"/paper/2505.22647"},"observation_digest":"sha256:557465261c00d7bb351d85db1f614e758fbd0fd79b6bff4fa25b31d65e699a48","observation_id":"f2aa37e3-d4ee-4e5b-8ad2-d4f0164a6dd9","resolution":{"observed_at":"2026-08-07T13:07:32.372279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:07:32.506861Z","title":"Echomimicv2: Towards striking, simplified, and semi-body human animation.arXiv preprint arXiv:2411.10061, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22647","last_updated":"2025-05-28T17:57:06Z","snapshot_observed_at":"2026-08-07T20:49:17.257002Z","submitted_at":"2025-05-28T17:57:06Z","title":"Let Them Talk: Audio-Driven Multi-Person Conversational Video Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:07:32.506861Z"},"links":{"citing_paper":"/paper/2505.22647"},"observation_digest":"sha256:f2ef622b0c7b0d435431b59dd403e544c05c52a463b306edc435144604758e68","observation_id":"7ed5f4a0-ce47-4f08-8461-6d8df225a658","resolution":{"observed_at":"2026-08-07T13:07:32.506861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.04842","last_updated":"2025-04-07T08:56:01Z","snapshot_observed_at":"2026-08-09T02:00:54.345290Z","submitted_at":"2025-04-07T08:56:01Z","title":"FantasyTalking: Realistic Talking Portrait Generation via Coherent Motion Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.04842","snapshot_observed_at":"2026-08-07T13:07:32.607328Z","title":"Fantasytalking: Realistic talking portrait generation via coherent motion synthesis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22647","last_updated":"2025-05-28T17:57:06Z","snapshot_observed_at":"2026-08-07T20:49:17.257002Z","submitted_at":"2025-05-28T17:57:06Z","title":"Let Them Talk: Audio-Driven Multi-Person Conversational Video Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:07:32.607328Z"},"links":{"cited_paper":"/paper/2504.04842","citing_paper":"/paper/2505.22647"},"observation_digest":"sha256:9e1fe5965cfb7c5d605235e85966ac1ca38852b49f0a30d70b302ebf1cffa46f","observation_id":"259b03b1-ff70-43b9-b91d-4b75e3601cab","resolution":{"observed_at":"2026-08-07T13:07:32.607328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04725","last_updated":"2024-02-08T18:08:57Z","snapshot_observed_at":"2026-07-06T15:52:13.602170Z","submitted_at":"2023-07-10T17:34:16Z","title":"AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04725","snapshot_observed_at":"2026-08-07T13:07:32.720783Z","title":"Animatediff: Animate your personalized text-to-image diffusion models without specific tuning.arXiv preprint arXiv:2307.04725, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22647","last_updated":"2025-05-28T17:57:06Z","snapshot_observed_at":"2026-08-07T20:49:17.257002Z","submitted_at":"2025-05-28T17:57:06Z","title":"Let Them Talk: Audio-Driven Multi-Person Conversational Video Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:07:32.720783Z"},"links":{"cited_paper":"/paper/2307.04725","citing_paper":"/paper/2505.22647"},"observation_digest":"sha256:6e55c6fecb9a644be5b035d6bf471f23fb086db33001bdef26c8f79e3d72fb72","observation_id":"1261ea0a-3beb-4122-8082-c182da4cbd1f","resolution":{"observed_at":"2026-08-07T13:07:32.720783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:07:32.854272Z","title":"Diffusion adversarial post-training for one-step video generation.arXiv preprint arXiv:2501.08316, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22647","last_updated":"2025-05-28T17:57:06Z","snapshot_observed_at":"2026-08-07T20:49:17.257002Z","submitted_at":"2025-05-28T17:57:06Z","title":"Let Them Talk: Audio-Driven Multi-Person Conversational Video Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:07:32.854272Z"},"links":{"citing_paper":"/paper/2505.22647"},"observation_digest":"sha256:9c96ff89aa5524eacdd6187d45222ec9b8fb9b55a1ca6815bd2d44c9c47341a3","observation_id":"e308acb5-2e92-4ad9-938c-4c6047b69b48","resolution":{"observed_at":"2026-08-07T13:07:32.854272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-07T13:07:33.012708Z","title":"Wan: Open and advanced large-scale video generative models.arXiv preprint arXiv:2503.20314, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22647","last_updated":"2025-05-28T17:57:06Z","snapshot_observed_at":"2026-08-07T20:49:17.257002Z","submitted_at":"2025-05-28T17:57:06Z","title":"Let Them Talk: Audio-Driven Multi-Person Conversational Video Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:07:33.012708Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2505.22647"},"observation_digest":"sha256:269c7194a721e2307aef7dda4d9d5e48e366d431581a88e14c71787f13b2cdee","observation_id":"7f95a48d-b2d2-458a-a096-8f3ffc45e4d6","resolution":{"observed_at":"2026-08-07T13:07:33.012708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:07:38.091513Z","title":"Stylesync: High-fidelity generalized and personalized lip sync in style-based generator","venue":null,"work_id":"ea942e8e-0f62-4d51-b0fb-1e30a6d54021","year":2023},"citing_paper":{"arxiv_id":"2505.22647","last_updated":"2025-05-28T17:57:06Z","snapshot_observed_at":"2026-08-07T20:49:17.257002Z","submitted_at":"2025-05-28T17:57:06Z","title":"Let Them Talk: Audio-Driven Multi-Person Conversational Video Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:07:33.101465Z"},"links":{"citing_paper":"/paper/2505.22647"},"observation_digest":"sha256:f60b547acf849f6e5f4ab58aa255bcac1a89fece0f7fa68e2ee92bacff7e3302","observation_id":"be6adcbb-8649-49f2-9bb9-d6df34a74a93","resolution":{"observed_at":"2026-08-07T13:07:38.151957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:07:37.896093Z","title":"Sadtalker: Learning realistic 3d motion coefficients for stylized audio-driven single image talking face animation","venue":null,"work_id":"1589f350-d74e-435c-b4b4-f9972fc27215","year":2023},"citing_paper":{"arxiv_id":"2505.22647","last_updated":"2025-05-28T17:57:06Z","snapshot_observed_at":"2026-08-07T20:49:17.257002Z","submitted_at":"2025-05-28T17:57:06Z","title":"Let Them Talk: Audio-Driven Multi-Person Conversational Video Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:07:33.182183Z"},"links":{"citing_paper":"/paper/2505.22647"},"observation_digest":"sha256:a6dfad3e6a3523ea9add1e3330d52b0aa7d2a6223089fa98ebc1d74e7422fa63","observation_id":"b3e515dd-9aa9-4a8b-af68-e07dbfa7e31a","resolution":{"observed_at":"2026-08-07T13:07:37.978666Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:07:37.750577Z","title":"Videoretalking: Audio-based lip synchronization for talking head video editing in the wild","venue":null,"work_id":"231f18a9-07fc-41fb-84e2-aa09dfb212b7","year":2022},"citing_paper":{"arxiv_id":"2505.22647","last_updated":"2025-05-28T17:57:06Z","snapshot_observed_at":"2026-08-07T20:49:17.257002Z","submitted_at":"2025-05-28T17:57:06Z","title":"Let Them Talk: Audio-Driven Multi-Person Conversational Video Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:07:33.306501Z"},"links":{"citing_paper":"/paper/2505.22647"},"observation_digest":"sha256:ee5480250395a5f5bbbeda4b952ceb1195a169fa14c68d762109dedd2370a72a","observation_id":"6276d75d-38de-4d24-9024-a13fab61bf94","resolution":{"observed_at":"2026-08-07T13:07:37.812816Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:07:37.542993Z","title":"Dpe: Disentanglement of pose and expression for general video portrait editing","venue":null,"work_id":"eb29dd80-0026-4281-9719-d137998307e6","year":2023},"citing_paper":{"arxiv_id":"2505.22647","last_updated":"2025-05-28T17:57:06Z","snapshot_observed_at":"2026-08-07T20:49:17.257002Z","submitted_at":"2025-05-28T17:57:06Z","title":"Let Them Talk: Audio-Driven Multi-Person Conversational Video Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:07:33.386221Z"},"links":{"citing_paper":"/paper/2505.22647"},"observation_digest":"sha256:ccaac9abfac0ee8eaa62acd4672812386e186b7fa193b7c2144932708861a4a8","observation_id":"207c8e16-14de-4c8b-a087-5f80423b576c","resolution":{"observed_at":"2026-08-07T13:07:37.623316Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:07:37.379719Z","title":"Styleheat: One-shot high-resolution editable talking face generation via pre-trained stylegan","venue":null,"work_id":"dec49832-8b47-4e10-b8c6-88f0f7760d5a","year":2022},"citing_paper":{"arxiv_id":"2505.22647","last_updated":"2025-05-28T17:57:06Z","snapshot_observed_at":"2026-08-07T20:49:17.257002Z","submitted_at":"2025-05-28T17:57:06Z","title":"Let Them Talk: Audio-Driven Multi-Person Conversational Video Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:07:33.450158Z"},"links":{"citing_paper":"/paper/2505.22647"},"observation_digest":"sha256:7fa9473e3fd920dc6bd96a8cb0affc43b719fd2bd281e537400610486fb7d883","observation_id":"c5908bc9-7adf-42bb-8e7e-a33af17923d8","resolution":{"observed_at":"2026-08-07T13:07:37.496222Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:07:37.211831Z","title":"Toontalker: Cross-domain face reenactment","venue":null,"work_id":"72187708-384b-4420-8455-5d6dc69c2650","year":2023},"citing_paper":{"arxiv_id":"2505.22647","last_updated":"2025-05-28T17:57:06Z","snapshot_observed_at":"2026-08-07T20:49:17.257002Z","submitted_at":"2025-05-28T17:57:06Z","title":"Let Them Talk: Audio-Driven Multi-Person Conversational Video Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:07:33.519967Z"},"links":{"citing_paper":"/paper/2505.22647"},"observation_digest":"sha256:c3de96ebfc93a8f5540c98febc7c3cbeea8a791dc68a758a696b736083188316","observation_id":"f61d0710-f06b-4136-8457-72c43342f32a","resolution":{"observed_at":"2026-08-07T13:07:37.265272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02511","last_updated":"2024-06-04T17:32:52Z","snapshot_observed_at":"2026-07-06T18:25:18.469656Z","submitted_at":"2024-06-04T17:32:52Z","title":"V-Express: Conditional Dropout for Progressive Training of Portrait Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02511","snapshot_observed_at":"2026-08-07T13:07:33.665330Z","title":"V-express: Conditional dropout for progressive training of portrait video generation.arXiv preprint arXiv:2406.02511, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22647","last_updated":"2025-05-28T17:57:06Z","snapshot_observed_at":"2026-08-07T20:49:17.257002Z","submitted_at":"2025-05-28T17:57:06Z","title":"Let Them Talk: Audio-Driven Multi-Person Conversational Video Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:07:33.665330Z"},"links":{"cited_paper":"/paper/2406.02511","citing_paper":"/paper/2505.22647"},"observation_digest":"sha256:ef14193f95a095a8acf5417651a132589f6d5b4e89dbf068fc7d2097b496bd9f","observation_id":"74043573-0dc9-4a75-ae0e-87a21f8a5153","resolution":{"observed_at":"2026-08-07T13:07:33.665330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:07:37.043010Z","title":"Nonlinear 3d face morphable model","venue":null,"work_id":"4dc57a6f-ab30-4c0a-a6a9-51345fcd9f9d","year":2018},"citing_paper":{"arxiv_id":"2505.22647","last_updated":"2025-05-28T17:57:06Z","snapshot_observed_at":"2026-08-07T20:49:17.257002Z","submitted_at":"2025-05-28T17:57:06Z","title":"Let Them Talk: Audio-Driven Multi-Person Conversational Video Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:07:33.768430Z"},"links":{"citing_paper":"/paper/2505.22647"},"observation_digest":"sha256:62bca3cfd7d730f41c739045e7c1c8fe0cf7d6bfa5ea4d6d12fa01a510930101","observation_id":"495fb50a-5248-408a-a27b-c6bf9729b9ae","resolution":{"observed_at":"2026-08-07T13:07:37.138422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:07:36.914541Z","title":"Audio-driven dubbing for user generated contents via style-aware semi-parametric synthesis.IEEE TCSVT, 33(3):1247– 1261, 2022","venue":null,"work_id":"a235cae5-9f01-4c4d-9242-c0995271f6a5","year":2022},"citing_paper":{"arxiv_id":"2505.22647","last_updated":"2025-05-28T17:57:06Z","snapshot_observed_at":"2026-08-07T20:49:17.257002Z","submitted_at":"2025-05-28T17:57:06Z","title":"Let Them Talk: Audio-Driven Multi-Person Conversational Video Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:07:33.896039Z"},"links":{"citing_paper":"/paper/2505.22647"},"observation_digest":"sha256:72dcd9e60231907f84f6c0c3557836ca070ab2d58d70491a51edc8538ebca345","observation_id":"d9bf26c2-7b55-4e30-b37a-59afa8d46960","resolution":{"observed_at":"2026-08-07T13:07:36.972021Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17694","last_updated":"2024-03-26T13:35:02Z","snapshot_observed_at":"2026-08-07T20:48:39.175359Z","submitted_at":"2024-03-26T13:35:02Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17694","snapshot_observed_at":"2026-08-07T13:07:34.059612Z","title":"Aniportrait: Audio-driven synthesis of photore- alistic portrait animation.arXiv preprint arXiv:2403.17694, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22647","last_updated":"2025-05-28T17:57:06Z","snapshot_observed_at":"2026-08-07T20:49:17.257002Z","submitted_at":"2025-05-28T17:57:06Z","title":"Let Them Talk: Audio-Driven Multi-Person Conversational Video Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T13:07:34.059612Z"},"links":{"cited_paper":"/paper/2403.17694","citing_paper":"/paper/2505.22647"},"observation_digest":"sha256:38656b6271c532a66005e5e058e1b473a34a0a268733fd2b5a8a12e4f42bdc05","observation_id":"b146ccef-7509-4d14-9277-f7205658eaec","resolution":{"observed_at":"2026-08-07T13:07:34.059612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16331","last_updated":"2025-06-05T11:49:59Z","snapshot_observed_at":"2026-08-10T00:00:56.878712Z","submitted_at":"2024-11-25T12:24:52Z","title":"Sonic: Shifting Focus to Global Audio Perception in Portrait Animation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.16331","snapshot_observed_at":"2026-08-07T13:07:34.169979Z","title":"Sonic: Shifting focus to global audio perception in portrait animation.arXiv preprint arXiv:2411.16331, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22647","last_updated":"2025-05-28T17:57:06Z","snapshot_observed_at":"2026-08-07T20:49:17.257002Z","submitted_at":"2025-05-28T17:57:06Z","title":"Let Them Talk: Audio-Driven Multi-Person Conversational Video Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T13:07:34.169979Z"},"links":{"cited_paper":"/paper/2411.16331","citing_paper":"/paper/2505.22647"},"observation_digest":"sha256:58c674c13c01305e69de549dbb327723a922b70b2ffc718c1b5b5ebc87fdffee","observation_id":"ed285332-15ad-49eb-8270-340bcb57a288","resolution":{"observed_at":"2026-08-07T13:07:34.169979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:07:34.216777Z","title":"High- resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22647","last_updated":"2025-05-28T17:57:06Z","snapshot_observed_at":"2026-08-07T20:49:17.257002Z","submitted_at":"2025-05-28T17:57:06Z","title":"Let Them Talk: Audio-Driven Multi-Person Conversational Video Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T13:07:34.216777Z"},"links":{"citing_paper":"/paper/2505.22647"},"observation_digest":"sha256:9a0f1a5fec287761a653d0638afce81fc9783a34d1024f6ba8636c3376bc5333","observation_id":"c09bd768-67e9-454f-ad5b-96dc55584f40","resolution":{"observed_at":"2026-08-07T13:07:34.216777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-07T13:07:34.276289Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis.arXiv preprint arXiv:2307.01952, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22647","last_updated":"2025-05-28T17:57:06Z","snapshot_observed_at":"2026-08-07T20:49:17.257002Z","submitted_at":"2025-05-28T17:57:06Z","title":"Let Them Talk: Audio-Driven Multi-Person Conversational Video Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T13:07:34.276289Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2505.22647"},"observation_digest":"sha256:623a0064b8a144e1badcb031c0f3b259fd2941b59ca1c357ffc98bccca1df6a0","observation_id":"bc0ffce2-f473-4b86-8b1a-a197b4d7db29","resolution":{"observed_at":"2026-08-07T13:07:34.276289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:07:36.771130Z","title":"Dreambooth: Fine tuning text-to-image diffusion models for subject-driven generation","venue":null,"work_id":"142af5f9-bd58-4e95-bd8a-c1a862003fb8","year":2023},"citing_paper":{"arxiv_id":"2505.22647","last_updated":"2025-05-28T17:57:06Z","snapshot_observed_at":"2026-08-07T20:49:17.257002Z","submitted_at":"2025-05-28T17:57:06Z","title":"Let Them Talk: Audio-Driven Multi-Person Conversational Video Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T13:07:34.329887Z"},"links":{"citing_paper":"/paper/2505.22647"},"observation_digest":"sha256:b6cf3c7784ed454c0a8d46e4f29509cc116ee1b55b042eea1dde826cd03f8aba","observation_id":"0ecc0f12-bfbd-4fed-9640-38d0985b3b6c","resolution":{"observed_at":"2026-08-07T13:07:36.846962Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:07:36.559468Z","title":"Omg: Occlusion-friendly personalized multi-concept generation in diffusion models","venue":null,"work_id":"9cf83e3a-1699-4cc7-b61e-ec572fc6b545","year":2024},"citing_paper":{"arxiv_id":"2505.22647","last_updated":"2025-05-28T17:57:06Z","snapshot_observed_at":"2026-08-07T20:49:17.257002Z","submitted_at":"2025-05-28T17:57:06Z","title":"Let Them Talk: Audio-Driven Multi-Person Conversational Video Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T13:07:34.358893Z"},"links":{"citing_paper":"/paper/2505.22647"},"observation_digest":"sha256:87d7648ba4bc6bf83ef0bac29238408b73c98b43283f2fa7f1b836cdee1d7b95","observation_id":"371b3d49-83ea-48ec-92bf-3dd33e1180fd","resolution":{"observed_at":"2026-08-07T13:07:36.657064Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19512","last_updated":"2023-10-30T13:12:40Z","snapshot_observed_at":"2026-08-07T10:15:15.859263Z","submitted_at":"2023-10-30T13:12:40Z","title":"VideoCrafter1: Open Diffusion Models for High-Quality Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19512","snapshot_observed_at":"2026-08-07T13:07:34.412479Z","title":"Videocrafter1: Open diffusion models for high-quality video generation.arXiv preprint arXiv:2310.19512, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22647","last_updated":"2025-05-28T17:57:06Z","snapshot_observed_at":"2026-08-07T20:49:17.257002Z","submitted_at":"2025-05-28T17:57:06Z","title":"Let Them Talk: Audio-Driven Multi-Person Conversational Video Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T13:07:34.412479Z"},"links":{"cited_paper":"/paper/2310.19512","citing_paper":"/paper/2505.22647"},"observation_digest":"sha256:6cfaf503b2ccdd4839b2690ee0d031490e97825530f179ca66dfb468c7902634","observation_id":"9670f83a-ce27-43d2-a9b0-b70fee369f18","resolution":{"observed_at":"2026-08-07T13:07:34.412479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-07T13:07:34.493506Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets.arXiv preprint arXiv:2311.15127, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22647","last_updated":"2025-05-28T17:57:06Z","snapshot_observed_at":"2026-08-07T20:49:17.257002Z","submitted_at":"2025-05-28T17:57:06Z","title":"Let Them Talk: Audio-Driven Multi-Person Conversational Video Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T13:07:34.493506Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2505.22647"},"observation_digest":"sha256:e258a46b02a97a3bcfd0a5df74be57fa5d806ae64842afcca7e04f97e45bc528","observation_id":"45142d58-ff24-4dff-b3ce-ff0fafedebe3","resolution":{"observed_at":"2026-08-07T13:07:34.493506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-07T13:07:34.552987Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer.arXiv preprint arXiv:2408.06072, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22647","last_updated":"2025-05-28T17:57:06Z","snapshot_observed_at":"2026-08-07T20:49:17.257002Z","submitted_at":"2025-05-28T17:57:06Z","title":"Let Them Talk: Audio-Driven Multi-Person Conversational Video Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T13:07:34.552987Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2505.22647"},"observation_digest":"sha256:6abe050fe80381dbbdd5e479f00e9c8b4fbc20e080c38056aa8ffe002e8d9037","observation_id":"99fcc958-4322-4fa7-b2df-68e4f9319c6d","resolution":{"observed_at":"2026-08-07T13:07:34.552987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-07T13:07:34.579279Z","title":"Hunyuanvideo: A systematic framework for large video generative models.arXiv preprint arXiv:2412.03603, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22647","last_updated":"2025-05-28T17:57:06Z","snapshot_observed_at":"2026-08-07T20:49:17.257002Z","submitted_at":"2025-05-28T17:57:06Z","title":"Let Them Talk: Audio-Driven Multi-Person Conversational Video Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T13:07:34.579279Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2505.22647"},"observation_digest":"sha256:877e86684503068a4d7acc4272dcfea1a760558495f9c1d15a01f23f8c935e4f","observation_id":"f6fc5fa5-7aa1-4b42-b00d-4e50b51b8941","resolution":{"observed_at":"2026-08-07T13:07:34.579279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:07:34.614272Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22647","last_updated":"2025-05-28T17:57:06Z","snapshot_observed_at":"2026-08-07T20:49:17.257002Z","submitted_at":"2025-05-28T17:57:06Z","title":"Let Them Talk: Audio-Driven Multi-Person Conversational Video Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T13:07:34.614272Z"},"links":{"citing_paper":"/paper/2505.22647"},"observation_digest":"sha256:9757ccec7f576c0fb40cd0563a65f65fef2db035ccce8d0e32cf2128716790fd","observation_id":"d2cfe75d-30fa-4cbe-aa61-1bcdc41eaec0","resolution":{"observed_at":"2026-08-07T13:07:34.614272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.07447","last_updated":"2024-09-11T17:52:07Z","snapshot_observed_at":"2026-08-07T23:33:01.135787Z","submitted_at":"2024-09-11T17:52:07Z","title":"StereoCrafter: Diffusion-based Generation of Long and High-fidelity Stereoscopic 3D from Monocular Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.07447","snapshot_observed_at":"2026-08-07T13:07:34.672108Z","title":"Stereocrafter: Diffusion-based generation of long and high-fidelity stereoscopic 3d from monocular videos.arXiv preprint arXiv:2409.07447, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22647","last_updated":"2025-05-28T17:57:06Z","snapshot_observed_at":"2026-08-07T20:49:17.257002Z","submitted_at":"2025-05-28T17:57:06Z","title":"Let Them Talk: Audio-Driven Multi-Person Conversational Video Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T13:07:34.672108Z"},"links":{"cited_paper":"/paper/2409.07447","citing_paper":"/paper/2505.22647"},"observation_digest":"sha256:33abb4afe363e34359d97b6d72b14b154ec455d71d534469e09cb2be813f8db4","observation_id":"9768261e-b0d3-480e-a0a8-7c803596f44d","resolution":{"observed_at":"2026-08-07T13:07:34.672108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.07744","last_updated":"2024-12-10T18:44:08Z","snapshot_observed_at":"2026-08-09T19:22:18.607269Z","submitted_at":"2024-12-10T18:44:08Z","title":"StyleMaster: Stylize Your Video with Artistic Generation and Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.07744","snapshot_observed_at":"2026-08-07T13:07:34.731259Z","title":"Stylemas- ter: Stylize your video with artistic generation and translation.arXiv preprint arXiv:2412.07744, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22647","last_updated":"2025-05-28T17:57:06Z","snapshot_observed_at":"2026-08-07T20:49:17.257002Z","submitted_at":"2025-05-28T17:57:06Z","title":"Let Them Talk: Audio-Driven Multi-Person Conversational Video Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T13:07:34.731259Z"},"links":{"cited_paper":"/paper/2412.07744","citing_paper":"/paper/2505.22647"},"observation_digest":"sha256:478384aa011dd335580cf920303b3f787067b7642c984958054c22298902a7e9","observation_id":"1d053117-d560-4002-9f3d-e633d01bf2db","resolution":{"observed_at":"2026-08-07T13:07:34.731259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:07:36.389842Z","title":"Towards multiple character image animation through enhancing implicit decoupling","venue":null,"work_id":"eefb06bb-cd24-45b2-aec3-321493907d2d","year":null},"citing_paper":{"arxiv_id":"2505.22647","last_updated":"2025-05-28T17:57:06Z","snapshot_observed_at":"2026-08-07T20:49:17.257002Z","submitted_at":"2025-05-28T17:57:06Z","title":"Let Them Talk: Audio-Driven Multi-Person Conversational Video Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T13:07:34.777121Z"},"links":{"citing_paper":"/paper/2505.22647"},"observation_digest":"sha256:a870d45278d2a439d503830d2bc3109fd7a8723ae1a900ea8e4f01c20b8f5ca0","observation_id":"c0459e79-81c5-434a-9579-81238439c0fa","resolution":{"observed_at":"2026-08-07T13:07:36.497400Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15239","last_updated":"2025-02-12T06:26:29Z","snapshot_observed_at":"2026-08-10T10:02:41.603903Z","submitted_at":"2024-08-27T17:57:14Z","title":"Generative Inbetweening: Adapting Image-to-Video Models for Keyframe Interpolation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15239","snapshot_observed_at":"2026-08-07T13:07:34.859398Z","title":"Generative inbetweening: Adapting image-to-video models for keyframe interpolation.arXiv preprint arXiv:2408.15239, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22647","last_updated":"2025-05-28T17:57:06Z","snapshot_observed_at":"2026-08-07T20:49:17.257002Z","submitted_at":"2025-05-28T17:57:06Z","title":"Let Them Talk: Audio-Driven Multi-Person Conversational Video Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T13:07:34.859398Z"},"links":{"cited_paper":"/paper/2408.15239","citing_paper":"/paper/2505.22647"},"observation_digest":"sha256:1570cf57d0fc21eedc92dda3bff4820e90a831e2cd5f29814e0f9044531cfb35","observation_id":"7d1f711e-748c-4da5-af35-5bfa901d2e78","resolution":{"observed_at":"2026-08-07T13:07:34.859398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:07:34.923083Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.22647","last_updated":"2025-05-28T17:57:06Z","snapshot_observed_at":"2026-08-07T20:49:17.257002Z","submitted_at":"2025-05-28T17:57:06Z","title":"Let Them Talk: Audio-Driven Multi-Person Conversational Video Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T13:07:34.923083Z"},"links":{"citing_paper":"/paper/2505.22647"},"observation_digest":"sha256:2312ee388de5b43b25817d2b4c0ba12dfc1c8bc3f7c8a11c3b990770170eb9fc","observation_id":"d5eba661-413c-4173-a00e-c5026e2133ff","resolution":{"observed_at":"2026-08-07T13:07:34.923083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:07:36.261806Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representations","venue":null,"work_id":"8525a0f5-9f9c-4cf4-94e9-5c58c7423d2d","year":2020},"citing_paper":{"arxiv_id":"2505.22647","last_updated":"2025-05-28T17:57:06Z","snapshot_observed_at":"2026-08-07T20:49:17.257002Z","submitted_at":"2025-05-28T17:57:06Z","title":"Let Them Talk: Audio-Driven Multi-Person Conversational Video Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T13:07:34.967027Z"},"links":{"citing_paper":"/paper/2505.22647"},"observation_digest":"sha256:3a857c22a06a0faa3362208e3679c9f7e9e1b3b2b04f11f87ed546e5624a1a31","observation_id":"f41f52a3-af98-4264-9419-6d1c277d33ad","resolution":{"observed_at":"2026-08-07T13:07:36.305862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:07:35.020211Z","title":"Roformer: Enhanced transformer with rotary position embedding.Neurocomputing, 568:127063, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22647","last_updated":"2025-05-28T17:57:06Z","snapshot_observed_at":"2026-08-07T20:49:17.257002Z","submitted_at":"2025-05-28T17:57:06Z","title":"Let Them Talk: Audio-Driven Multi-Person Conversational Video Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T13:07:35.020211Z"},"links":{"citing_paper":"/paper/2505.22647"},"observation_digest":"sha256:4fc06caa09e7a3353e6a11ae1b492ee41c8e0cc2a3db311d1b8dbd8dcefb1d96","observation_id":"bd1241d6-cccc-42ee-87d2-93771b447322","resolution":{"observed_at":"2026-08-07T13:07:35.020211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:07:36.098523Z","title":"Flow-guided one-shot talking face generation with a high-resolution audio-visual dataset","venue":null,"work_id":"b30f2bc5-79a7-486f-8640-a5c109d1f283","year":2021},"citing_paper":{"arxiv_id":"2505.22647","last_updated":"2025-05-28T17:57:06Z","snapshot_observed_at":"2026-08-07T20:49:17.257002Z","submitted_at":"2025-05-28T17:57:06Z","title":"Let Them Talk: Audio-Driven Multi-Person Conversational Video Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T13:07:35.062209Z"},"links":{"citing_paper":"/paper/2505.22647"},"observation_digest":"sha256:94fc6fa548aafa71fea4f4f5465aea270cc54522d350a328d1e2a487407cd41f","observation_id":"d6462992-add8-41c3-810f-1ac97f91f31b","resolution":{"observed_at":"2026-08-07T13:07:36.142026Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:07:35.138198Z","title":"CelebV-HQ: A large-scale video facial attributes dataset","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22647","last_updated":"2025-05-28T17:57:06Z","snapshot_observed_at":"2026-08-07T20:49:17.257002Z","submitted_at":"2025-05-28T17:57:06Z","title":"Let Them Talk: Audio-Driven Multi-Person Conversational Video Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T13:07:35.138198Z"},"links":{"citing_paper":"/paper/2505.22647"},"observation_digest":"sha256:75c129cec02e1265dce30f584ff007acb5c8da94577089e37f7ab91b1e5d2da0","observation_id":"0d4da94a-4e14-4506-8e7f-7ba252bfc1f2","resolution":{"observed_at":"2026-08-07T13:07:35.138198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:07:35.932849Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilibrium","venue":null,"work_id":"a1d44f7e-2b8c-421c-a539-0b667ddd99e7","year":2017},"citing_paper":{"arxiv_id":"2505.22647","last_updated":"2025-05-28T17:57:06Z","snapshot_observed_at":"2026-08-07T20:49:17.257002Z","submitted_at":"2025-05-28T17:57:06Z","title":"Let Them Talk: Audio-Driven Multi-Person Conversational Video Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T13:07:35.210087Z"},"links":{"citing_paper":"/paper/2505.22647"},"observation_digest":"sha256:7588606f4b1666f5d120c90a37982b72d73d3b6a121406fb74f5cf313de46232","observation_id":"322e3111-5c0e-4bfc-b587-f592a7b76e39","resolution":{"observed_at":"2026-08-07T13:07:36.007740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:07:35.267621Z","title":"Fvd: A new metric for video generation","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.22647","last_updated":"2025-05-28T17:57:06Z","snapshot_observed_at":"2026-08-07T20:49:17.257002Z","submitted_at":"2025-05-28T17:57:06Z","title":"Let Them Talk: Audio-Driven Multi-Person Conversational Video Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T13:07:35.267621Z"},"links":{"citing_paper":"/paper/2505.22647"},"observation_digest":"sha256:c92617c980a2b236ddebe55d8136a55bde138d1f95c044e68d7f58f2249c6df5","observation_id":"a7c1b579-1744-4a02-83cc-50eef747966b","resolution":{"observed_at":"2026-08-07T13:07:35.267621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:07:35.836481Z","title":"Out of time: automated lip sync in the wild","venue":null,"work_id":"6058c4e7-85c4-472b-b78e-c617890b5bad","year":2017},"citing_paper":{"arxiv_id":"2505.22647","last_updated":"2025-05-28T17:57:06Z","snapshot_observed_at":"2026-08-07T20:49:17.257002Z","submitted_at":"2025-05-28T17:57:06Z","title":"Let Them Talk: Audio-Driven Multi-Person Conversational Video Generation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T13:07:35.362688Z"},"links":{"citing_paper":"/paper/2505.22647"},"observation_digest":"sha256:9083aed6c73daedf830c7e5f43ed737908925fb04b72158b2daa87481d1b6a04","observation_id":"3312cc87-6f2e-4766-a6cb-0a5fca454df8","resolution":{"observed_at":"2026-08-07T13:07:35.864051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.22647","last_updated":"2025-05-28T17:57:06Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T20:49:17.257002Z","submitted_at":"2025-05-28T17:57:06Z","title":"Let Them Talk: Audio-Driven Multi-Person Conversational Video Generation"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":29,"verified_exact":0,"verified_fuzzy":17},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 16 inbound Pith citation observations for arXiv:2505.22647."}