{"as_of":"2026-08-10T00:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:dd12271aa8e8b4802a8af2c03411b85bdae6346500e71125ec11daf04f0bc826","coverage":[{"denominator":60,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":60,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T04:46:05.382405Z","state":"measured"},{"denominator":60,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":60,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2508.03050/citation-record","integrity":"/paper/2508.03050/integrity","json":"/paper/2508.03050/citation-record.json","paper":"/paper/2508.03050"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:46:10.515855Z","title":"GitHub repository","venue":null,"work_id":"0ca8dfdc-d009-4103-9835-9b43036a5be7","year":null},"citing_paper":{"arxiv_id":"2508.03050","last_updated":"2025-08-05T03:54:18Z","snapshot_observed_at":"2026-08-09T04:46:02.489265Z","submitted_at":"2025-08-05T03:54:18Z","title":"Multi-human Interactive Talking Dataset","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T04:46:04.006639Z"},"links":{"citing_paper":"/paper/2508.03050"},"observation_digest":"sha256:06cfe6acc48988c189f925c38bb045f6607498d9e387960b4042d47d7f06e47f","observation_id":"0cdfd198-ace5-49ca-938f-ec0ff35a64bd","resolution":{"observed_at":"2026-08-06T04:46:10.599728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:46:10.328307Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representations","venue":null,"work_id":"d8a4f35e-8209-4755-8aec-45b747db84bc","year":2020},"citing_paper":{"arxiv_id":"2508.03050","last_updated":"2025-08-05T03:54:18Z","snapshot_observed_at":"2026-08-09T04:46:02.489265Z","submitted_at":"2025-08-05T03:54:18Z","title":"Multi-human Interactive Talking Dataset","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T04:46:04.012092Z"},"links":{"citing_paper":"/paper/2508.03050"},"observation_digest":"sha256:0ab00e6d5c20522fca9c4fc5f851f54bbad0cd3a81b37893a13d7f3cac605c44","observation_id":"3acb0df4-a24a-403b-9b3e-0e9e8fe8397f","resolution":{"observed_at":"2026-08-06T04:46:10.437319Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.05514","last_updated":"2020-05-12T01:52:28Z","snapshot_observed_at":"2026-08-09T19:25:03.105225Z","submitted_at":"2020-05-12T01:52:28Z","title":"TalkNet: Fully-Convolutional Non-Autoregressive Speech Synthesis Model","version":1},"cited_work":{"arxiv_id":"2005.05514","doi":null,"metadata_source":"pith","pith_arxiv_id":"2005.05514","snapshot_observed_at":"2026-08-06T04:46:06.234099Z","title":"TalkNet: Fully-Convolutional Non-Autoregressive Speech Synthesis Model","venue":"eess.AS","work_id":"ad23093a-13b2-4fa2-ba87-6454daaf17bb","year":2020},"citing_paper":{"arxiv_id":"2508.03050","last_updated":"2025-08-05T03:54:18Z","snapshot_observed_at":"2026-08-09T04:46:02.489265Z","submitted_at":"2025-08-05T03:54:18Z","title":"Multi-human Interactive Talking Dataset","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T04:46:04.017758Z"},"links":{"cited_paper":"/paper/2005.05514","citing_paper":"/paper/2508.03050"},"observation_digest":"sha256:fa5d3dbb76623848633970e74f8da6150b405333c032cdaad66fdb0deb27678a","observation_id":"2c37f9f6-713c-4fea-96d7-9182bcb6f0a7","resolution":{"observed_at":"2026-08-06T04:46:06.309021Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-06T04:46:04.022782Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.03050","last_updated":"2025-08-05T03:54:18Z","snapshot_observed_at":"2026-08-09T04:46:02.489265Z","submitted_at":"2025-08-05T03:54:18Z","title":"Multi-human Interactive Talking Dataset","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T04:46:04.022782Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2508.03050"},"observation_digest":"sha256:97521f4cbafcc318a6a1f7bd9dae7a4ba6b90e269bc0d6e69fa2300729c81e5d","observation_id":"4bd0cc6d-2ddf-452a-8569-95a465a7cd43","resolution":{"observed_at":"2026-08-06T04:46:04.022782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:46:10.235669Z","title":"Magicdance: Realistic human dance video generation with motions & facial expressions transfer","venue":null,"work_id":"2cb26118-f15d-4e4f-a207-2348b1ee0ff6","year":2023},"citing_paper":{"arxiv_id":"2508.03050","last_updated":"2025-08-05T03:54:18Z","snapshot_observed_at":"2026-08-09T04:46:02.489265Z","submitted_at":"2025-08-05T03:54:18Z","title":"Multi-human Interactive Talking Dataset","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T04:46:04.027925Z"},"links":{"citing_paper":"/paper/2508.03050"},"observation_digest":"sha256:4b2bb019423700873d86de0882f3a5f01a693572dedcd0d22a43b65f2ccbe72a","observation_id":"7d291381-c3c7-4d22-a4da-7a1cf7ef60c9","resolution":{"observed_at":"2026-08-06T04:46:10.271706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19512","last_updated":"2023-10-30T13:12:40Z","snapshot_observed_at":"2026-08-07T10:15:15.859263Z","submitted_at":"2023-10-30T13:12:40Z","title":"VideoCrafter1: Open Diffusion Models for High-Quality Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19512","snapshot_observed_at":"2026-08-06T04:46:04.032620Z","title":"Videocrafter1: Open diffusion models for high-quality video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03050","last_updated":"2025-08-05T03:54:18Z","snapshot_observed_at":"2026-08-09T04:46:02.489265Z","submitted_at":"2025-08-05T03:54:18Z","title":"Multi-human Interactive Talking Dataset","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T04:46:04.032620Z"},"links":{"cited_paper":"/paper/2310.19512","citing_paper":"/paper/2508.03050"},"observation_digest":"sha256:0d0f705f49529d5c1b5a0d442b7aed68fa7e057f08b240b78f2c3a3b2d978c6e","observation_id":"0a5c21c2-a261-4a67-b674-442421b2a455","resolution":{"observed_at":"2026-08-06T04:46:04.032620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08136","last_updated":"2024-07-12T02:41:51Z","snapshot_observed_at":"2026-08-05T23:17:13.069591Z","submitted_at":"2024-07-11T02:26:51Z","title":"EchoMimic: Lifelike Audio-Driven Portrait Animations through Editable Landmark Conditions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08136","snapshot_observed_at":"2026-08-06T04:46:04.037670Z","title":"Echomimic: Lifelike audio-driven portrait animations through editable landmark conditions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.03050","last_updated":"2025-08-05T03:54:18Z","snapshot_observed_at":"2026-08-09T04:46:02.489265Z","submitted_at":"2025-08-05T03:54:18Z","title":"Multi-human Interactive Talking Dataset","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T04:46:04.037670Z"},"links":{"cited_paper":"/paper/2407.08136","citing_paper":"/paper/2508.03050"},"observation_digest":"sha256:49fbcf5b73f7afb45b66564c0e758d14a0f1a6fd13f8eba95aca20174369dab6","observation_id":"04945ce8-166c-4c18-b9a1-af83f84ca9a4","resolution":{"observed_at":"2026-08-06T04:46:04.037670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:46:04.042957Z","title":"Out of time: automated lip sync in the wild","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2508.03050","last_updated":"2025-08-05T03:54:18Z","snapshot_observed_at":"2026-08-09T04:46:02.489265Z","submitted_at":"2025-08-05T03:54:18Z","title":"Multi-human Interactive Talking Dataset","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T04:46:04.042957Z"},"links":{"citing_paper":"/paper/2508.03050"},"observation_digest":"sha256:a775967f6199c77579252f795ff65119044c6d13cbbaaf18981d542edf4ea1fb","observation_id":"4105ac0e-03fb-4bd3-b2b7-cd02a2c2c66a","resolution":{"observed_at":"2026-08-06T04:46:04.042957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1806.05622","last_updated":"2018-06-27T01:49:17Z","snapshot_observed_at":"2026-08-08T04:36:13.309903Z","submitted_at":"2018-06-14T15:59:12Z","title":"VoxCeleb2: Deep Speaker Recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.05622","snapshot_observed_at":"2026-08-06T04:46:04.049199Z","title":"V oxceleb2: Deep speaker recognition","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.03050","last_updated":"2025-08-05T03:54:18Z","snapshot_observed_at":"2026-08-09T04:46:02.489265Z","submitted_at":"2025-08-05T03:54:18Z","title":"Multi-human Interactive Talking Dataset","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T04:46:04.049199Z"},"links":{"cited_paper":"/paper/1806.05622","citing_paper":"/paper/2508.03050"},"observation_digest":"sha256:9fab80fd9fad8382b59cb1f892cb6ed90f398273508dcf3bf36b7ad88f45152a","observation_id":"0f8c61c2-97e5-4f21-9eab-7ef66fa10556","resolution":{"observed_at":"2026-08-06T04:46:04.049199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07718","last_updated":"2024-10-14T13:35:17Z","snapshot_observed_at":"2026-08-05T03:23:39.587839Z","submitted_at":"2024-10-10T08:34:41Z","title":"Hallo2: Long-Duration and High-Resolution Audio-Driven Portrait Image Animation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07718","snapshot_observed_at":"2026-08-06T04:46:04.054306Z","title":"Hallo2: Long-duration and high-resolution audio-driven portrait image animation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.03050","last_updated":"2025-08-05T03:54:18Z","snapshot_observed_at":"2026-08-09T04:46:02.489265Z","submitted_at":"2025-08-05T03:54:18Z","title":"Multi-human Interactive Talking Dataset","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T04:46:04.054306Z"},"links":{"cited_paper":"/paper/2410.07718","citing_paper":"/paper/2508.03050"},"observation_digest":"sha256:83d5d6d925f4d51f6d0e64feed182ae2ed34eb87ef0965013c66e5ff392f3fb0","observation_id":"6e201cba-1307-4505-960c-56ce975e0a70","resolution":{"observed_at":"2026-08-06T04:46:04.054306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05107","last_updated":"2023-12-11T11:00:13Z","snapshot_observed_at":"2026-07-06T16:58:51.683654Z","submitted_at":"2023-12-08T15:37:17Z","title":"DreaMoving: A Human Video Generation Framework based on Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.05107","snapshot_observed_at":"2026-08-06T04:46:04.059505Z","title":"Dreamoving: A human dance video generation framework based on diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.03050","last_updated":"2025-08-05T03:54:18Z","snapshot_observed_at":"2026-08-09T04:46:02.489265Z","submitted_at":"2025-08-05T03:54:18Z","title":"Multi-human Interactive Talking Dataset","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T04:46:04.059505Z"},"links":{"cited_paper":"/paper/2312.05107","citing_paper":"/paper/2508.03050"},"observation_digest":"sha256:9b9d96643c1dcbd85b67856684bf24f5ab17da68eb1b8d9a3943fdc008fdd06f","observation_id":"dafcda37-a4f0-4a18-8f21-1a03e6c906f9","resolution":{"observed_at":"2026-08-06T04:46:04.059505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.10939","last_updated":"2023-01-26T05:00:09Z","snapshot_observed_at":"2026-07-06T14:44:45.326057Z","submitted_at":"2023-01-26T05:00:09Z","title":"Affective Faces for Goal-Driven Dyadic Communication","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.10939","snapshot_observed_at":"2026-08-06T04:46:04.064242Z","title":"Affective faces for goal-driven dyadic communication","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.03050","last_updated":"2025-08-05T03:54:18Z","snapshot_observed_at":"2026-08-09T04:46:02.489265Z","submitted_at":"2025-08-05T03:54:18Z","title":"Multi-human Interactive Talking Dataset","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T04:46:04.064242Z"},"links":{"cited_paper":"/paper/2301.10939","citing_paper":"/paper/2508.03050"},"observation_digest":"sha256:8538af00245cc6a17f289722a12511363c6ce5eb73d2863df84580a6fdf56a1d","observation_id":"5b10e9c2-488c-4edc-934e-7963998b7bd4","resolution":{"observed_at":"2026-08-06T04:46:04.064242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:46:10.108242Z","title":"Learning individual styles of conversational gesture","venue":null,"work_id":"d96ce3af-115b-4fed-a09d-1fc7f182ebb6","year":2019},"citing_paper":{"arxiv_id":"2508.03050","last_updated":"2025-08-05T03:54:18Z","snapshot_observed_at":"2026-08-09T04:46:02.489265Z","submitted_at":"2025-08-05T03:54:18Z","title":"Multi-human Interactive Talking Dataset","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T04:46:04.069026Z"},"links":{"citing_paper":"/paper/2508.03050"},"observation_digest":"sha256:d4abad1ad3b0713c44bba720a70bd5d448ed73f25c89733cfe83599ce0dcfea8","observation_id":"4a6ebae4-3608-4ccb-8724-bdf0b704c5ae","resolution":{"observed_at":"2026-08-06T04:46:10.130062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04725","last_updated":"2024-02-08T18:08:57Z","snapshot_observed_at":"2026-07-06T15:52:13.602170Z","submitted_at":"2023-07-10T17:34:16Z","title":"AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04725","snapshot_observed_at":"2026-08-06T04:46:04.073413Z","title":"Animatediff: Animate your personalized text-to-image diffusion models without specific tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.03050","last_updated":"2025-08-05T03:54:18Z","snapshot_observed_at":"2026-08-09T04:46:02.489265Z","submitted_at":"2025-08-05T03:54:18Z","title":"Multi-human Interactive Talking Dataset","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T04:46:04.073413Z"},"links":{"cited_paper":"/paper/2307.04725","citing_paper":"/paper/2508.03050"},"observation_digest":"sha256:169b33965f7e75b27f11969141800d84942ee130adf0c0b3919fa9b2a71d098e","observation_id":"525143e0-4471-4645-9138-0b81f1c55acd","resolution":{"observed_at":"2026-08-06T04:46:04.073413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:46:09.990785Z","title":"Co-speech gesture video generation via motion- decoupled diffusion model","venue":null,"work_id":"5c683a53-f1b4-42e8-a1cf-bd5930b73a10","year":2024},"citing_paper":{"arxiv_id":"2508.03050","last_updated":"2025-08-05T03:54:18Z","snapshot_observed_at":"2026-08-09T04:46:02.489265Z","submitted_at":"2025-08-05T03:54:18Z","title":"Multi-human Interactive Talking Dataset","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T04:46:04.078056Z"},"links":{"citing_paper":"/paper/2508.03050"},"observation_digest":"sha256:98e770e146ab74e720407991e558f8a72617765c2f1a9ce668b207e0f3a89e0e","observation_id":"30321dbd-b666-4811-9777-d4e665d03ccd","resolution":{"observed_at":"2026-08-06T04:46:10.044867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:46:09.840667Z","title":"Animate anyone: Consistent and controllable image-to-video synthesis for character animation","venue":null,"work_id":"98694a8c-8cec-4fdf-9f43-36b965b666b9","year":2024},"citing_paper":{"arxiv_id":"2508.03050","last_updated":"2025-08-05T03:54:18Z","snapshot_observed_at":"2026-08-09T04:46:02.489265Z","submitted_at":"2025-08-05T03:54:18Z","title":"Multi-human Interactive Talking Dataset","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T04:46:04.082151Z"},"links":{"citing_paper":"/paper/2508.03050"},"observation_digest":"sha256:19a2bc2b92bcb3d731b39543e155060f343616bc12aae5bf172575b1619ba499","observation_id":"dc9fa1c7-c6c9-4b7e-b603-3e1e9081c766","resolution":{"observed_at":"2026-08-06T04:46:09.900096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:46:09.723443Z","title":"Whisperv","venue":null,"work_id":"065bc387-ccac-4351-b937-d65645a7d677","year":2023},"citing_paper":{"arxiv_id":"2508.03050","last_updated":"2025-08-05T03:54:18Z","snapshot_observed_at":"2026-08-09T04:46:02.489265Z","submitted_at":"2025-08-05T03:54:18Z","title":"Multi-human Interactive Talking Dataset","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T04:46:04.086464Z"},"links":{"citing_paper":"/paper/2508.03050"},"observation_digest":"sha256:6f0e2a920be9ed97a7fe859fc45c12ea8797d12397a093f8fbb6fa76d03b2b11","observation_id":"c3cbb69b-bda5-4073-830d-9de0291b2d3c","resolution":{"observed_at":"2026-08-06T04:46:09.772447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:46:09.594920Z","title":"Perceptual conversational head generation with regularized driver and enhanced renderer","venue":null,"work_id":"d4d317fa-84ef-468c-859f-d768ce16790f","year":2022},"citing_paper":{"arxiv_id":"2508.03050","last_updated":"2025-08-05T03:54:18Z","snapshot_observed_at":"2026-08-09T04:46:02.489265Z","submitted_at":"2025-08-05T03:54:18Z","title":"Multi-human Interactive Talking Dataset","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T04:46:04.090821Z"},"links":{"citing_paper":"/paper/2508.03050"},"observation_digest":"sha256:e9332f40a928df715c7e74ed009c3e23ed02ab248dba9113c41e079e1cf156c6","observation_id":"dd891624-2dfa-48d8-8afb-3f224a0dd716","resolution":{"observed_at":"2026-08-06T04:46:09.659633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:46:04.095209Z","title":"Vbench: Comprehensive benchmark suite for video generative models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.03050","last_updated":"2025-08-05T03:54:18Z","snapshot_observed_at":"2026-08-09T04:46:02.489265Z","submitted_at":"2025-08-05T03:54:18Z","title":"Multi-human Interactive Talking Dataset","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T04:46:04.095209Z"},"links":{"citing_paper":"/paper/2508.03050"},"observation_digest":"sha256:2c447b5851eb9be50683cef628cda61a6e7bf8376cb857bbf450c6de72ac862c","observation_id":"8ac39e5e-8a09-4631-bb69-4d28ba9a7697","resolution":{"observed_at":"2026-08-06T04:46:04.095209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02634","last_updated":"2025-04-04T05:13:40Z","snapshot_observed_at":"2026-08-05T07:44:02.175955Z","submitted_at":"2024-09-04T11:55:14Z","title":"Loopy: Taming Audio-Driven Portrait Avatar with Long-Term Motion Dependency","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02634","snapshot_observed_at":"2026-08-06T04:46:04.100602Z","title":"Loopy: Taming audio-driven portrait avatar with long-term motion dependency","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.03050","last_updated":"2025-08-05T03:54:18Z","snapshot_observed_at":"2026-08-09T04:46:02.489265Z","submitted_at":"2025-08-05T03:54:18Z","title":"Multi-human Interactive Talking Dataset","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T04:46:04.100602Z"},"links":{"cited_paper":"/paper/2409.02634","citing_paper":"/paper/2508.03050"},"observation_digest":"sha256:1703b17e341954de6e1817dcd286a29880a93a3d14792c8dae659193e589a145","observation_id":"12f37f79-c744-4589-aa63-959fc0534037","resolution":{"observed_at":"2026-08-06T04:46:04.100602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:46:09.413854Z","title":"Text2performer: Text-driven human video generation","venue":null,"work_id":"836ec651-62ea-4586-992f-a6bdfe7d9fe7","year":2023},"citing_paper":{"arxiv_id":"2508.03050","last_updated":"2025-08-05T03:54:18Z","snapshot_observed_at":"2026-08-09T04:46:02.489265Z","submitted_at":"2025-08-05T03:54:18Z","title":"Multi-human Interactive Talking Dataset","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T04:46:04.106115Z"},"links":{"citing_paper":"/paper/2508.03050"},"observation_digest":"sha256:83ae37ed4c6b8f7132ffd0dd68e686c6c8616f2d459061bb224779b7657c5d37","observation_id":"4b8685a9-ffe7-4a01-9409-9ecc6342e2cf","resolution":{"observed_at":"2026-08-06T04:46:09.498775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:46:09.273503Z","title":"Whole-body human pose estimation in the wild","venue":null,"work_id":"92d2886d-8bb6-46c5-b0e3-04f89f19be32","year":2020},"citing_paper":{"arxiv_id":"2508.03050","last_updated":"2025-08-05T03:54:18Z","snapshot_observed_at":"2026-08-09T04:46:02.489265Z","submitted_at":"2025-08-05T03:54:18Z","title":"Multi-human Interactive Talking Dataset","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T04:46:04.110498Z"},"links":{"citing_paper":"/paper/2508.03050"},"observation_digest":"sha256:db66e56be7ba0552b318fb33d89dfa34b9b0e5e3fd0c696b32c985eec0150748","observation_id":"6b6eb7d4-1ed5-4b79-a431-773593f37b62","resolution":{"observed_at":"2026-08-06T04:46:09.341158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:46:09.135145Z","title":"Sapiens: Foundation for human vision models","venue":null,"work_id":"a7273c40-769e-404c-bcac-c94463a28f9a","year":2024},"citing_paper":{"arxiv_id":"2508.03050","last_updated":"2025-08-05T03:54:18Z","snapshot_observed_at":"2026-08-09T04:46:02.489265Z","submitted_at":"2025-08-05T03:54:18Z","title":"Multi-human Interactive Talking Dataset","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T04:46:04.114657Z"},"links":{"citing_paper":"/paper/2508.03050"},"observation_digest":"sha256:a6352cb61779bec8f9172631c6356830c392543027e53b9a502b2e44d559b9a1","observation_id":"34967ca4-0aae-41e9-8366-dd2a3c3760c0","resolution":{"observed_at":"2026-08-06T04:46:09.208983Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08428","last_updated":"2024-07-11T12:09:05Z","snapshot_observed_at":"2026-08-09T18:02:58.208542Z","submitted_at":"2024-07-11T12:09:05Z","title":"A Comprehensive Survey on Human Video Generation: Challenges, Methods, and Insights","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08428","snapshot_observed_at":"2026-08-06T04:46:04.118923Z","title":"A comprehensive survey on human video generation: Challenges, methods, and insights","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.03050","last_updated":"2025-08-05T03:54:18Z","snapshot_observed_at":"2026-08-09T04:46:02.489265Z","submitted_at":"2025-08-05T03:54:18Z","title":"Multi-human Interactive Talking Dataset","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T04:46:04.118923Z"},"links":{"cited_paper":"/paper/2407.08428","citing_paper":"/paper/2508.03050"},"observation_digest":"sha256:1eb47aad6112abbbf2ef43b7232e530c93c1ab3b605013ce463edb39fedeecf8","observation_id":"8873e075-bb5b-4ce9-8ca0-52ff8e6e0a6b","resolution":{"observed_at":"2026-08-06T04:46:04.118923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00115","last_updated":"2025-01-04T06:16:56Z","snapshot_observed_at":"2026-08-08T10:49:13.982249Z","submitted_at":"2024-11-28T07:01:06Z","title":"OpenHumanVid: A Large-Scale High-Quality Dataset for Enhancing Human-Centric Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00115","snapshot_observed_at":"2026-08-06T04:46:04.123309Z","title":"Openhumanvid: A large-scale high-quality dataset for enhancing human-centric video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.03050","last_updated":"2025-08-05T03:54:18Z","snapshot_observed_at":"2026-08-09T04:46:02.489265Z","submitted_at":"2025-08-05T03:54:18Z","title":"Multi-human Interactive Talking Dataset","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T04:46:04.123309Z"},"links":{"cited_paper":"/paper/2412.00115","citing_paper":"/paper/2508.03050"},"observation_digest":"sha256:a4f1f0cd04f6f65bec1ea508e04cf04e2b320ff5938703128295d5a7f8d30c20","observation_id":"782103c6-d6b4-4152-bf72-c0d101291091","resolution":{"observed_at":"2026-08-06T04:46:04.123309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04221","last_updated":"2024-10-05T16:30:46Z","snapshot_observed_at":"2026-07-06T19:28:26.436468Z","submitted_at":"2024-10-05T16:30:46Z","title":"TANGO: Co-Speech Gesture Video Reenactment with Hierarchical Audio Motion Embedding and Diffusion Interpolation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04221","snapshot_observed_at":"2026-08-06T04:46:04.127815Z","title":"Tango: Co-speech gesture video reenactment with hierarchical audio motion embedding and diffusion interpolation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03050","last_updated":"2025-08-05T03:54:18Z","snapshot_observed_at":"2026-08-09T04:46:02.489265Z","submitted_at":"2025-08-05T03:54:18Z","title":"Multi-human Interactive Talking Dataset","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T04:46:04.127815Z"},"links":{"cited_paper":"/paper/2410.04221","citing_paper":"/paper/2508.03050"},"observation_digest":"sha256:dd58e3f509f19d2a6b317a795dfad5359836fa16493ee823ce8929e82d56532e","observation_id":"9370856a-bb87-47d2-87dd-38fe730e3878","resolution":{"observed_at":"2026-08-06T04:46:04.127815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:46:08.976927Z","title":"Customlistener: Text-guided responsive interaction for user-friendly listening head generation","venue":null,"work_id":"8d528a4c-83c4-4958-b4e6-03efd0b5811f","year":2024},"citing_paper":{"arxiv_id":"2508.03050","last_updated":"2025-08-05T03:54:18Z","snapshot_observed_at":"2026-08-09T04:46:02.489265Z","submitted_at":"2025-08-05T03:54:18Z","title":"Multi-human Interactive Talking Dataset","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T04:46:04.135037Z"},"links":{"citing_paper":"/paper/2508.03050"},"observation_digest":"sha256:346102b933c0b44efa1fad4509c4e9f7be500e08b17d46ebf849ec71d8bdb4ab","observation_id":"5fb68e29-6299-4801-804f-d9269e44cf0e","resolution":{"observed_at":"2026-08-06T04:46:09.041918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:46:08.834405Z","title":"Learning hierarchical cross-modal association for co-speech gesture generation","venue":null,"work_id":"da5e5aea-ef35-4293-af40-ab2e3cae09c3","year":2022},"citing_paper":{"arxiv_id":"2508.03050","last_updated":"2025-08-05T03:54:18Z","snapshot_observed_at":"2026-08-09T04:46:02.489265Z","submitted_at":"2025-08-05T03:54:18Z","title":"Multi-human Interactive Talking Dataset","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T04:46:04.148338Z"},"links":{"citing_paper":"/paper/2508.03050"},"observation_digest":"sha256:03f7f0f5d76098e128e17d5c8a212b0a9a79866ee689e47f3d107992f33d2f5e","observation_id":"89b6971c-5938-4a0a-9e98-bee54b5bd831","resolution":{"observed_at":"2026-08-06T04:46:08.912736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:46:08.688385Z","title":"Follow your pose: Pose-guided text-to-video generation using pose-free videos","venue":null,"work_id":"8d2adbc2-6f93-44dd-b1ab-06fb41247d8e","year":2024},"citing_paper":{"arxiv_id":"2508.03050","last_updated":"2025-08-05T03:54:18Z","snapshot_observed_at":"2026-08-09T04:46:02.489265Z","submitted_at":"2025-08-05T03:54:18Z","title":"Multi-human Interactive Talking Dataset","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T04:46:04.157908Z"},"links":{"citing_paper":"/paper/2508.03050"},"observation_digest":"sha256:9c92f1f5b6eb3524c9681baf6789da1e30ce671d553299cf8c67f6d0ee278fdb","observation_id":"4848fdaa-7499-4bce-8010-c945cdee0496","resolution":{"observed_at":"2026-08-06T04:46:08.773653Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:46:04.167430Z","title":"Learning to listen: Modeling non-deterministic dyadic facial motion","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.03050","last_updated":"2025-08-05T03:54:18Z","snapshot_observed_at":"2026-08-09T04:46:02.489265Z","submitted_at":"2025-08-05T03:54:18Z","title":"Multi-human Interactive Talking Dataset","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T04:46:04.167430Z"},"links":{"citing_paper":"/paper/2508.03050"},"observation_digest":"sha256:287ea218e24e00b28508c796847b6ed646deeb2b1b015c7b3d71c8ac244a992f","observation_id":"5610ee8e-98c2-4014-9d1b-1a3db1726d28","resolution":{"observed_at":"2026-08-06T04:46:04.167430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:46:04.179142Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.03050","last_updated":"2025-08-05T03:54:18Z","snapshot_observed_at":"2026-08-09T04:46:02.489265Z","submitted_at":"2025-08-05T03:54:18Z","title":"Multi-human Interactive Talking Dataset","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T04:46:04.179142Z"},"links":{"citing_paper":"/paper/2508.03050"},"observation_digest":"sha256:d3c1c93cc9c991d7507bd31f3f0b3d21fe8c7d0bce3bb13721c8464a96114583","observation_id":"67282c5a-0dc5-4cc9-8554-8913de99d050","resolution":{"observed_at":"2026-08-06T04:46:04.179142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06070","last_updated":"2025-03-08T08:43:03Z","snapshot_observed_at":"2026-07-06T18:59:34.520274Z","submitted_at":"2024-08-12T11:41:18Z","title":"ControlNeXt: Powerful and Efficient Control for Image and Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06070","snapshot_observed_at":"2026-08-06T04:46:04.188293Z","title":"Con- trolnext: Powerful and efficient control for image and video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.03050","last_updated":"2025-08-05T03:54:18Z","snapshot_observed_at":"2026-08-09T04:46:02.489265Z","submitted_at":"2025-08-05T03:54:18Z","title":"Multi-human Interactive Talking Dataset","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T04:46:04.188293Z"},"links":{"cited_paper":"/paper/2408.06070","citing_paper":"/paper/2508.03050"},"observation_digest":"sha256:48bb57fe1b40fec350a095c52927adca0fff466fe84790515955700f6563f12a","observation_id":"882adab5-7d3a-4c8a-9520-a8f3cedb2778","resolution":{"observed_at":"2026-08-06T04:46:04.188293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:46:04.197991Z","title":"A lip sync expert is all you need for speech to lip generation in the wild","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.03050","last_updated":"2025-08-05T03:54:18Z","snapshot_observed_at":"2026-08-09T04:46:02.489265Z","submitted_at":"2025-08-05T03:54:18Z","title":"Multi-human Interactive Talking Dataset","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T04:46:04.197991Z"},"links":{"citing_paper":"/paper/2508.03050"},"observation_digest":"sha256:8d45cce97c476bc5e55d5cc8869230a49bddaf801690055f36ee58fb986cc4f9","observation_id":"44850ca4-9bf1-4f9c-9384-6555bf76b903","resolution":{"observed_at":"2026-08-06T04:46:04.197991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:46:08.530909Z","title":"Speech drives templates: Co- speech gesture synthesis with learned templates","venue":null,"work_id":"a60885e1-26bd-496a-938f-eecafb807b4c","year":2021},"citing_paper":{"arxiv_id":"2508.03050","last_updated":"2025-08-05T03:54:18Z","snapshot_observed_at":"2026-08-09T04:46:02.489265Z","submitted_at":"2025-08-05T03:54:18Z","title":"Multi-human Interactive Talking Dataset","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T04:46:04.208672Z"},"links":{"citing_paper":"/paper/2508.03050"},"observation_digest":"sha256:80f0456736e8c7f3be44947450e531b1cbede4354dfa96a0e2d0908a7616a3d7","observation_id":"ed8189e5-f776-49dd-993b-93e31b7833c8","resolution":{"observed_at":"2026-08-06T04:46:08.607230Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:46:04.220246Z","title":"High- resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.03050","last_updated":"2025-08-05T03:54:18Z","snapshot_observed_at":"2026-08-09T04:46:02.489265Z","submitted_at":"2025-08-05T03:54:18Z","title":"Multi-human Interactive Talking Dataset","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T04:46:04.220246Z"},"links":{"citing_paper":"/paper/2508.03050"},"observation_digest":"sha256:bb3465a79e988aa7b71eda98c0577027c5bd8409d56f33cd46c8cc45982e1d6b","observation_id":"80a096b3-0296-45be-a6e4-6eb1d2eae47a","resolution":{"observed_at":"2026-08-06T04:46:04.220246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15477","last_updated":"2025-05-20T23:20:36Z","snapshot_observed_at":"2026-07-06T19:20:46.575837Z","submitted_at":"2024-09-23T18:59:37Z","title":"MediConfusion: Can you trust your AI radiologist? Probing the reliability of multimodal medical foundation models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.15477","snapshot_observed_at":"2026-08-06T04:46:04.233222Z","title":"Mediconfusion: Can you trust your ai radiologist? probing the reliability of multimodal medical foundation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.03050","last_updated":"2025-08-05T03:54:18Z","snapshot_observed_at":"2026-08-09T04:46:02.489265Z","submitted_at":"2025-08-05T03:54:18Z","title":"Multi-human Interactive Talking Dataset","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T04:46:04.233222Z"},"links":{"cited_paper":"/paper/2409.15477","citing_paper":"/paper/2508.03050"},"observation_digest":"sha256:c1a67bc5d9c900d302634fdf128e050e1de231c57d33a7a750da8573f3b2a0a0","observation_id":"b0b63739-a436-4cef-9232-56b0f0fa4212","resolution":{"observed_at":"2026-08-06T04:46:04.233222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14792","last_updated":"2022-09-29T13:59:46Z","snapshot_observed_at":"2026-07-06T13:57:47.051387Z","submitted_at":"2022-09-29T13:59:46Z","title":"Make-A-Video: Text-to-Video Generation without Text-Video Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14792","snapshot_observed_at":"2026-08-06T04:46:04.239375Z","title":"Make-a-video: Text-to-video generation without text-video data","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.03050","last_updated":"2025-08-05T03:54:18Z","snapshot_observed_at":"2026-08-09T04:46:02.489265Z","submitted_at":"2025-08-05T03:54:18Z","title":"Multi-human Interactive Talking Dataset","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T04:46:04.239375Z"},"links":{"cited_paper":"/paper/2209.14792","citing_paper":"/paper/2508.03050"},"observation_digest":"sha256:806970ca5d3c8a147284eb6253ffa22c2adc70b2504362d861584691b1f14de6","observation_id":"c89c97e4-3d0e-475b-add1-2a0b11bc546d","resolution":{"observed_at":"2026-08-06T04:46:04.239375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:46:04.248960Z","title":"Lip reading sentences in the wild","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.03050","last_updated":"2025-08-05T03:54:18Z","snapshot_observed_at":"2026-08-09T04:46:02.489265Z","submitted_at":"2025-08-05T03:54:18Z","title":"Multi-human Interactive Talking Dataset","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T04:46:04.248960Z"},"links":{"citing_paper":"/paper/2508.03050"},"observation_digest":"sha256:0e247cbda7bb98f65cd404fb82b1de4ab57fc55ff67c64c04a68ee590d5422b7","observation_id":"52ef254d-7061-4244-ac43-24e4e974b57d","resolution":{"observed_at":"2026-08-06T04:46:04.248960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14484","last_updated":"2025-09-08T04:39:24Z","snapshot_observed_at":"2026-08-08T02:33:17.377276Z","submitted_at":"2024-12-19T03:10:26Z","title":"Llama Learns to Direct: DirectorLLM for Human-Centric Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14484","snapshot_observed_at":"2026-08-06T04:46:04.259024Z","title":"Directorllm for human-centric video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.03050","last_updated":"2025-08-05T03:54:18Z","snapshot_observed_at":"2026-08-09T04:46:02.489265Z","submitted_at":"2025-08-05T03:54:18Z","title":"Multi-human Interactive Talking Dataset","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T04:46:04.259024Z"},"links":{"cited_paper":"/paper/2412.14484","citing_paper":"/paper/2508.03050"},"observation_digest":"sha256:9ed7bac967abc63f5f46f003fef2f21d7356eb8f6572162ff34d98b24381767d","observation_id":"f110161b-2b44-47a6-848e-45469ae2262d","resolution":{"observed_at":"2026-08-06T04:46:04.259024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:46:08.375518Z","title":"Diffused heads: Diffusion models beat gans on talking-face generation","venue":null,"work_id":"656410ea-a944-44dd-bfdf-3ddee2951477","year":2024},"citing_paper":{"arxiv_id":"2508.03050","last_updated":"2025-08-05T03:54:18Z","snapshot_observed_at":"2026-08-09T04:46:02.489265Z","submitted_at":"2025-08-05T03:54:18Z","title":"Multi-human Interactive Talking Dataset","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T04:46:04.267724Z"},"links":{"citing_paper":"/paper/2508.03050"},"observation_digest":"sha256:2872eb87210deef9ed48318d27a7dce00a58bc919dbebc4cfe2a93d21fc50098","observation_id":"49d27cb2-3f02-41a5-a0a7-1e78d1932a71","resolution":{"observed_at":"2026-08-06T04:46:08.416341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14272","last_updated":"2024-06-20T12:52:46Z","snapshot_observed_at":"2026-08-06T02:56:01.121249Z","submitted_at":"2024-06-20T12:52:46Z","title":"MultiTalk: Enhancing 3D Talking Head Generation Across Languages with Multilingual Video Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14272","snapshot_observed_at":"2026-08-06T04:46:04.277714Z","title":"Multitalk: Enhancing 3d talking head generation across languages with multilingual video dataset","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.03050","last_updated":"2025-08-05T03:54:18Z","snapshot_observed_at":"2026-08-09T04:46:02.489265Z","submitted_at":"2025-08-05T03:54:18Z","title":"Multi-human Interactive Talking Dataset","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T04:46:04.277714Z"},"links":{"cited_paper":"/paper/2406.14272","citing_paper":"/paper/2508.03050"},"observation_digest":"sha256:c373ac1c871f9f32b703bf8b5d63058e32d7f6231fb469dccd6241532edb9d25","observation_id":"1c5507d2-af67-4c7a-9fe8-8d898218fdb2","resolution":{"observed_at":"2026-08-06T04:46:04.277714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:46:08.212839Z","title":"Edtalk: Efficient disentanglement for emotional talking head synthesis","venue":null,"work_id":"3d0bae99-4111-4da5-9410-4158c1a36639","year":2024},"citing_paper":{"arxiv_id":"2508.03050","last_updated":"2025-08-05T03:54:18Z","snapshot_observed_at":"2026-08-09T04:46:02.489265Z","submitted_at":"2025-08-05T03:54:18Z","title":"Multi-human Interactive Talking Dataset","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T04:46:04.288655Z"},"links":{"citing_paper":"/paper/2508.03050"},"observation_digest":"sha256:0b34c7dcf923d71f58a33c776d9bdbd03cc5bc80e314c73eefc5bfc8d514a48f","observation_id":"d0c1f5e6-d51c-4daf-b9f5-2d5f6367ca36","resolution":{"observed_at":"2026-08-06T04:46:08.289330Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09069","last_updated":"2024-07-17T21:53:41Z","snapshot_observed_at":"2026-08-01T08:57:25.832861Z","submitted_at":"2024-03-14T03:21:33Z","title":"Dyadic Interaction Modeling for Social Behavior Generation","version":3},"cited_work":{"arxiv_id":"2403.09069","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.09069","snapshot_observed_at":"2026-08-06T04:46:05.751874Z","title":"Dyadic Interaction Modeling for Social Behavior Generation","venue":"cs.CV","work_id":"b6294e1b-c359-410c-9268-845b1bd5f517","year":2024},"citing_paper":{"arxiv_id":"2508.03050","last_updated":"2025-08-05T03:54:18Z","snapshot_observed_at":"2026-08-09T04:46:02.489265Z","submitted_at":"2025-08-05T03:54:18Z","title":"Multi-human Interactive Talking Dataset","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T04:46:04.305034Z"},"links":{"cited_paper":"/paper/2403.09069","citing_paper":"/paper/2508.03050"},"observation_digest":"sha256:494558ae264138c6200fe4b1248b31ec19a6678699a89ed4088d26e95567da0b","observation_id":"a3925a25-8fac-4919-8aa6-840e946351e4","resolution":{"observed_at":"2026-08-06T04:46:05.855275Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:46:08.047356Z","title":"Realistic speech-driven facial animation with gans","venue":null,"work_id":"c3c43b3d-a9c6-4567-a6a2-ddffbdac6f76","year":2020},"citing_paper":{"arxiv_id":"2508.03050","last_updated":"2025-08-05T03:54:18Z","snapshot_observed_at":"2026-08-09T04:46:02.489265Z","submitted_at":"2025-08-05T03:54:18Z","title":"Multi-human Interactive Talking Dataset","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T04:46:04.317437Z"},"links":{"citing_paper":"/paper/2508.03050"},"observation_digest":"sha256:c879e5a50ff681abd2cb4202fda288acd7dcb912f3195a93bf678db30f099cb7","observation_id":"ec413d04-8900-4808-9b44-97b1fa0e29ae","resolution":{"observed_at":"2026-08-06T04:46:08.112266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17465","last_updated":"2023-12-04T16:49:18Z","snapshot_observed_at":"2026-07-06T16:54:14.216770Z","submitted_at":"2023-11-29T09:13:00Z","title":"AgentAvatar: Disentangling Planning, Driving and Rendering for Photorealistic Avatar Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17465","snapshot_observed_at":"2026-08-06T04:46:04.346797Z","title":"Agentavatar: Disentangling planning, driving and rendering for photorealistic avatar agents","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.03050","last_updated":"2025-08-05T03:54:18Z","snapshot_observed_at":"2026-08-09T04:46:02.489265Z","submitted_at":"2025-08-05T03:54:18Z","title":"Multi-human Interactive Talking Dataset","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T04:46:04.346797Z"},"links":{"cited_paper":"/paper/2311.17465","citing_paper":"/paper/2508.03050"},"observation_digest":"sha256:fce224073df92b5d67b7f9a58de25f9e82b091fdfba8f01873159a160eec2ed4","observation_id":"accf5f45-1e4d-4eda-b2a4-6609cff35088","resolution":{"observed_at":"2026-08-06T04:46:04.346797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16726","last_updated":"2024-12-16T17:11:49Z","snapshot_observed_at":"2026-08-01T19:51:22.869895Z","submitted_at":"2024-11-23T04:38:51Z","title":"EmotiveTalk: Expressive Talking Head Generation through Audio Information Decoupling and Emotional Video Diffusion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.16726","snapshot_observed_at":"2026-08-06T04:46:04.405476Z","title":"Emotivetalk: Expressive talking head generation through audio information decoupling and emotional video diffusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.03050","last_updated":"2025-08-05T03:54:18Z","snapshot_observed_at":"2026-08-09T04:46:02.489265Z","submitted_at":"2025-08-05T03:54:18Z","title":"Multi-human Interactive Talking Dataset","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T04:46:04.405476Z"},"links":{"cited_paper":"/paper/2411.16726","citing_paper":"/paper/2508.03050"},"observation_digest":"sha256:9799c248daf6e663b345199eac6b12dee88307e632042c710c73f54ac4dce92f","observation_id":"3894480e-4fe8-4be3-8cb4-4d99737df128","resolution":{"observed_at":"2026-08-06T04:46:04.405476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:46:07.880431Z","title":"Mead: A large-scale audio-visual dataset for emotional talking-face generation","venue":null,"work_id":"623bf05d-9793-4712-8f35-120308bae8af","year":2020},"citing_paper":{"arxiv_id":"2508.03050","last_updated":"2025-08-05T03:54:18Z","snapshot_observed_at":"2026-08-09T04:46:02.489265Z","submitted_at":"2025-08-05T03:54:18Z","title":"Multi-human Interactive Talking Dataset","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T04:46:04.507674Z"},"links":{"citing_paper":"/paper/2508.03050"},"observation_digest":"sha256:b391012e44b5fb9003a4637c457258b9d674f4753de9dc55bee4b081dd721948","observation_id":"c01e8b70-a59c-4002-baac-3ec27f6e87c4","resolution":{"observed_at":"2026-08-06T04:46:07.975733Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:46:07.738543Z","title":"Draganything: Motion control for anything using entity representation","venue":null,"work_id":"66698f81-fc42-45a2-a893-60b8d38e6e29","year":2024},"citing_paper":{"arxiv_id":"2508.03050","last_updated":"2025-08-05T03:54:18Z","snapshot_observed_at":"2026-08-09T04:46:02.489265Z","submitted_at":"2025-08-05T03:54:18Z","title":"Multi-human Interactive Talking Dataset","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T04:46:04.599303Z"},"links":{"citing_paper":"/paper/2508.03050"},"observation_digest":"sha256:ce9965c2341ae47360b9c8e95fa91c184133e9b1b143665f70c1bf6e0a07cb15","observation_id":"c791ccfc-cd29-40f0-84ed-f9e2f1b706e4","resolution":{"observed_at":"2026-08-06T04:46:07.805118Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:46:04.669820Z","title":"Magicanimate: Temporally consistent human image animation using diffusion model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.03050","last_updated":"2025-08-05T03:54:18Z","snapshot_observed_at":"2026-08-09T04:46:02.489265Z","submitted_at":"2025-08-05T03:54:18Z","title":"Multi-human Interactive Talking Dataset","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T04:46:04.669820Z"},"links":{"citing_paper":"/paper/2508.03050"},"observation_digest":"sha256:c53a32f03b4540353df03391300fc4c4adb06dd0c4259d2adbc495adbbc818de","observation_id":"cde52439-12ea-4f8b-9e43-9842e2f3b7b2","resolution":{"observed_at":"2026-08-06T04:46:04.669820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:46:07.585360Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer","venue":null,"work_id":"e16487f0-9fff-47f0-bbb0-1923eafc53c0","year":2024},"citing_paper":{"arxiv_id":"2508.03050","last_updated":"2025-08-05T03:54:18Z","snapshot_observed_at":"2026-08-09T04:46:02.489265Z","submitted_at":"2025-08-05T03:54:18Z","title":"Multi-human Interactive Talking Dataset","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T04:46:04.734189Z"},"links":{"citing_paper":"/paper/2508.03050"},"observation_digest":"sha256:28cfecfa59c697b0e91857a807869b85eeffce91242c925d1871c10310c1ef69","observation_id":"194abaf8-9235-4387-ae97-1d68579224ba","resolution":{"observed_at":"2026-08-06T04:46:07.641043Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:46:07.423583Z","title":"Show-1: Marrying pixel and latent diffusion models for text-to-video generation","venue":null,"work_id":"20940f2c-5030-43cf-9fdc-24a8f5365bca","year":2024},"citing_paper":{"arxiv_id":"2508.03050","last_updated":"2025-08-05T03:54:18Z","snapshot_observed_at":"2026-08-09T04:46:02.489265Z","submitted_at":"2025-08-05T03:54:18Z","title":"Multi-human Interactive Talking Dataset","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T04:46:04.832246Z"},"links":{"citing_paper":"/paper/2508.03050"},"observation_digest":"sha256:68d955647941e3956ea7da5bc24c5f3fe721587c8ee53878f520e6ed6d845ca6","observation_id":"93cc9205-cab3-4e42-acf8-19831313e13f","resolution":{"observed_at":"2026-08-06T04:46:07.488950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:46:04.910982Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.03050","last_updated":"2025-08-05T03:54:18Z","snapshot_observed_at":"2026-08-09T04:46:02.489265Z","submitted_at":"2025-08-05T03:54:18Z","title":"Multi-human Interactive Talking Dataset","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T04:46:04.910982Z"},"links":{"citing_paper":"/paper/2508.03050"},"observation_digest":"sha256:314bb6e6a34b74afc785af241a07e02dc18ef1282a3b21a1197bcfb13ad91814","observation_id":"8b1f1e3a-64e0-491e-8084-8de15dbb6c95","resolution":{"observed_at":"2026-08-06T04:46:04.910982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:46:07.280294Z","title":"Sadtalker: Learning realistic 3d motion coefficients for stylized audio-driven single image talking face animation","venue":null,"work_id":"9d9c71b8-08d6-4a67-9abd-4f19a3083686","year":2023},"citing_paper":{"arxiv_id":"2508.03050","last_updated":"2025-08-05T03:54:18Z","snapshot_observed_at":"2026-08-09T04:46:02.489265Z","submitted_at":"2025-08-05T03:54:18Z","title":"Multi-human Interactive Talking Dataset","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T04:46:04.954087Z"},"links":{"citing_paper":"/paper/2508.03050"},"observation_digest":"sha256:12a2f6b17897319ee184d299620691a843f9e80c99d3acefaae3b83a58567ee2","observation_id":"08bde3ec-3b0c-4783-a73b-0dd0982db4bb","resolution":{"observed_at":"2026-08-06T04:46:07.337650Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:46:07.091666Z","title":"Flow-guided one-shot talking face generation with a high-resolution audio-visual dataset","venue":null,"work_id":"b1337317-df25-46d0-ba8f-a8f2b4460cfc","year":2021},"citing_paper":{"arxiv_id":"2508.03050","last_updated":"2025-08-05T03:54:18Z","snapshot_observed_at":"2026-08-09T04:46:02.489265Z","submitted_at":"2025-08-05T03:54:18Z","title":"Multi-human Interactive Talking Dataset","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T04:46:05.010072Z"},"links":{"citing_paper":"/paper/2508.03050"},"observation_digest":"sha256:e85b8a4069d03cfcae85873467de9de91211480cecf038eab776d6e54e16f11f","observation_id":"4fb099b9-1173-4346-84d0-3e624918e8a1","resolution":{"observed_at":"2026-08-06T04:46:07.173922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:46:06.929263Z","title":"Responsive listening head generation: a benchmark dataset and baseline","venue":null,"work_id":"aec67dfa-3767-4013-857f-27e9e810cd8b","year":2022},"citing_paper":{"arxiv_id":"2508.03050","last_updated":"2025-08-05T03:54:18Z","snapshot_observed_at":"2026-08-09T04:46:02.489265Z","submitted_at":"2025-08-05T03:54:18Z","title":"Multi-human Interactive Talking Dataset","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T04:46:05.079666Z"},"links":{"citing_paper":"/paper/2508.03050"},"observation_digest":"sha256:4e7f1aa16aae3b4637e14624718d86613e179e3eaf635f9afb2bf4e35c67997e","observation_id":"a8d6a4bf-0880-40a8-be54-6ae719648052","resolution":{"observed_at":"2026-08-06T04:46:07.012112Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02090","last_updated":"2023-07-05T08:06:26Z","snapshot_observed_at":"2026-08-07T07:11:09.347211Z","submitted_at":"2023-07-05T08:06:26Z","title":"Interactive Conversational Head Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.02090","snapshot_observed_at":"2026-08-06T04:46:05.142153Z","title":"Interactive conversational head generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.03050","last_updated":"2025-08-05T03:54:18Z","snapshot_observed_at":"2026-08-09T04:46:02.489265Z","submitted_at":"2025-08-05T03:54:18Z","title":"Multi-human Interactive Talking Dataset","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T04:46:05.142153Z"},"links":{"cited_paper":"/paper/2307.02090","citing_paper":"/paper/2508.03050"},"observation_digest":"sha256:b8012025b031f003db1a435576fb1659874c66db432dfd4e3e34848b277c7ce1","observation_id":"a2503984-6b32-4526-a0ac-39f27d8b765f","resolution":{"observed_at":"2026-08-06T04:46:05.142153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:46:06.766742Z","title":"Audio-driven neural gesture reenactment with video motion graphs","venue":null,"work_id":"218e3da6-1f98-4ccb-8577-e8c36212f87a","year":2022},"citing_paper":{"arxiv_id":"2508.03050","last_updated":"2025-08-05T03:54:18Z","snapshot_observed_at":"2026-08-09T04:46:02.489265Z","submitted_at":"2025-08-05T03:54:18Z","title":"Multi-human Interactive Talking Dataset","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T04:46:05.203642Z"},"links":{"citing_paper":"/paper/2508.03050"},"observation_digest":"sha256:048181da8c664c63cec1c1f8a5e17c819394449f6a3653d3f3745ec95ba11241","observation_id":"714cd6f0-3ada-4664-ae7a-1e3308d5ebf0","resolution":{"observed_at":"2026-08-06T04:46:06.843301Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:46:06.588783Z","title":"Celebv-hq: A large-scale video facial attributes dataset","venue":null,"work_id":"14736cda-4c27-4596-9333-ea36d1c550e1","year":2022},"citing_paper":{"arxiv_id":"2508.03050","last_updated":"2025-08-05T03:54:18Z","snapshot_observed_at":"2026-08-09T04:46:02.489265Z","submitted_at":"2025-08-05T03:54:18Z","title":"Multi-human Interactive Talking Dataset","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T04:46:05.271574Z"},"links":{"citing_paper":"/paper/2508.03050"},"observation_digest":"sha256:bed8180cb68bef1486f8640374b1618bbb1a9062e0bf2a03e4a7ea3fc4cd250c","observation_id":"a22c984e-8a12-4baa-bdc1-e6c6364a5ffb","resolution":{"observed_at":"2026-08-06T04:46:06.678256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:46:06.379802Z","title":"Taming diffusion models for audio-driven co-speech gesture generation","venue":null,"work_id":"85e082dc-c26b-46c1-83aa-215541497c42","year":2023},"citing_paper":{"arxiv_id":"2508.03050","last_updated":"2025-08-05T03:54:18Z","snapshot_observed_at":"2026-08-09T04:46:02.489265Z","submitted_at":"2025-08-05T03:54:18Z","title":"Multi-human Interactive Talking Dataset","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T04:46:05.333389Z"},"links":{"citing_paper":"/paper/2508.03050"},"observation_digest":"sha256:dce20f750323acb8d79555ec2a93bc3c51f17d2dc5d915b94958752c62a009f7","observation_id":"94f3564d-f034-4b36-8adb-d63cb3e3a24d","resolution":{"observed_at":"2026-08-06T04:46:06.486569Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04037","last_updated":"2024-12-05T10:20:34Z","snapshot_observed_at":"2026-08-03T17:56:36.278072Z","submitted_at":"2024-12-05T10:20:34Z","title":"INFP: Audio-Driven Interactive Head Generation in Dyadic Conversations","version":1},"cited_work":{"arxiv_id":"2412.04037","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.04037","snapshot_observed_at":"2026-08-06T04:46:05.518160Z","title":"INFP: Audio-Driven Interactive Head Generation in Dyadic Conversations","venue":"cs.CV","work_id":"9cef4404-d312-42b5-81df-115fcbfb1499","year":2024},"citing_paper":{"arxiv_id":"2508.03050","last_updated":"2025-08-05T03:54:18Z","snapshot_observed_at":"2026-08-09T04:46:02.489265Z","submitted_at":"2025-08-05T03:54:18Z","title":"Multi-human Interactive Talking Dataset","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T04:46:05.382405Z"},"links":{"cited_paper":"/paper/2412.04037","citing_paper":"/paper/2508.03050"},"observation_digest":"sha256:064190b96ef80b5472eb63cdd81ce5baeb4fd8922c3330243c9f33bc7ead00e5","observation_id":"8569be9f-6540-496b-9667-ed88b5a6cfde","resolution":{"observed_at":"2026-08-06T04:46:05.601149Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.03050","last_updated":"2025-08-05T03:54:18Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T04:46:02.489265Z","submitted_at":"2025-08-05T03:54:18Z","title":"Multi-human Interactive Talking Dataset"},"reference_resolution":{"displayed":60,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":29,"verified_exact":3,"verified_fuzzy":28},"total_outbound_references":60},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 60 of 60 outbound references and 0 inbound Pith citation observations for arXiv:2508.03050."}