{"as_of":"2026-08-23T07:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:25dafc0ebac299ad469d5ab16517b3b2d203ff76bf8bee728debc158fa6059d9","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:02:30.549667Z","state":"measured"},{"denominator":79,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":79,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":35,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T00:21:12.302668Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-05T12:41:04.394160Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.20156","last_updated":"2025-06-03T15:15:31Z","snapshot_observed_at":"2026-08-19T03:06:29.083756Z","submitted_at":"2025-05-26T15:57:27Z","title":"HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20156","snapshot_observed_at":"2026-08-15T18:29:40.897824Z","title":"HunyuanVideo-Avatar: High-Fidelity Audio-Driven Hu- man Animation for Multiple Characters.arXiv preprint arXiv:2505.20156, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.19833","last_updated":"2025-06-24T17:50:16Z","snapshot_observed_at":"2026-08-18T10:26:05.461413Z","submitted_at":"2025-06-24T17:50:16Z","title":"Bind-Your-Avatar: Multi-Talking-Character Video Generation with Dynamic 3D-mask-based Embedding Router","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T18:29:40.897824Z"},"links":{"cited_paper":"/paper/2505.20156","citing_paper":"/paper/2506.19833"},"observation_digest":"sha256:4c5589066db9b0bf11e31861206746edad97059060e306bbd0cd5f512057c579","observation_id":"bbce61ed-b268-474d-b389-49af8bed024c","resolution":{"observed_at":"2026-08-15T18:29:40.897824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20156","last_updated":"2025-06-03T15:15:31Z","snapshot_observed_at":"2026-08-19T03:06:29.083756Z","submitted_at":"2025-05-26T15:57:27Z","title":"HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20156","snapshot_observed_at":"2026-08-06T18:51:24.893203Z","title":"Hunyuanvideo-avatar: High-fidelity audio-driven hu- man animation for multiple characters","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-09T23:14:03.004938Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:24.893203Z"},"links":{"cited_paper":"/paper/2505.20156","citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:d7b74833e679a837ec071a9c22be8bd13c2d8e350f5e5c7a3fbd408039abcaa1","observation_id":"79609944-7dee-4bd5-aeee-e6dcfefb663d","resolution":{"observed_at":"2026-08-06T18:51:24.893203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20156","last_updated":"2025-06-03T15:15:31Z","snapshot_observed_at":"2026-08-19T03:06:29.083756Z","submitted_at":"2025-05-26T15:57:27Z","title":"HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20156","snapshot_observed_at":"2026-08-06T17:49:42.835896Z","title":"Hunyuanvideo-avatar: High-fidelity audio-driven hu- man animation for multiple characters","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.09862","last_updated":"2025-07-14T02:22:47Z","snapshot_observed_at":"2026-08-19T21:46:46.680017Z","submitted_at":"2025-07-14T02:22:47Z","title":"SpeakerVid-5M: A Large-Scale High-Quality Dataset for Audio-Visual Dyadic Interactive Human Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T17:49:42.835896Z"},"links":{"cited_paper":"/paper/2505.20156","citing_paper":"/paper/2507.09862"},"observation_digest":"sha256:26d4c884d8e68176a55185b4b851921730428d6eb7754f81b749337adc27cd1a","observation_id":"0119b901-ac10-44ef-9ef1-f8f5ee3bdc63","resolution":{"observed_at":"2026-08-06T17:49:42.835896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20156","last_updated":"2025-06-03T15:15:31Z","snapshot_observed_at":"2026-08-19T03:06:29.083756Z","submitted_at":"2025-05-26T15:57:27Z","title":"HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20156","snapshot_observed_at":"2026-08-15T17:42:41.019438Z","title":"Hunyuanvideo-avatar: High-fidelity audio-driven hu- man animation for multiple characters","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-22T09:42:52.422920Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T17:42:41.019438Z"},"links":{"cited_paper":"/paper/2505.20156","citing_paper":"/paper/2508.08248"},"observation_digest":"sha256:e0249bc6fa8b8df690ad7f6a373d3ffe71e64524de2c5c543ee01d33c51c5dfb","observation_id":"0301e8b9-c0db-4444-bf66-3fabdaf38afe","resolution":{"observed_at":"2026-08-15T17:42:41.019438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20156","last_updated":"2025-06-03T15:15:31Z","snapshot_observed_at":"2026-08-19T03:06:29.083756Z","submitted_at":"2025-05-26T15:57:27Z","title":"HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20156","snapshot_observed_at":"2026-08-05T20:06:45.351100Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.11255","last_updated":"2025-08-15T06:43:46Z","snapshot_observed_at":"2026-08-15T12:40:44.223386Z","submitted_at":"2025-08-15T06:43:46Z","title":"FantasyTalking2: Timestep-Layer Adaptive Preference Optimization for Audio-Driven Portrait Animation","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-05T20:06:45.351100Z"},"links":{"cited_paper":"/paper/2505.20156","citing_paper":"/paper/2508.11255"},"observation_digest":"sha256:ebe5e8e65c9f066f471186021647c0db384abf89a8de89b79597da147280632f","observation_id":"c1e1bfbd-c25a-43d2-95b4-104ee8d9c7c3","resolution":{"observed_at":"2026-08-05T20:06:45.351100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20156","last_updated":"2025-06-03T15:15:31Z","snapshot_observed_at":"2026-08-19T03:06:29.083756Z","submitted_at":"2025-05-26T15:57:27Z","title":"HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20156","snapshot_observed_at":"2026-08-05T18:50:16.212957Z","title":"Hunyuanvideo-avatar: High-fidelity audio-driven human animation for multiple characters.arXiv preprint arXiv:2505.20156, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.14033","last_updated":"2025-08-19T17:55:23Z","snapshot_observed_at":"2026-08-18T04:45:00.241729Z","submitted_at":"2025-08-19T17:55:23Z","title":"InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-05T18:50:16.212957Z"},"links":{"cited_paper":"/paper/2505.20156","citing_paper":"/paper/2508.14033"},"observation_digest":"sha256:47f9eb6ab792869c921f5e076ed0ee3c05fddef52963c349524e0a881b4ba0e1","observation_id":"4e38b2e0-a4b8-4d3e-8f2d-23f112e447c1","resolution":{"observed_at":"2026-08-05T18:50:16.212957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20156","last_updated":"2025-06-03T15:15:31Z","snapshot_observed_at":"2026-08-19T03:06:29.083756Z","submitted_at":"2025-05-26T15:57:27Z","title":"HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20156","snapshot_observed_at":"2026-08-05T16:24:58.625126Z","title":"9 Joon Son Chung and Andrew Zisserman","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-15T01:56:17.706891Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-05T16:24:58.625126Z"},"links":{"cited_paper":"/paper/2505.20156","citing_paper":"/paper/2508.18621"},"observation_digest":"sha256:9f578a79b5d188cb22476631da58b2693ea337b3112cfb7cabcdb607c562e94d","observation_id":"3e091873-51f3-4079-b666-ccbce3d342bf","resolution":{"observed_at":"2026-08-05T16:24:58.625126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20156","last_updated":"2025-06-03T15:15:31Z","snapshot_observed_at":"2026-08-19T03:06:29.083756Z","submitted_at":"2025-05-26T15:57:27Z","title":"HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20156","snapshot_observed_at":"2026-08-05T15:19:37.088684Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-11T09:08:07.295323Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:37.088684Z"},"links":{"cited_paper":"/paper/2505.20156","citing_paper":"/paper/2508.20210"},"observation_digest":"sha256:cf553c1c899dc0b329f50b2ad0294a18f265dda683578598767a79549021a20c","observation_id":"69e9fe5b-c627-4661-b3b4-3e72b6611d20","resolution":{"observed_at":"2026-08-05T15:19:37.088684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20156","last_updated":"2025-06-03T15:15:31Z","snapshot_observed_at":"2026-08-19T03:06:29.083756Z","submitted_at":"2025-05-26T15:57:27Z","title":"HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20156","snapshot_observed_at":"2026-08-05T00:05:47.280317Z","title":"Hunyuanvideo-avatar: High-fidelity audio-driven human animation for multiple characters","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06155","last_updated":"2025-09-07T17:55:03Z","snapshot_observed_at":"2026-08-20T05:56:51.995983Z","submitted_at":"2025-09-07T17:55:03Z","title":"UniVerse-1: Unified Audio-Video Generation via Stitching of Experts","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T00:05:47.280317Z"},"links":{"cited_paper":"/paper/2505.20156","citing_paper":"/paper/2509.06155"},"observation_digest":"sha256:2598fe8bbc0be9b5ba34ca18d23aae053d2eafb1b185b5704b108922a9c79be5","observation_id":"e5cf9909-4892-42ea-8df7-cc66e9a7d1da","resolution":{"observed_at":"2026-08-05T00:05:47.280317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20156","last_updated":"2025-06-03T15:15:31Z","snapshot_observed_at":"2026-08-19T03:06:29.083756Z","submitted_at":"2025-05-26T15:57:27Z","title":"HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20156","snapshot_observed_at":"2026-08-03T16:25:54.145826Z","title":"Hunyuanvideo-avatar: High-fidelity audio-driven human animation for multiple characters.arXiv preprint arXiv:2505.20156, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.13677","last_updated":"2026-07-31T15:26:54Z","snapshot_observed_at":"2026-08-16T01:03:28.277020Z","submitted_at":"2025-12-15T18:58:18Z","title":"JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T16:25:54.145826Z"},"links":{"cited_paper":"/paper/2505.20156","citing_paper":"/paper/2512.13677"},"observation_digest":"sha256:51c3a857f87ee3218dc4f191895a090234560185b36a13368dad685f95dab4e0","observation_id":"2818ee41-0988-4952-81f6-d2edff52087b","resolution":{"observed_at":"2026-08-03T16:25:54.145826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20156","last_updated":"2025-06-03T15:15:31Z","snapshot_observed_at":"2026-08-19T03:06:29.083756Z","submitted_at":"2025-05-26T15:57:27Z","title":"HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters","version":2},"cited_work":{"arxiv_id":"2505.20156","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.20156","snapshot_observed_at":"2026-07-05T12:41:04.394160Z","title":"Hunyuanvideo-avatar: High-fidelity audio-driven human animation for multiple characters","venue":"cs.CV","work_id":"cb746e54-5ed4-4c60-903c-02e347b9ddf0","year":2025},"citing_paper":{"arxiv_id":"2602.13669","last_updated":"2026-04-22T07:41:44Z","snapshot_observed_at":"2026-08-11T04:55:53.338738Z","submitted_at":"2026-02-14T08:32:38Z","title":"EchoTorrent: Towards Swift, Sustained, and Streaming Multi-Modal Video Generation","version":5},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-15T22:20:16.320171Z"},"links":{"cited_paper":"/paper/2505.20156","citing_paper":"/paper/2602.13669"},"observation_digest":"sha256:84cddbad93f97b587d8d0b83541768c866a02c3286da0649e1380d2cafed658b","observation_id":"15816203-5205-4098-927d-b2ccc98fb5e1","resolution":{"observed_at":"2026-05-15T22:20:22.405659Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20156","last_updated":"2025-06-03T15:15:31Z","snapshot_observed_at":"2026-08-19T03:06:29.083756Z","submitted_at":"2025-05-26T15:57:27Z","title":"HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters","version":2},"cited_work":{"arxiv_id":"2505.20156","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.20156","snapshot_observed_at":"2026-07-05T12:41:04.394160Z","title":"Hunyuanvideo-avatar: High-fidelity audio-driven human animation for multiple characters","venue":"cs.CV","work_id":"cb746e54-5ed4-4c60-903c-02e347b9ddf0","year":2025},"citing_paper":{"arxiv_id":"2604.09057","last_updated":"2026-04-16T03:03:01Z","snapshot_observed_at":"2026-08-11T02:10:16.564282Z","submitted_at":"2026-04-10T07:37:03Z","title":"Tora3: Trajectory-Guided Audio-Video Generation with Physical Coherence","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T17:13:06.005185Z"},"links":{"cited_paper":"/paper/2505.20156","citing_paper":"/paper/2604.09057"},"observation_digest":"sha256:aa707ca2a4a6ff120c6de32232a399dfeb0dd06a8968d09ade3d10464713c5f8","observation_id":"48f3ba57-29a5-4ed1-8edf-3887bff17dad","resolution":{"observed_at":"2026-05-11T07:20:58.617276Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20156","last_updated":"2025-06-03T15:15:31Z","snapshot_observed_at":"2026-08-19T03:06:29.083756Z","submitted_at":"2025-05-26T15:57:27Z","title":"HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters","version":2},"cited_work":{"arxiv_id":"2505.20156","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.20156","snapshot_observed_at":"2026-07-05T12:41:04.394160Z","title":"Hunyuanvideo-avatar: High-fidelity audio-driven human animation for multiple characters","venue":"cs.CV","work_id":"cb746e54-5ed4-4c60-903c-02e347b9ddf0","year":2025},"citing_paper":{"arxiv_id":"2604.11804","last_updated":"2026-04-17T08:08:09Z","snapshot_observed_at":"2026-08-06T16:53:42.723002Z","submitted_at":"2026-04-13T17:59:12Z","title":"OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:02.727887Z"},"links":{"cited_paper":"/paper/2505.20156","citing_paper":"/paper/2604.11804"},"observation_digest":"sha256:b48b589a2a0a127511dd7c0a2ec34129beffd3f483bde6a2233acbb488a4fbe6","observation_id":"a70e2c08-2720-43c8-ab53-4ee090b879ef","resolution":{"observed_at":"2026-05-11T11:11:00.831890Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20156","last_updated":"2025-06-03T15:15:31Z","snapshot_observed_at":"2026-08-19T03:06:29.083756Z","submitted_at":"2025-05-26T15:57:27Z","title":"HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters","version":2},"cited_work":{"arxiv_id":"2505.20156","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.20156","snapshot_observed_at":"2026-07-05T12:41:04.394160Z","title":"Hunyuanvideo-avatar: High-fidelity audio-driven human animation for multiple characters","venue":"cs.CV","work_id":"cb746e54-5ed4-4c60-903c-02e347b9ddf0","year":2025},"citing_paper":{"arxiv_id":"2604.18326","last_updated":"2026-05-30T12:42:13Z","snapshot_observed_at":"2026-08-16T04:04:29.404446Z","submitted_at":"2026-04-20T14:28:51Z","title":"OmniHuman: A Large-scale Dataset and Benchmark for Human-Centric Video Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T05:19:49.671136Z"},"links":{"cited_paper":"/paper/2505.20156","citing_paper":"/paper/2604.18326"},"observation_digest":"sha256:dceb830f43bc8d65c8568dba396cf342f2998bc34f153813369bdcbd15cb5cb5","observation_id":"ce62eea3-9924-4266-8bff-633d54a0591f","resolution":{"observed_at":"2026-05-10T05:20:54.957167Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20156","last_updated":"2025-06-03T15:15:31Z","snapshot_observed_at":"2026-08-19T03:06:29.083756Z","submitted_at":"2025-05-26T15:57:27Z","title":"HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters","version":2},"cited_work":{"arxiv_id":"2505.20156","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.20156","snapshot_observed_at":"2026-07-05T12:41:04.394160Z","title":"Hunyuanvideo-avatar: High-fidelity audio-driven human animation for multiple characters","venue":"cs.CV","work_id":"cb746e54-5ed4-4c60-903c-02e347b9ddf0","year":2025},"citing_paper":{"arxiv_id":"2604.18326","last_updated":"2026-05-30T12:42:13Z","snapshot_observed_at":"2026-08-16T04:04:29.404446Z","submitted_at":"2026-04-20T14:28:51Z","title":"OmniHuman: A Large-scale Dataset and Benchmark for Human-Centric Video Generation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-05T12:34:41.758238Z"},"links":{"cited_paper":"/paper/2505.20156","citing_paper":"/paper/2604.18326"},"observation_digest":"sha256:1c2b058ac82b9c7f5bfe39a193ee56108f4e4db1cb676954da5b107764403fb6","observation_id":"16c1e838-08b9-4157-b9ce-21d3e0227c44","resolution":{"observed_at":"2026-07-05T12:41:04.395475Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20156","last_updated":"2025-06-03T15:15:31Z","snapshot_observed_at":"2026-08-19T03:06:29.083756Z","submitted_at":"2025-05-26T15:57:27Z","title":"HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters","version":2},"cited_work":{"arxiv_id":"2505.20156","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.20156","snapshot_observed_at":"2026-07-05T12:41:04.394160Z","title":"Hunyuanvideo-avatar: High-fidelity audio-driven human animation for multiple characters","venue":"cs.CV","work_id":"cb746e54-5ed4-4c60-903c-02e347b9ddf0","year":2025},"citing_paper":{"arxiv_id":"2604.23629","last_updated":"2026-05-09T12:26:33Z","snapshot_observed_at":"2026-08-14T12:34:00.834574Z","submitted_at":"2026-04-26T09:44:06Z","title":"From Visual Synthesis to Interactive Worlds: Toward Production-Ready 3D Asset Generation","version":1},"reference_index":239,"source":"pdf_text","source_observed_at":"2026-05-08T05:12:55.062360Z"},"links":{"cited_paper":"/paper/2505.20156","citing_paper":"/paper/2604.23629"},"observation_digest":"sha256:d78bdbe151803f3849fb00cc2d9a9e21fed72ef23d56c0e23eda2bf251dc2516","observation_id":"45966fcc-bf53-4162-a8f3-8c566350d129","resolution":{"observed_at":"2026-05-11T21:31:16.993284Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20156","last_updated":"2025-06-03T15:15:31Z","snapshot_observed_at":"2026-08-19T03:06:29.083756Z","submitted_at":"2025-05-26T15:57:27Z","title":"HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters","version":2},"cited_work":{"arxiv_id":"2505.20156","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.20156","snapshot_observed_at":"2026-07-05T12:41:04.394160Z","title":"Hunyuanvideo-avatar: High-fidelity audio-driven human animation for multiple characters","venue":"cs.CV","work_id":"cb746e54-5ed4-4c60-903c-02e347b9ddf0","year":2025},"citing_paper":{"arxiv_id":"2604.23629","last_updated":"2026-05-09T12:26:33Z","snapshot_observed_at":"2026-08-14T12:34:00.834574Z","submitted_at":"2026-04-26T09:44:06Z","title":"From Visual Synthesis to Interactive Worlds: Toward Production-Ready 3D Asset Generation","version":2},"reference_index":239,"source":"pdf_text","source_observed_at":"2026-05-12T01:55:13.370339Z"},"links":{"cited_paper":"/paper/2505.20156","citing_paper":"/paper/2604.23629"},"observation_digest":"sha256:72dfd69e0e3817a9b1ab2e2a5069799162e0066bdb27218e642f7ba67a46eab0","observation_id":"9b87c130-bc3b-4952-be35-5a430522ed65","resolution":{"observed_at":"2026-05-12T01:56:14.940154Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20156","last_updated":"2025-06-03T15:15:31Z","snapshot_observed_at":"2026-08-19T03:06:29.083756Z","submitted_at":"2025-05-26T15:57:27Z","title":"HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters","version":2},"cited_work":{"arxiv_id":"2505.20156","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.20156","snapshot_observed_at":"2026-07-05T12:41:04.394160Z","title":"Hunyuanvideo-avatar: High-fidelity audio-driven human animation for multiple characters","venue":"cs.CV","work_id":"cb746e54-5ed4-4c60-903c-02e347b9ddf0","year":2025},"citing_paper":{"arxiv_id":"2604.27918","last_updated":"2026-04-30T14:22:27Z","snapshot_observed_at":"2026-08-13T15:04:09.568604Z","submitted_at":"2026-04-30T14:22:27Z","title":"Generate Your Talking Avatar from Video Reference","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-07T05:32:04.519820Z"},"links":{"cited_paper":"/paper/2505.20156","citing_paper":"/paper/2604.27918"},"observation_digest":"sha256:592025dce3db24aaff4876a69b264aed9df4de09df45c0a3022a39490aa31c6b","observation_id":"cd038643-1325-41d9-97b7-c5b75ad4e314","resolution":{"observed_at":"2026-05-12T10:36:29.817723Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20156","last_updated":"2025-06-03T15:15:31Z","snapshot_observed_at":"2026-08-19T03:06:29.083756Z","submitted_at":"2025-05-26T15:57:27Z","title":"HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters","version":2},"cited_work":{"arxiv_id":"2505.20156","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.20156","snapshot_observed_at":"2026-07-05T12:41:04.394160Z","title":"Hunyuanvideo-avatar: High-fidelity audio-driven human animation for multiple characters","venue":"cs.CV","work_id":"cb746e54-5ed4-4c60-903c-02e347b9ddf0","year":2025},"citing_paper":{"arxiv_id":"2605.06912","last_updated":"2026-05-07T20:22:32Z","snapshot_observed_at":"2026-08-11T05:27:38.333763Z","submitted_at":"2026-05-07T20:22:32Z","title":"Advancing Reliable Synthetic Video Detection: Insights from the SAFE Challenge","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-11T00:53:18.735506Z"},"links":{"cited_paper":"/paper/2505.20156","citing_paper":"/paper/2605.06912"},"observation_digest":"sha256:030bd43d1f52ed038466af6ad278e1b478af0c71bb71c5a94d493b349029e322","observation_id":"7254af00-a8c2-424c-83b9-bb3452c290ad","resolution":{"observed_at":"2026-05-11T05:00:57.489097Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20156","last_updated":"2025-06-03T15:15:31Z","snapshot_observed_at":"2026-08-19T03:06:29.083756Z","submitted_at":"2025-05-26T15:57:27Z","title":"HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters","version":2},"cited_work":{"arxiv_id":"2505.20156","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.20156","snapshot_observed_at":"2026-07-05T12:41:04.394160Z","title":"Hunyuanvideo-avatar: High-fidelity audio-driven human animation for multiple characters","venue":"cs.CV","work_id":"cb746e54-5ed4-4c60-903c-02e347b9ddf0","year":2025},"citing_paper":{"arxiv_id":"2605.10079","last_updated":"2026-05-11T07:01:38Z","snapshot_observed_at":"2026-08-17T23:56:38.620522Z","submitted_at":"2026-05-11T07:01:38Z","title":"SocialDirector: Training-Free Social Interaction Control for Multi-Person Video Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-12T03:28:30.471533Z"},"links":{"cited_paper":"/paper/2505.20156","citing_paper":"/paper/2605.10079"},"observation_digest":"sha256:fab47014fe3611caff445ed463e9aa356a5b3b659a8a8ffab2fc6883a515cd83","observation_id":"2840d6b3-c54c-4c46-9b33-871a4055e74e","resolution":{"observed_at":"2026-05-12T07:21:23.980846Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20156","last_updated":"2025-06-03T15:15:31Z","snapshot_observed_at":"2026-08-19T03:06:29.083756Z","submitted_at":"2025-05-26T15:57:27Z","title":"HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters","version":2},"cited_work":{"arxiv_id":"2505.20156","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.20156","snapshot_observed_at":"2026-07-05T12:41:04.394160Z","title":"Hunyuanvideo-avatar: High-fidelity audio-driven human animation for multiple characters","venue":"cs.CV","work_id":"cb746e54-5ed4-4c60-903c-02e347b9ddf0","year":2025},"citing_paper":{"arxiv_id":"2605.15042","last_updated":"2026-05-14T16:36:34Z","snapshot_observed_at":"2026-08-15T12:46:54.250833Z","submitted_at":"2026-05-14T16:36:34Z","title":"EverAnimate: Minute-Scale Human Animation via Latent Flow Restoration","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-30T21:21:58.123630Z"},"links":{"cited_paper":"/paper/2505.20156","citing_paper":"/paper/2605.15042"},"observation_digest":"sha256:f3d4fb25e4688f40bde52de90ffb4bd9c17bbf0c87f67ee07da10ca756a48183","observation_id":"0f1ac7a1-5ba9-4776-9c18-c41a47b34b47","resolution":{"observed_at":"2026-06-30T21:25:04.977138Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20156","last_updated":"2025-06-03T15:15:31Z","snapshot_observed_at":"2026-08-19T03:06:29.083756Z","submitted_at":"2025-05-26T15:57:27Z","title":"HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters","version":2},"cited_work":{"arxiv_id":"2505.20156","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.20156","snapshot_observed_at":"2026-07-05T12:41:04.394160Z","title":"Hunyuanvideo-avatar: High-fidelity audio-driven human animation for multiple characters","venue":"cs.CV","work_id":"cb746e54-5ed4-4c60-903c-02e347b9ddf0","year":2025},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-16T00:14:17.051626Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"cited_paper":"/paper/2505.20156","citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:9518dc5a3604eb167a271ec624760d3c1ab00bae71d3e1e9a7e78064dd5181ac","observation_id":"6993e1d7-5a78-4019-a386-b96d18e52023","resolution":{"observed_at":"2026-05-20T15:08:25.087991Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20156","last_updated":"2025-06-03T15:15:31Z","snapshot_observed_at":"2026-08-19T03:06:29.083756Z","submitted_at":"2025-05-26T15:57:27Z","title":"HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters","version":2},"cited_work":{"arxiv_id":"2505.20156","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.20156","snapshot_observed_at":"2026-07-05T12:41:04.394160Z","title":"Hunyuanvideo-avatar: High-fidelity audio-driven human animation for multiple characters","venue":"cs.CV","work_id":"cb746e54-5ed4-4c60-903c-02e347b9ddf0","year":2025},"citing_paper":{"arxiv_id":"2605.26486","last_updated":"2026-05-26T02:54:12Z","snapshot_observed_at":"2026-08-19T12:44:18.273863Z","submitted_at":"2026-05-26T02:54:12Z","title":"LongCat-Video-Avatar 1.5 Technical Report","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-29T18:28:16.968339Z"},"links":{"cited_paper":"/paper/2505.20156","citing_paper":"/paper/2605.26486"},"observation_digest":"sha256:0c2fbf518a5ae439a3f3ee1af67a6a50fb3f08dd971c181858f19e4cc1166dcb","observation_id":"7f083a95-514a-49f4-84fa-b92b464bbf32","resolution":{"observed_at":"2026-06-29T18:33:50.666638Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20156","last_updated":"2025-06-03T15:15:31Z","snapshot_observed_at":"2026-08-19T03:06:29.083756Z","submitted_at":"2025-05-26T15:57:27Z","title":"HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters","version":2},"cited_work":{"arxiv_id":"2505.20156","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.20156","snapshot_observed_at":"2026-07-05T12:41:04.394160Z","title":"Hunyuanvideo-avatar: High-fidelity audio-driven human animation for multiple characters","venue":"cs.CV","work_id":"cb746e54-5ed4-4c60-903c-02e347b9ddf0","year":2025},"citing_paper":{"arxiv_id":"2605.30083","last_updated":"2026-05-28T15:30:04Z","snapshot_observed_at":"2026-08-08T04:25:10.823052Z","submitted_at":"2026-05-28T15:30:04Z","title":"Future Forcing: Future-aware Training-free KV Cache Policy for Autoregressive Video Generation","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-06-29T08:30:00.438334Z"},"links":{"cited_paper":"/paper/2505.20156","citing_paper":"/paper/2605.30083"},"observation_digest":"sha256:7ed46f7c6f1c6aabea81d3213c3de0fa3428e016efd6d6325357ac599ff2be34","observation_id":"de7144ba-08db-4dbb-80bb-e66e8427185d","resolution":{"observed_at":"2026-06-29T08:33:15.133861Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20156","last_updated":"2025-06-03T15:15:31Z","snapshot_observed_at":"2026-08-19T03:06:29.083756Z","submitted_at":"2025-05-26T15:57:27Z","title":"HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters","version":2},"cited_work":{"arxiv_id":"2505.20156","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.20156","snapshot_observed_at":"2026-07-05T12:41:04.394160Z","title":"Hunyuanvideo-avatar: High-fidelity audio-driven human animation for multiple characters","venue":"cs.CV","work_id":"cb746e54-5ed4-4c60-903c-02e347b9ddf0","year":2025},"citing_paper":{"arxiv_id":"2606.22905","last_updated":"2026-06-30T08:27:33Z","snapshot_observed_at":"2026-08-12T18:44:08.929234Z","submitted_at":"2026-06-22T06:41:17Z","title":"InteractiveAvatar: Real-Time Streaming Video Generation for Consistent and Intent-Aware Avatars","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-26T09:09:06.925645Z"},"links":{"cited_paper":"/paper/2505.20156","citing_paper":"/paper/2606.22905"},"observation_digest":"sha256:efd3a6e23d8eb73766effe446571070cb6308a5a8d9889713877a9bcb0e9df92","observation_id":"f9769dbf-ff53-41ef-9735-3571dab8ec85","resolution":{"observed_at":"2026-07-04T10:09:44.578759Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20156","last_updated":"2025-06-03T15:15:31Z","snapshot_observed_at":"2026-08-19T03:06:29.083756Z","submitted_at":"2025-05-26T15:57:27Z","title":"HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters","version":2},"cited_work":{"arxiv_id":"2505.20156","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.20156","snapshot_observed_at":"2026-07-05T12:41:04.394160Z","title":"Hunyuanvideo-avatar: High-fidelity audio-driven human animation for multiple characters","venue":"cs.CV","work_id":"cb746e54-5ed4-4c60-903c-02e347b9ddf0","year":2025},"citing_paper":{"arxiv_id":"2606.22905","last_updated":"2026-06-30T08:27:33Z","snapshot_observed_at":"2026-08-12T18:44:08.929234Z","submitted_at":"2026-06-22T06:41:17Z","title":"InteractiveAvatar: Real-Time Streaming Video Generation for Consistent and Intent-Aware Avatars","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-01T07:00:53.496569Z"},"links":{"cited_paper":"/paper/2505.20156","citing_paper":"/paper/2606.22905"},"observation_digest":"sha256:be0911ed617f49ea1bb4f0dd05eb725245f1d4e0dae4e2440ec151908fdc8ddd","observation_id":"ba3ef183-f07e-40c1-984b-5a75ef2ad9d3","resolution":{"observed_at":"2026-07-01T07:05:29.096627Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20156","last_updated":"2025-06-03T15:15:31Z","snapshot_observed_at":"2026-08-19T03:06:29.083756Z","submitted_at":"2025-05-26T15:57:27Z","title":"HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters","version":2},"cited_work":{"arxiv_id":"2505.20156","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.20156","snapshot_observed_at":"2026-07-05T12:41:04.394160Z","title":"Hunyuanvideo-avatar: High-fidelity audio-driven human animation for multiple characters","venue":"cs.CV","work_id":"cb746e54-5ed4-4c60-903c-02e347b9ddf0","year":2025},"citing_paper":{"arxiv_id":"2606.30849","last_updated":"2026-06-29T19:26:13Z","snapshot_observed_at":"2026-08-02T00:44:38.626792Z","submitted_at":"2026-06-29T19:26:13Z","title":"SyncCache: Exploiting Asymmetric Dynamics for Fast Audio-Driven Portrait Animation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-01T06:13:11.504526Z"},"links":{"cited_paper":"/paper/2505.20156","citing_paper":"/paper/2606.30849"},"observation_digest":"sha256:7caefb27855e53337673ec9bb1e96e63c42f0c12d65937339eee01a6f4bdbed0","observation_id":"99bb1fc8-4679-4fe4-b37a-b62d049c71b9","resolution":{"observed_at":"2026-07-01T09:45:40.333810Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20156","last_updated":"2025-06-03T15:15:31Z","snapshot_observed_at":"2026-08-19T03:06:29.083756Z","submitted_at":"2025-05-26T15:57:27Z","title":"HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20156","snapshot_observed_at":"2026-08-01T05:27:15.550477Z","title":"Hunyuanvideo-avatar: High-fidelity audio-driven hu- man animation for multiple characters.arXiv preprint arXiv:2505.20156, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22241","last_updated":"2026-07-30T03:34:42Z","snapshot_observed_at":"2026-08-15T05:30:04.018365Z","submitted_at":"2026-07-24T12:17:57Z","title":"AgentHOI: Multi-Agent Reasoning for Human-Object-Interaction Video Generation via Implicit Representation Alignment","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T05:27:15.550477Z"},"links":{"cited_paper":"/paper/2505.20156","citing_paper":"/paper/2607.22241"},"observation_digest":"sha256:e4a5eef6e05e75e2fa15e1168d72a27a74866ce98b4bc0b252a66f3ce7782490","observation_id":"9ddd5501-accf-41aa-b8e0-34c74969c051","resolution":{"observed_at":"2026-08-01T05:27:15.550477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20156","last_updated":"2025-06-03T15:15:31Z","snapshot_observed_at":"2026-08-19T03:06:29.083756Z","submitted_at":"2025-05-26T15:57:27Z","title":"HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20156","snapshot_observed_at":"2026-08-01T03:52:55.409252Z","title":"arXiv preprint arXiv:2505.20156 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23023","last_updated":"2026-07-28T02:01:27Z","snapshot_observed_at":"2026-08-18T22:20:10.192450Z","submitted_at":"2026-07-25T03:42:52Z","title":"OmniMate: Open-Ended Real-Time Streaming Audio-Visual Generation for Interactive Avatars","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-01T03:52:55.409252Z"},"links":{"cited_paper":"/paper/2505.20156","citing_paper":"/paper/2607.23023"},"observation_digest":"sha256:fe3058cbb250e814816e627898e3514c136c677d794252edddb65d7ade6b6c6e","observation_id":"5debf619-80d7-4f30-b701-caf13a5f782e","resolution":{"observed_at":"2026-08-01T03:52:55.409252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20156","last_updated":"2025-06-03T15:15:31Z","snapshot_observed_at":"2026-08-19T03:06:29.083756Z","submitted_at":"2025-05-26T15:57:27Z","title":"HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20156","snapshot_observed_at":"2026-07-31T23:18:59.579082Z","title":"2505.20156 , archivePrefix=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24013","last_updated":"2026-07-29T08:53:30Z","snapshot_observed_at":"2026-08-15T11:57:31.456434Z","submitted_at":"2026-07-27T05:21:40Z","title":"AptAvatar: Fast and Vivid Long-Form Audio-Driven Video Generation for Production-Ready Avatars","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-07-31T23:18:59.579082Z"},"links":{"cited_paper":"/paper/2505.20156","citing_paper":"/paper/2607.24013"},"observation_digest":"sha256:d3e8409d903183b795d193446900679da758412909dbfcb7790a857740f5cd17","observation_id":"bdcf06bc-8e18-4506-977f-6f1d8ac4919a","resolution":{"observed_at":"2026-07-31T23:18:59.579082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20156","last_updated":"2025-06-03T15:15:31Z","snapshot_observed_at":"2026-08-19T03:06:29.083756Z","submitted_at":"2025-05-26T15:57:27Z","title":"HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20156","snapshot_observed_at":"2026-08-15T15:14:35.982238Z","title":"Hunyuanvideo-avatar: High-fidelity audio-driven hu- man animation for multiple characters.arXiv preprint arXiv:2505.20156, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-20T18:07:33.675539Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:35.982238Z"},"links":{"cited_paper":"/paper/2505.20156","citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:91c01eb0a7693396a04c4be63d8e5f8b6d58944349cb48f865d92ddf882498a1","observation_id":"408e0bc6-58b0-4827-b1be-96613547c5e7","resolution":{"observed_at":"2026-08-15T15:14:35.982238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20156","last_updated":"2025-06-03T15:15:31Z","snapshot_observed_at":"2026-08-19T03:06:29.083756Z","submitted_at":"2025-05-26T15:57:27Z","title":"HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20156","snapshot_observed_at":"2026-08-06T00:31:25.258190Z","title":"Hunyuanvideo-avatar: High-fidelity audio-driven human animation for multiple characters.arXiv preprint arXiv:2505.20156, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01157","last_updated":"2026-08-02T11:28:13Z","snapshot_observed_at":"2026-08-08T03:59:35.155645Z","submitted_at":"2026-08-02T11:28:13Z","title":"InteracVid: Building a Real Interactive Audio-Visual Response Dataset from Live-Chat Videos","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T00:31:25.258190Z"},"links":{"cited_paper":"/paper/2505.20156","citing_paper":"/paper/2608.01157"},"observation_digest":"sha256:ac4a4a961aec1cba4040dd04281dad50eef6ec7141171a8dde6328e9653ad585","observation_id":"c3a629d6-5bce-4156-9c88-8156fd355e42","resolution":{"observed_at":"2026-08-06T00:31:25.258190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20156","last_updated":"2025-06-03T15:15:31Z","snapshot_observed_at":"2026-08-19T03:06:29.083756Z","submitted_at":"2025-05-26T15:57:27Z","title":"HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20156","snapshot_observed_at":"2026-08-04T06:45:46.240639Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02474","last_updated":"2026-08-17T07:57:59Z","snapshot_observed_at":"2026-08-20T23:16:59.964838Z","submitted_at":"2026-08-03T16:42:54Z","title":"EchoCache: Energy-Guided Cross-Modal Caching for Efficient Audio-Driven Video Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T06:45:46.240639Z"},"links":{"cited_paper":"/paper/2505.20156","citing_paper":"/paper/2608.02474"},"observation_digest":"sha256:a69fb6d84b628de8bbfa0455afdedcaee375b47a6853b892e9966a7f19ff00bb","observation_id":"b1bd9306-469f-4ce9-90b3-eab397e300ab","resolution":{"observed_at":"2026-08-04T06:45:46.240639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20156","last_updated":"2025-06-03T15:15:31Z","snapshot_observed_at":"2026-08-19T03:06:29.083756Z","submitted_at":"2025-05-26T15:57:27Z","title":"HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20156","snapshot_observed_at":"2026-08-11T17:41:09.275832Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09427","last_updated":"2026-08-10T10:55:27Z","snapshot_observed_at":"2026-08-17T16:31:16.758807Z","submitted_at":"2026-08-10T10:55:27Z","title":"Foundation Models are Implicit Deepfake Detectors","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T17:41:09.275832Z"},"links":{"cited_paper":"/paper/2505.20156","citing_paper":"/paper/2608.09427"},"observation_digest":"sha256:351d619436539f17b1e0cf3c914f54a894d205590b9f3383f8de1b8e04c136e7","observation_id":"f59e2f68-2862-46a1-b819-776d994b7e5e","resolution":{"observed_at":"2026-08-11T17:41:09.275832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20156","last_updated":"2025-06-03T15:15:31Z","snapshot_observed_at":"2026-08-19T03:06:29.083756Z","submitted_at":"2025-05-26T15:57:27Z","title":"HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20156","snapshot_observed_at":"2026-08-16T00:21:12.302668Z","title":"Hunyuanvideo-avatar: High-fidelity audio-driven human animation for multiple characters.arXiv preprint arXiv:2505.20156, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.12107","last_updated":"2026-08-12T14:29:08Z","snapshot_observed_at":"2026-08-22T12:59:18.379935Z","submitted_at":"2026-08-12T14:29:08Z","title":"Avatar-Forever: Decoupled Parallel Training for High-Quality Real-Time Infinite Avatars","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-16T00:21:12.302668Z"},"links":{"cited_paper":"/paper/2505.20156","citing_paper":"/paper/2608.12107"},"observation_digest":"sha256:1213371d5ad3f6487a44b2924cc118c009245b1aa0efac4f835e86f42e39de92","observation_id":"08990fbb-5c71-46f1-bfd7-354b05afb300","resolution":{"observed_at":"2026-08-16T00:21:12.302668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.20156/citation-record","integrity":"/paper/2505.20156/integrity","json":"/paper/2505.20156/citation-record.json","paper":"/paper/2505.20156"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2408.02879","last_updated":"2024-08-06T01:13:09Z","snapshot_observed_at":"2026-08-17T19:38:39.943433Z","submitted_at":"2024-08-06T01:13:09Z","title":"Body of Her: A Preliminary Study on End-to-End Humanoid Agent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02879","snapshot_observed_at":"2026-08-07T14:02:26.629471Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20156","last_updated":"2025-06-03T15:15:31Z","snapshot_observed_at":"2026-08-19T03:06:29.083756Z","submitted_at":"2025-05-26T15:57:27Z","title":"HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:26.629471Z"},"links":{"cited_paper":"/paper/2408.02879","citing_paper":"/paper/2505.20156"},"observation_digest":"sha256:33a0757adf2f65a19f173fe9ff41435ad05d45b3cf802f39d624e5f6c9f437d9","observation_id":"588288d3-38ca-4fd1-9cb4-6d05b9331ed2","resolution":{"observed_at":"2026-08-07T14:02:26.629471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12945","last_updated":"2024-02-05T16:36:30Z","snapshot_observed_at":"2026-08-20T04:48:52.471048Z","submitted_at":"2024-01-23T18:05:25Z","title":"Lumiere: A Space-Time Diffusion Model for Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12945","snapshot_observed_at":"2026-08-07T14:02:26.692997Z","title":"Bar-Tal, H","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20156","last_updated":"2025-06-03T15:15:31Z","snapshot_observed_at":"2026-08-19T03:06:29.083756Z","submitted_at":"2025-05-26T15:57:27Z","title":"HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:26.692997Z"},"links":{"cited_paper":"/paper/2401.12945","citing_paper":"/paper/2505.20156"},"observation_digest":"sha256:f7852954a6b782c2c4ee256c616e550cd536a8dba66624841011f3293cdc8ae8","observation_id":"b6cfadab-7d82-42b5-b151-c18d0e345c4c","resolution":{"observed_at":"2026-08-07T14:02:26.692997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-20T09:39:07.545813Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-07T14:02:26.769430Z","title":"Blattmann, T","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20156","last_updated":"2025-06-03T15:15:31Z","snapshot_observed_at":"2026-08-19T03:06:29.083756Z","submitted_at":"2025-05-26T15:57:27Z","title":"HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:26.769430Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2505.20156"},"observation_digest":"sha256:3ecb0f2ca5e52be3e5156af0031577a962184f035eddad4f44514b22cf73ddcb","observation_id":"6286e85a-4e05-42b9-8c58-064be661215b","resolution":{"observed_at":"2026-08-07T14:02:26.769430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:26.852513Z","title":"Blattmann, R","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20156","last_updated":"2025-06-03T15:15:31Z","snapshot_observed_at":"2026-08-19T03:06:29.083756Z","submitted_at":"2025-05-26T15:57:27Z","title":"HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:26.852513Z"},"links":{"citing_paper":"/paper/2505.20156"},"observation_digest":"sha256:c2931cae9bd92c6e747a1c0be4e44cadfdfdcd07088509c1de1e68a28ea1e422","observation_id":"3b72457c-bd3a-4392-922a-6f768920a565","resolution":{"observed_at":"2026-08-07T14:02:26.852513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:26.939627Z","title":"Brooks, J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20156","last_updated":"2025-06-03T15:15:31Z","snapshot_observed_at":"2026-08-19T03:06:29.083756Z","submitted_at":"2025-05-26T15:57:27Z","title":"HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:26.939627Z"},"links":{"citing_paper":"/paper/2505.20156"},"observation_digest":"sha256:628fdd3c8b8896babae720853105e858f09c1893b304e05215e87e331874aaca","observation_id":"3de5cfbe-a35b-445d-ba88-47bc8fb13b2a","resolution":{"observed_at":"2026-08-07T14:02:26.939627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:32.269922Z","title":null,"venue":null,"work_id":"a0926d7f-dce7-427a-bb82-67583423a968","year":2016},"citing_paper":{"arxiv_id":"2505.20156","last_updated":"2025-06-03T15:15:31Z","snapshot_observed_at":"2026-08-19T03:06:29.083756Z","submitted_at":"2025-05-26T15:57:27Z","title":"HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:27.034169Z"},"links":{"citing_paper":"/paper/2505.20156"},"observation_digest":"sha256:dfa67a608b069f8654f17617e81225fd9d6ec3e910bcc04e0ee22a72991f5f99","observation_id":"8af66ef0-013a-47a4-8c0d-b09356ec883e","resolution":{"observed_at":"2026-08-07T14:02:32.378131Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00733","last_updated":"2025-03-13T08:23:27Z","snapshot_observed_at":"2026-08-18T10:30:20.725493Z","submitted_at":"2024-12-01T08:54:30Z","title":"Hallo3: Highly Dynamic and Realistic Portrait Image Animation with Video Diffusion Transformer","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00733","snapshot_observed_at":"2026-08-07T14:02:27.124310Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20156","last_updated":"2025-06-03T15:15:31Z","snapshot_observed_at":"2026-08-19T03:06:29.083756Z","submitted_at":"2025-05-26T15:57:27Z","title":"HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:27.124310Z"},"links":{"cited_paper":"/paper/2412.00733","citing_paper":"/paper/2505.20156"},"observation_digest":"sha256:ba36dd9c27b1a90d48b6bd2d592be1131c93f399a2d2f20bb07041c1dd555107","observation_id":"ed5ff8a9-c3c7-4bfe-9597-dfb59813d059","resolution":{"observed_at":"2026-08-07T14:02:27.124310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:27.208294Z","title":"Esser, S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20156","last_updated":"2025-06-03T15:15:31Z","snapshot_observed_at":"2026-08-19T03:06:29.083756Z","submitted_at":"2025-05-26T15:57:27Z","title":"HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:27.208294Z"},"links":{"citing_paper":"/paper/2505.20156"},"observation_digest":"sha256:9ad22fceca9f98873fb388ea989867f3987625e3228b324b73a205521b529280","observation_id":"52116a24-61ed-4d4a-a8a7-a3f2d6c644b5","resolution":{"observed_at":"2026-08-07T14:02:27.208294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04725","last_updated":"2024-02-08T18:08:57Z","snapshot_observed_at":"2026-08-17T14:04:31.230742Z","submitted_at":"2023-07-10T17:34:16Z","title":"AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04725","snapshot_observed_at":"2026-08-07T14:02:27.315202Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20156","last_updated":"2025-06-03T15:15:31Z","snapshot_observed_at":"2026-08-19T03:06:29.083756Z","submitted_at":"2025-05-26T15:57:27Z","title":"HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:27.315202Z"},"links":{"cited_paper":"/paper/2307.04725","citing_paper":"/paper/2505.20156"},"observation_digest":"sha256:2eec5f8b5faaf295d6f28c36072badf6a877e58604ecedc98452a44fc966e296","observation_id":"eb2cd1cd-5658-4ae3-809a-a0bc76c14fcd","resolution":{"observed_at":"2026-08-07T14:02:27.315202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06662","last_updated":"2023-12-11T18:59:57Z","snapshot_observed_at":"2026-08-21T01:21:02.724804Z","submitted_at":"2023-12-11T18:59:57Z","title":"Photorealistic Video Generation with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06662","snapshot_observed_at":"2026-08-07T14:02:27.393281Z","title":"Gupta, L","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20156","last_updated":"2025-06-03T15:15:31Z","snapshot_observed_at":"2026-08-19T03:06:29.083756Z","submitted_at":"2025-05-26T15:57:27Z","title":"HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:27.393281Z"},"links":{"cited_paper":"/paper/2312.06662","citing_paper":"/paper/2505.20156"},"observation_digest":"sha256:b027c3d587bc80f0d1a14f066d1b7027291baf690f46e0d0cbd5d59d8d69ef0a","observation_id":"b77c0f73-d6df-4241-b1fe-047f7242ff90","resolution":{"observed_at":"2026-08-07T14:02:27.393281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:27.485775Z","title":"Heusel, H","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.20156","last_updated":"2025-06-03T15:15:31Z","snapshot_observed_at":"2026-08-19T03:06:29.083756Z","submitted_at":"2025-05-26T15:57:27Z","title":"HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:27.485775Z"},"links":{"citing_paper":"/paper/2505.20156"},"observation_digest":"sha256:32462fce650220ecd2447b3fd2ed6ba7e1cb456126ae92f4ad46fad897a1d799","observation_id":"09089bcf-4189-4c28-9786-1c0df99829b8","resolution":{"observed_at":"2026-08-07T14:02:27.485775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:32.153282Z","title":null,"venue":null,"work_id":"6c9f5593-83e2-412f-8682-053917ed3dd3","year":2022},"citing_paper":{"arxiv_id":"2505.20156","last_updated":"2025-06-03T15:15:31Z","snapshot_observed_at":"2026-08-19T03:06:29.083756Z","submitted_at":"2025-05-26T15:57:27Z","title":"HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:27.558464Z"},"links":{"citing_paper":"/paper/2505.20156"},"observation_digest":"sha256:42f3dd5492dff16ceff4c78dd2ba6975a87bcffede87385fa8006a349fed4f3c","observation_id":"a6cadf59-6741-4182-8f17-a123d1f33aef","resolution":{"observed_at":"2026-08-07T14:02:32.218678Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:31.987528Z","title":"Hogue, C","venue":null,"work_id":"886bc33f-5a2c-44d2-a931-ae67fd886d53","year":1922},"citing_paper":{"arxiv_id":"2505.20156","last_updated":"2025-06-03T15:15:31Z","snapshot_observed_at":"2026-08-19T03:06:29.083756Z","submitted_at":"2025-05-26T15:57:27Z","title":"HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:27.649201Z"},"links":{"citing_paper":"/paper/2505.20156"},"observation_digest":"sha256:e5bbc3115e129ae60c07820a8d811422b1af071490f7c63b88e2ee5772c26664","observation_id":"28e4319b-20ee-4744-886a-73ac8278426f","resolution":{"observed_at":"2026-08-07T14:02:32.063655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:27.757517Z","title":"Huang, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20156","last_updated":"2025-06-03T15:15:31Z","snapshot_observed_at":"2026-08-19T03:06:29.083756Z","submitted_at":"2025-05-26T15:57:27Z","title":"HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:27.757517Z"},"links":{"citing_paper":"/paper/2505.20156"},"observation_digest":"sha256:685572aeb408da5c5ca810db2af1a4458956f06f8e2eec76d8761d0cb05661fb","observation_id":"cab230a6-a858-44a9-905d-0067eb4dfcfd","resolution":{"observed_at":"2026-08-07T14:02:27.757517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16331","last_updated":"2025-06-05T11:49:59Z","snapshot_observed_at":"2026-08-14T22:06:30.252612Z","submitted_at":"2024-11-25T12:24:52Z","title":"Sonic: Shifting Focus to Global Audio Perception in Portrait Animation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.16331","snapshot_observed_at":"2026-08-07T14:02:27.838081Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20156","last_updated":"2025-06-03T15:15:31Z","snapshot_observed_at":"2026-08-19T03:06:29.083756Z","submitted_at":"2025-05-26T15:57:27Z","title":"HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:27.838081Z"},"links":{"cited_paper":"/paper/2411.16331","citing_paper":"/paper/2505.20156"},"observation_digest":"sha256:36936b32c2ed8ef5048711ad85e33fad834c03202b27ecd1a2f73369fc225520","observation_id":"8d5fd413-4126-48a8-b2b7-899499011224","resolution":{"observed_at":"2026-08-07T14:02:27.838081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02634","last_updated":"2025-04-04T05:13:40Z","snapshot_observed_at":"2026-08-17T16:32:16.739621Z","submitted_at":"2024-09-04T11:55:14Z","title":"Loopy: Taming Audio-Driven Portrait Avatar with Long-Term Motion Dependency","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02634","snapshot_observed_at":"2026-08-07T14:02:27.924996Z","title":"Jiang, C","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20156","last_updated":"2025-06-03T15:15:31Z","snapshot_observed_at":"2026-08-19T03:06:29.083756Z","submitted_at":"2025-05-26T15:57:27Z","title":"HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:27.924996Z"},"links":{"cited_paper":"/paper/2409.02634","citing_paper":"/paper/2505.20156"},"observation_digest":"sha256:7959d1fd7beaf12f81dcd0286957db146762d2edc3b528801cf9644152e8acaa","observation_id":"75e72959-7ebf-4db8-90cb-21aa6a743f7f","resolution":{"observed_at":"2026-08-07T14:02:27.924996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-17T07:44:10.213698Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-07T14:02:27.998790Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20156","last_updated":"2025-06-03T15:15:31Z","snapshot_observed_at":"2026-08-19T03:06:29.083756Z","submitted_at":"2025-05-26T15:57:27Z","title":"HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:27.998790Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2505.20156"},"observation_digest":"sha256:8d2c4a0ddfa3b806c79c08e161c286bd6382a60a730c654a468dc88164589e75","observation_id":"c58d42b3-0bdb-4247-b80f-6bf45c7ff7d9","resolution":{"observed_at":"2026-08-07T14:02:27.998790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09262","last_updated":"2025-03-13T09:17:52Z","snapshot_observed_at":"2026-08-16T20:23:00.161927Z","submitted_at":"2024-12-12T13:20:52Z","title":"LatentSync: Taming Audio-Conditioned Latent Diffusion Models for Lip Sync with SyncNet Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09262","snapshot_observed_at":"2026-08-07T14:02:28.063276Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20156","last_updated":"2025-06-03T15:15:31Z","snapshot_observed_at":"2026-08-19T03:06:29.083756Z","submitted_at":"2025-05-26T15:57:27Z","title":"HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:28.063276Z"},"links":{"cited_paper":"/paper/2412.09262","citing_paper":"/paper/2505.20156"},"observation_digest":"sha256:baeb877a254b359e544698579b5971fada8bc01a1a64cd63e8c62be3d4ac6002","observation_id":"3dc06998-993a-4eb3-a842-9d38f9c56de3","resolution":{"observed_at":"2026-08-07T14:02:28.063276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:28.169736Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.20156","last_updated":"2025-06-03T15:15:31Z","snapshot_observed_at":"2026-08-19T03:06:29.083756Z","submitted_at":"2025-05-26T15:57:27Z","title":"HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:28.169736Z"},"links":{"citing_paper":"/paper/2505.20156"},"observation_digest":"sha256:3b3f5d277073164be7651fd840bc8d244a3b43d54476996ab57fb7dbc813888f","observation_id":"73ff64f8-1f63-41f8-8e3d-d2fa1a80bbf2","resolution":{"observed_at":"2026-08-07T14:02:28.169736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01876","last_updated":"2025-04-05T05:31:38Z","snapshot_observed_at":"2026-08-19T21:16:46.905576Z","submitted_at":"2024-09-03T13:19:31Z","title":"CyberHost: Taming Audio-driven Avatar Diffusion Model with Region Codebook Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.01876","snapshot_observed_at":"2026-08-07T14:02:28.276147Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20156","last_updated":"2025-06-03T15:15:31Z","snapshot_observed_at":"2026-08-19T03:06:29.083756Z","submitted_at":"2025-05-26T15:57:27Z","title":"HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:28.276147Z"},"links":{"cited_paper":"/paper/2409.01876","citing_paper":"/paper/2505.20156"},"observation_digest":"sha256:6660ae6d14ef430804e863cb6a74203e4437c585bfc67caac737d79360a4236a","observation_id":"e7535f10-8dfe-4ede-9af2-d9dcacc654a6","resolution":{"observed_at":"2026-08-07T14:02:28.276147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01061","last_updated":"2025-06-30T08:26:56Z","snapshot_observed_at":"2026-08-20T06:05:18.569195Z","submitted_at":"2025-02-03T05:17:32Z","title":"OmniHuman-1: Rethinking the Scaling-Up of One-Stage Conditioned Human Animation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01061","snapshot_observed_at":"2026-08-07T14:02:28.347532Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20156","last_updated":"2025-06-03T15:15:31Z","snapshot_observed_at":"2026-08-19T03:06:29.083756Z","submitted_at":"2025-05-26T15:57:27Z","title":"HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:28.347532Z"},"links":{"cited_paper":"/paper/2502.01061","citing_paper":"/paper/2505.20156"},"observation_digest":"sha256:4d128b228db15941dc2a5c8e3618a131ec409b1857e709b4898769502186d4e7","observation_id":"5693d6cf-d8f2-45e0-96a7-7bf224c2da88","resolution":{"observed_at":"2026-08-07T14:02:28.347532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:28.454820Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20156","last_updated":"2025-06-03T15:15:31Z","snapshot_observed_at":"2026-08-19T03:06:29.083756Z","submitted_at":"2025-05-26T15:57:27Z","title":"HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:28.454820Z"},"links":{"citing_paper":"/paper/2505.20156"},"observation_digest":"sha256:abd7a7894b6f6d9997c653dc130c52f09dd7a70badc0f43ff7fd7fd03baa7ac6","observation_id":"9ea3e67c-bddb-4b7c-bd6d-aaa1480bdf70","resolution":{"observed_at":"2026-08-07T14:02:28.454820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-16T02:30:42.660030Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-07T14:02:28.536605Z","title":"Lipman, R","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20156","last_updated":"2025-06-03T15:15:31Z","snapshot_observed_at":"2026-08-19T03:06:29.083756Z","submitted_at":"2025-05-26T15:57:27Z","title":"HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:28.536605Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2505.20156"},"observation_digest":"sha256:b2c75d82a1dd3918071e4dd8a6f15846abc8a55f0ec1f924b8c88d9e8b20f4dc","observation_id":"00f4672b-2bf2-42dc-a219-f1e0be9861d7","resolution":{"observed_at":"2026-08-07T14:02:28.536605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:28.618503Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20156","last_updated":"2025-06-03T15:15:31Z","snapshot_observed_at":"2026-08-19T03:06:29.083756Z","submitted_at":"2025-05-26T15:57:27Z","title":"HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:28.618503Z"},"links":{"citing_paper":"/paper/2505.20156"},"observation_digest":"sha256:600c44cc21b03ae1b7e97fa8d77c2962d768620dd5e0fcb60707dbbec2160a53","observation_id":"f0d9104a-09bb-43ca-96a8-419218a2bb81","resolution":{"observed_at":"2026-08-07T14:02:28.618503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:31.810347Z","title":"Radford, J","venue":null,"work_id":"8efeac9e-15ad-42d6-a2b9-ee7a37f20c4c","year":2023},"citing_paper":{"arxiv_id":"2505.20156","last_updated":"2025-06-03T15:15:31Z","snapshot_observed_at":"2026-08-19T03:06:29.083756Z","submitted_at":"2025-05-26T15:57:27Z","title":"HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:28.712294Z"},"links":{"citing_paper":"/paper/2505.20156"},"observation_digest":"sha256:e28a5ffd5702d9366bb2e7cc94989d42f125994f0d1a8524ab1d22adc316e51b","observation_id":"e229cb43-5360-4b04-ab56-fc688c2234fa","resolution":{"observed_at":"2026-08-07T14:02:31.907480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:31.673577Z","title":null,"venue":null,"work_id":"8ef6db8e-5515-4f8d-90e9-46c739862b22","year":2023},"citing_paper":{"arxiv_id":"2505.20156","last_updated":"2025-06-03T15:15:31Z","snapshot_observed_at":"2026-08-19T03:06:29.083756Z","submitted_at":"2025-05-26T15:57:27Z","title":"HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:28.794453Z"},"links":{"citing_paper":"/paper/2505.20156"},"observation_digest":"sha256:65131c6b8a6fa6ad5645911d39725f66812155691cedee2bce4bc87b36952e5b","observation_id":"efc2c1e2-cc3e-4aae-80fc-46a7f7f914b0","resolution":{"observed_at":"2026-08-07T14:02:31.734865Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14792","last_updated":"2022-09-29T13:59:46Z","snapshot_observed_at":"2026-07-06T13:57:47.051387Z","submitted_at":"2022-09-29T13:59:46Z","title":"Make-A-Video: Text-to-Video Generation without Text-Video Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14792","snapshot_observed_at":"2026-08-07T14:02:28.903520Z","title":"Singer, A","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20156","last_updated":"2025-06-03T15:15:31Z","snapshot_observed_at":"2026-08-19T03:06:29.083756Z","submitted_at":"2025-05-26T15:57:27Z","title":"HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:28.903520Z"},"links":{"cited_paper":"/paper/2209.14792","citing_paper":"/paper/2505.20156"},"observation_digest":"sha256:c7f59d98c2e2934601ad64a685ae1aa0178014168b7e97c4c85455ed1089ed76","observation_id":"77c53fce-1cf1-4c31-a5fa-7b30f13d5543","resolution":{"observed_at":"2026-08-07T14:02:28.903520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:28.983264Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20156","last_updated":"2025-06-03T15:15:31Z","snapshot_observed_at":"2026-08-19T03:06:29.083756Z","submitted_at":"2025-05-26T15:57:27Z","title":"HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:28.983264Z"},"links":{"citing_paper":"/paper/2505.20156"},"observation_digest":"sha256:2220a94002c542f596cffadced2ded39f80a8b80bd6233050d28f73bcae9041b","observation_id":"9d4b4b41-c505-4e2a-8ab3-ba265963146c","resolution":{"observed_at":"2026-08-07T14:02:28.983264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15098","last_updated":"2025-07-07T17:33:23Z","snapshot_observed_at":"2026-08-12T17:19:10.028618Z","submitted_at":"2024-11-22T17:55:15Z","title":"OminiControl: Minimal and Universal Control for Diffusion Transformer","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15098","snapshot_observed_at":"2026-08-07T14:02:29.076310Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20156","last_updated":"2025-06-03T15:15:31Z","snapshot_observed_at":"2026-08-19T03:06:29.083756Z","submitted_at":"2025-05-26T15:57:27Z","title":"HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:29.076310Z"},"links":{"cited_paper":"/paper/2411.15098","citing_paper":"/paper/2505.20156"},"observation_digest":"sha256:904141c84d5a77e0f4aacb1d23a6c297f26f47aa4d691c81e53643868e5a1749","observation_id":"3e9ae884-1849-4e20-908b-ebf2eb80769b","resolution":{"observed_at":"2026-08-07T14:02:29.076310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:31.529437Z","title":"Unterthiner, S","venue":null,"work_id":"b36f8822-76b5-410f-880f-3663c51633a4","year":null},"citing_paper":{"arxiv_id":"2505.20156","last_updated":"2025-06-03T15:15:31Z","snapshot_observed_at":"2026-08-19T03:06:29.083756Z","submitted_at":"2025-05-26T15:57:27Z","title":"HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:29.161941Z"},"links":{"citing_paper":"/paper/2505.20156"},"observation_digest":"sha256:bb35d1a75d75e878efe33206faaf1d86fb7d3cbaee8c9e48c9314c58f6521f06","observation_id":"2e5e23a9-7cc2-41a1-8fa0-39c5b24cb736","resolution":{"observed_at":"2026-08-07T14:02:31.589649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:29.248644Z","title":"Villegas, M","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20156","last_updated":"2025-06-03T15:15:31Z","snapshot_observed_at":"2026-08-19T03:06:29.083756Z","submitted_at":"2025-05-26T15:57:27Z","title":"HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:29.248644Z"},"links":{"citing_paper":"/paper/2505.20156"},"observation_digest":"sha256:f98c84e73f7bc72a2ca65a7307dc65bc754a72850a2ad945342e6e4690ff55e3","observation_id":"4aa870e9-0003-4f2a-a7c5-f004ed7116f8","resolution":{"observed_at":"2026-08-07T14:02:29.248644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-08-12T22:34:51.361078Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-07T14:02:29.329734Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20156","last_updated":"2025-06-03T15:15:31Z","snapshot_observed_at":"2026-08-19T03:06:29.083756Z","submitted_at":"2025-05-26T15:57:27Z","title":"HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:29.329734Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2505.20156"},"observation_digest":"sha256:cb3100f557deb6f9ce9ff4b28c5b80093505c8843c4c3a093671899e98b26f1d","observation_id":"02778bfb-b2fb-44a1-828c-6c2bef5cc689","resolution":{"observed_at":"2026-08-07T14:02:29.329734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02511","last_updated":"2024-06-04T17:32:52Z","snapshot_observed_at":"2026-08-19T07:28:01.288662Z","submitted_at":"2024-06-04T17:32:52Z","title":"V-Express: Conditional Dropout for Progressive Training of Portrait Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02511","snapshot_observed_at":"2026-08-07T14:02:29.417057Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20156","last_updated":"2025-06-03T15:15:31Z","snapshot_observed_at":"2026-08-19T03:06:29.083756Z","submitted_at":"2025-05-26T15:57:27Z","title":"HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:29.417057Z"},"links":{"cited_paper":"/paper/2406.02511","citing_paper":"/paper/2505.20156"},"observation_digest":"sha256:3dfe2f62aac1f8b534f5254ad446e3a572791e554603300b8733e5f888fd2e04","observation_id":"b23639c4-e012-4a26-938e-9e2c4ca63775","resolution":{"observed_at":"2026-08-07T14:02:29.417057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06571","last_updated":"2023-08-12T13:53:10Z","snapshot_observed_at":"2026-08-14T13:59:50.878772Z","submitted_at":"2023-08-12T13:53:10Z","title":"ModelScope Text-to-Video Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06571","snapshot_observed_at":"2026-08-07T14:02:29.525633Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20156","last_updated":"2025-06-03T15:15:31Z","snapshot_observed_at":"2026-08-19T03:06:29.083756Z","submitted_at":"2025-05-26T15:57:27Z","title":"HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:29.525633Z"},"links":{"cited_paper":"/paper/2308.06571","citing_paper":"/paper/2505.20156"},"observation_digest":"sha256:82b0a2b49af00b79e32cca5f7337c4f2e9a1143857fe51d3d6e2f0289acbb07c","observation_id":"abd11fd9-bd30-4c68-978f-86c3d5eafdac","resolution":{"observed_at":"2026-08-07T14:02:29.525633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.04842","last_updated":"2025-04-07T08:56:01Z","snapshot_observed_at":"2026-08-16T12:43:28.043771Z","submitted_at":"2025-04-07T08:56:01Z","title":"FantasyTalking: Realistic Talking Portrait Generation via Coherent Motion Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.04842","snapshot_observed_at":"2026-08-07T14:02:29.621663Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20156","last_updated":"2025-06-03T15:15:31Z","snapshot_observed_at":"2026-08-19T03:06:29.083756Z","submitted_at":"2025-05-26T15:57:27Z","title":"HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:29.621663Z"},"links":{"cited_paper":"/paper/2504.04842","citing_paper":"/paper/2505.20156"},"observation_digest":"sha256:0a36bae1db0888b29fe56aca6e0a98966ea33d3782dd8b884ca0ccd5965236cc","observation_id":"23562447-b0cf-4b97-8e8b-76addc290927","resolution":{"observed_at":"2026-08-07T14:02:29.621663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08260","last_updated":"2025-04-26T17:58:24Z","snapshot_observed_at":"2026-08-20T11:29:59.473513Z","submitted_at":"2024-10-10T17:57:49Z","title":"Koala-36M: A Large-scale Video Dataset Improving Consistency between Fine-grained Conditions and Video Content","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08260","snapshot_observed_at":"2026-08-07T14:02:29.718723Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20156","last_updated":"2025-06-03T15:15:31Z","snapshot_observed_at":"2026-08-19T03:06:29.083756Z","submitted_at":"2025-05-26T15:57:27Z","title":"HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:29.718723Z"},"links":{"cited_paper":"/paper/2410.08260","citing_paper":"/paper/2505.20156"},"observation_digest":"sha256:f864ac4a8e4f8d0beb2ad127417e94937c51d7465e87fc9d17d77abc559e607c","observation_id":"27e88653-d264-4b8e-b612-726e40321e3a","resolution":{"observed_at":"2026-08-07T14:02:29.718723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:29.798615Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.20156","last_updated":"2025-06-03T15:15:31Z","snapshot_observed_at":"2026-08-19T03:06:29.083756Z","submitted_at":"2025-05-26T15:57:27Z","title":"HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:29.798615Z"},"links":{"citing_paper":"/paper/2505.20156"},"observation_digest":"sha256:1c370779c3f37d55c53c02dba0354df3cdf0a70de01e4efeb5b67a91836469ac","observation_id":"a26cb2eb-a6fe-430e-b3dc-578da54c9208","resolution":{"observed_at":"2026-08-07T14:02:29.798615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.17090","last_updated":"2023-12-28T16:10:25Z","snapshot_observed_at":"2026-08-02T07:14:02.308302Z","submitted_at":"2023-12-28T16:10:25Z","title":"Q-Align: Teaching LMMs for Visual Scoring via Discrete Text-Defined Levels","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.17090","snapshot_observed_at":"2026-08-07T14:02:29.947862Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20156","last_updated":"2025-06-03T15:15:31Z","snapshot_observed_at":"2026-08-19T03:06:29.083756Z","submitted_at":"2025-05-26T15:57:27Z","title":"HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:29.947862Z"},"links":{"cited_paper":"/paper/2312.17090","citing_paper":"/paper/2505.20156"},"observation_digest":"sha256:2df682d06df697b111894d612dcdb656864532e60731e29a7c1dafb5b55339c5","observation_id":"9566cd20-ce5f-4161-8dfa-e9982b076577","resolution":{"observed_at":"2026-08-07T14:02:29.947862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08801","last_updated":"2024-06-16T07:10:41Z","snapshot_observed_at":"2026-08-18T10:23:27.377504Z","submitted_at":"2024-06-13T04:33:20Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08801","snapshot_observed_at":"2026-08-07T14:02:30.045227Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20156","last_updated":"2025-06-03T15:15:31Z","snapshot_observed_at":"2026-08-19T03:06:29.083756Z","submitted_at":"2025-05-26T15:57:27Z","title":"HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:30.045227Z"},"links":{"cited_paper":"/paper/2406.08801","citing_paper":"/paper/2505.20156"},"observation_digest":"sha256:f403f9ee37dca1609b0da6c2db8ba3ff234866086cf80dd4fc9f08721309d64b","observation_id":"0bc3d107-8172-44b4-a7e9-6efaf9a46f08","resolution":{"observed_at":"2026-08-07T14:02:30.045227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:31.367209Z","title":"Zhang, X","venue":null,"work_id":"82043d64-5d9e-4d51-9e36-68035c52f3ba","year":2023},"citing_paper":{"arxiv_id":"2505.20156","last_updated":"2025-06-03T15:15:31Z","snapshot_observed_at":"2026-08-19T03:06:29.083756Z","submitted_at":"2025-05-26T15:57:27Z","title":"HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:30.138964Z"},"links":{"citing_paper":"/paper/2505.20156"},"observation_digest":"sha256:fd3da3070618e0fda2ed6b3ac9b1cde2e8152063356a493efdfbb401ba7300ea","observation_id":"5f3d60eb-7299-4daa-b8d4-5cc7dcb8d36f","resolution":{"observed_at":"2026-08-07T14:02:31.428928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:31.194735Z","title":"Zhang, L","venue":null,"work_id":"4bf26b2e-52ac-4ded-b4c2-a5ad70ed4a7c","year":2021},"citing_paper":{"arxiv_id":"2505.20156","last_updated":"2025-06-03T15:15:31Z","snapshot_observed_at":"2026-08-19T03:06:29.083756Z","submitted_at":"2025-05-26T15:57:27Z","title":"HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:30.232211Z"},"links":{"citing_paper":"/paper/2505.20156"},"observation_digest":"sha256:52e2bea7cb04cc0d21d7c049d6a875b7839885ff9d442dac35042fc0794d21e4","observation_id":"a169bb99-bf0f-45df-846d-0df64eec789f","resolution":{"observed_at":"2026-08-07T14:02:31.278250Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.11018","last_updated":"2023-05-11T11:23:03Z","snapshot_observed_at":"2026-08-16T05:49:16.026825Z","submitted_at":"2022-11-20T16:40:31Z","title":"MagicVideo: Efficient Video Generation With Latent Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.11018","snapshot_observed_at":"2026-08-07T14:02:30.356365Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20156","last_updated":"2025-06-03T15:15:31Z","snapshot_observed_at":"2026-08-19T03:06:29.083756Z","submitted_at":"2025-05-26T15:57:27Z","title":"HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:30.356365Z"},"links":{"cited_paper":"/paper/2211.11018","citing_paper":"/paper/2505.20156"},"observation_digest":"sha256:432c915e490bcd64a6c3d594c9f3158d46ae79bc528acf427381d5bf11db6782","observation_id":"86386a17-2dac-4eb0-bcff-7dc885138102","resolution":{"observed_at":"2026-08-07T14:02:30.356365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15458","last_updated":"2024-10-20T17:51:35Z","snapshot_observed_at":"2026-08-21T21:24:01.429930Z","submitted_at":"2024-10-20T17:51:35Z","title":"Allegro: Open the Black Box of Commercial-Level Video Generation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.15458","snapshot_observed_at":"2026-08-07T14:02:30.456640Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20156","last_updated":"2025-06-03T15:15:31Z","snapshot_observed_at":"2026-08-19T03:06:29.083756Z","submitted_at":"2025-05-26T15:57:27Z","title":"HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:30.456640Z"},"links":{"cited_paper":"/paper/2410.15458","citing_paper":"/paper/2505.20156"},"observation_digest":"sha256:9db5fdee0e358bea6eb7fc0e6a7004cb350d40383831b4f8e6d3c24ac28d5443","observation_id":"674d369a-5816-41c1-9ae9-3c02adad90f1","resolution":{"observed_at":"2026-08-07T14:02:30.456640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:30.985971Z","title":null,"venue":null,"work_id":"b69f834f-2afc-45e8-a9b0-caa6e3ffe9dc","year":2022},"citing_paper":{"arxiv_id":"2505.20156","last_updated":"2025-06-03T15:15:31Z","snapshot_observed_at":"2026-08-19T03:06:29.083756Z","submitted_at":"2025-05-26T15:57:27Z","title":"HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:30.549667Z"},"links":{"citing_paper":"/paper/2505.20156"},"observation_digest":"sha256:4aa02b5da51bc9cab38c655649a7d95b62bc6bc590e3cf34faaa0f3e2f20695f","observation_id":"bf5a2aee-6659-466c-b602-cb8ba9d90e6d","resolution":{"observed_at":"2026-08-07T14:02:31.116744Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.20156","last_updated":"2025-06-03T15:15:31Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-19T03:06:29.083756Z","submitted_at":"2025-05-26T15:57:27Z","title":"HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":39,"verified_exact":0,"verified_fuzzy":5},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 35 inbound Pith citation observations for arXiv:2505.20156."}